首页 > 业界 > 关键词  > 人形机器人最新资讯  > 正文

AI日报:Captions推出AI视频API套件;国产人形机器人成养老新希望;百度已有18%搜索结果由AI生成

2024-08-23 15:34 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、Captions公司发布AI视频生成和编辑API工具

Captions公司最近推出了一套革命性的AI视频生成和编辑API工具,为社交媒体和营销活动注入新活力,为开发者和内容创作者提供前所未有的视频制作方式。这一创新举措将视频创作推向新高度。

image.png

【AiBase提要:】

🌟 创新API工具包括AI Creator、AI Twin、AI Edit和AI Translate,构建全面视频创作生态系统。

🔥 AI Creator可编程生成对话视频,适用于UGC风格视频广告和有机视频项目。

💡 AI Translate即时翻译视频至29种以上语言,口型同步让翻译更自然流畅。

详情链接:https://help.captions.ai/api-reference/api

2、国产人形机器人崛起!领航者2号NAVIAI演讲、泡茶,下棋样样精通

在2024年世界机器人大会上,浙江人形机器人创新中心推出的领航者2号NAVIAI引起轰动,展示出卓越性能和高度拟人化设计,满足人们对服务陪伴的情感需求。该机器人具备高达275Tops的AI算力,展示了快速学习和高精度作业能力,具备广泛的应用潜力。领航者2号的成功标志着国产人形机器人技术的领先地位,为未来产业发展指明新方向。

image.png

【AiBase提要:】

🌟 领航者2号NAVIAI具备41个自由度,拥有拟人化动作映射执行能力,能够完成各种复杂动作,展现出极高的适应性和流畅性。

🤖 领航者2号NAVIAI拥有高达275Tops的AI算力,每秒能进行275万亿次运算,快速响应和处理各种复杂任务,展示出快速学习和高精度作业能力。

🚀 领航者2号NAVIAI具备类人具身智能导航技术,在开放和复杂场景中展示出鲁棒的语义交互和精准的物体抓取能力,具有广泛的应用潜力。

3、视频美颜大师!模糊人脸秒变高清!KEEP技术让你告别像素脸

KEEP技术是科技界的新宠儿,为那些珍贵视频中的模糊人脸提供了解决方案。通过创新的特征传播框架,KEEP技术能让视频人脸清晰度飙升,每一个表情都栩栩如生。它像超级眼镜一样装在你的视频上,让每一个细节无所遁形。

【AiBase提要:】

🔍 KEEP技术通过卡尔曼滤波原理保持稳定的面部先验信息,恢复视频帧间的面部细节一致性表现出色。

🕵️‍♂️ KEEP技术像超级聪明的侦探,从之前的视频帧中搜集线索,推理出当前帧的最佳面貌。

📈 实验结果显示,KEEP方法能有效恢复人脸细节,避免模糊和失真问题,让视频画质达到前所未有的高度。

详情链接:https://top.aibase.com/tool/keep

4、快手可灵AI推出会员首购优惠活动

快手可灵AI推出会员首购优惠活动,为用户提供连续包月和连续包季黄金会员优惠,同时升级了可灵AI大模型和推出了更高画质版本。7月6日,可灵AI网页端正式上线,提供限时免费服务,集成了文生图、文生视频的相关能力。

image.png

【AiBase提要:】

🌟 连续包月黄金会员首购仅需19元,后续续费58元,支持随时取消。

🔑 连续包季黄金会员首购仅需99元,下季度续费152元,支持随时取消。

💡 可灵AI大模型支持生成高清1080p视频,新增首尾帧控制、镜头控制等编辑功能,单次生成文生视频时长增加至10秒。

5、Meshy发布新款 AI 3D 建模工具Meshy-4:AI生成高质量 3D 模型

Meshy发布了最新的AI驱动3D建模工具Meshy-4,标志着虚拟环境创作的重大进步。经过16个月的开发,Meshy的联合创始人余明表示,他们对于这一成就感到非常自豪。Meshy-4在模型几何和工作流程上都进行了重大改进,旨在提升设计师和开发者的创作效率。

image.png

【AiBase提要:】

🌟 AI生成的3D模型更清晰更专业

💡 新增的“重试”功能解决了AI生成内容的多变性问题

🎮 Meshy-4的进步将对游戏开发和建筑可视化等行业产生重要影响

详情链接:https://top.aibase.com/tool/meshy

6、Google AI Studio 推出全新提示词库 可测试长篇文本上下文、原生多模态等

Google AI Studio最新发布的提示词库引起了广泛关注,为用户提供了丰富多元的体验。这个新的提示库就像是一个全新的导游,带领用户探索更生动多样化的内容,让人仿佛置身于充满惊喜和创新的世界中。用户可以在其中体验更直观全面的信息展示方式,极大地丰富了用户的选择。

【AiBase提要:】

🌟 提示词库集合了多种实用功能,涵盖教育、编程、旅行建议等多个领域,为用户提供更丰富的选择。

🔍 新功能亮点包括配方生成器、数学导师、寻宝游戏设计等,满足不同用户需求。

😊 用户只需登录 Google AI Studio,选择适合的提示词并输入需求,即可获得所需内容,极大地便利了用户的日常工作。

详情链接:https://aistudio.google.com/app/gallery

7、李彦宏:百度已有18%搜索结果由AI生成 未来两三年AI竞争激烈

百度2024年第二季度财报显示公司总营收持平,净利润达74亿元。董事长李彦宏强调人工智能领域竞争激烈,百度凭借文心大模型等优势保持领先。智能云业务增长14%,搜索业务升级改造加速,18%搜索结果由AI生成。Apollo Go自动驾驶服务成全球最大

【AiBase提要:】

📊 百度2024年第二季度财报显示总营收339亿元人民币,净利润74亿元,智能云业务增长14%。

🤖 百度在人工智能领域投资十几年,文心大模型日均调用量超过6亿次,搜索业务18%结果由AI生成。

🔮 百度未来面临激烈AI竞争,计划转向轻资产模式,Apollo Go自动驾驶服务成全球最大

8、陈睿:每月有超 8000 万用户在B站浏览与AI相关的内容

B站2024年第二季度财报显示总净营收达61.27亿元人民币,同比增长16%,净亏损6.08亿元,同比大幅收窄61%。在财报电话会议中,B站董事长兼CEO陈睿等高管对财报要点进行了解读,重点关注广告业务增长和人工智能应用。

【AiBase提要:】

📈 广告业务增长: 广告业务同比增长30%,单季度收入首次突破20亿元,占总收入三分之一。

🤖 人工智能应用: B站以高质量和丰富的人工智能内容著称,每月有超过8000万用户浏览相关内容。

💡 AI技术创作: AI技术极大提高创作者效率和发布频率,普通用户也能通过AI技术成为创作者。

9、人形机器人Adam 在沃尔玛首次上岗:一天能提供200杯茶和咖啡

在美国伊利诺伊州洛克福德的沃尔玛,一款名为Adam的人形AI机器人正式投入使用,为顾客提供高达200杯饮品,标志着AlphaMax Management公司的正式启动。这一创新模式有望带来新的收入流和稳定的现金流,为饮品行业注入新活力。

image.png

【AiBase提要:】

☕️ Adam机器人在伊利诺伊州的沃尔玛提供智能对话和饮品制作服务。

🤖 每天可为顾客提供高达200杯各类饮品,方便快捷。

🏪 AlphaMax Management期待通过这一创新模式实现新的收入流和稳定的现金流。

10、热门绘画应用Procreate拒绝生成式AI CEO:艺术的人性不能被剥夺

Procreate最近宣布拒绝引入生成式AI技术,CEO詹姆斯・库达坚定表示生成式AI剥夺了创作的人性,引发广泛关注。公司将继续致力于为艺术家提供更好的创作工具,坚守艺术的本质。这一决定凸显了数字艺术与人性之间的微妙关系。

【AiBase提要:】

✨ Procreate宣布拒绝生成式AI,回应艺术界反对声音。

🎨 CEO詹姆斯・库达认为生成式AI剥夺了创作的人性。

🤖 Procreate将继续致力于为艺术家提供更好的创作工具。

11、特朗普转发AI生成 “泰勒支持” 照片,自称 “一无所知”

特朗普在社交平台转发AI生成的泰勒・斯威夫特支持图片,却声称对此一无所知,引发争议和疑问。他承认这些图片是他人生成的,同时表示对AI技术的危险性有所警惕。特朗普曾因指责哈里斯使用AI伪造图片而受到批评,暴露了其言论存在的矛盾和虚伪之处。

image.png

【AiBase提要:】

📸 特朗普在 Truth Social 上分享AI生成的泰勒・斯威夫特支持图片,却声称一无所知。

🤖 他承认这些图片是其他人生成的,表达对AI技术可能非常危险的担忧。

📰 特朗普曾因指责哈里斯利用AI伪造图片而受到批评,揭示其言论存在的虚伪性和矛盾之处。

举报

  • 相关推荐
  • 大家在看
  • Graphite Reviewer:AI代码审查伴侣

    Graphite Reviewer是一个AI代码审查工具,它通过即时反馈帮助团队提高代码审查的效率和质量。该工具利用代码库感知AI,自动检测代码中的bug和错误,使团队能够专注于构建而不是审查。它支持自定义规则,保证代码质量和一致性,同时确保代码的私密性和安全性。Graphite Reviewer的主要优点包括快速合并PR、强化质量和一致性、保持代码私密和安全、捕捉常见错误等。

  • Character SDK:构建可实时互动的AI角色

    Character SDK是一个能够创建AI角色的平台,这些角色可以实时听、说、看,甚至采取行动。它通过实时语音和视觉识别、高级OCR处理、多语言交流、自适应推理和基于意图的任务自动化等技术,帮助企业提高效率,减少成本,并提供个性化的用户体验。

  • Temperstack:一站式SRE平台,提升服务可靠性。

    Temperstack是一个企业级的主动式SRE平台,旨在减少SRE的重复劳动,提高服务的可靠性。它通过自动化服务目录、警报审计和跨您的监控工具的SLI报告,为从CTO到SRE工程师的团队提供可见性、主动发现问题并促进协作。Temperstack集成了流行的监控工具,提供统一的命令界面,以实现全面的SRE可见性和行动。

  • o1-engineer:命令行工具,提升开发效率

    o1-engineer 是一个命令行工具,旨在帮助开发者通过 OpenAI 的 API 高效地管理和交互项目。它提供了代码生成、文件编辑、项目规划等功能,以简化开发工作流程。

  • Canvas:与ChatGPT协作的新方式

    Canvas是OpenAI推出的一个新界面,旨在通过与ChatGPT的协作来改进写作和编码项目。它允许用户在一个单独的窗口中与ChatGPT一起工作,超越了简单的聊天界面。Canvas利用GPT-4o模型,能够更好地理解用户的上下文,并提供内联反馈和建议。它支持直接编辑文本或代码,并提供快捷操作菜单,帮助用户调整写作长度、调试代码等。Canvas还支持版本回溯,帮助用户管理项目的不同版本。

  • Text Behind Image:轻松创建文字背景图片设计。

    Text Behind Image 是一个开源的设计工具,允许用户轻松创建文字背景图片设计。它提供了一个简洁的界面,让用户可以自由地在图片上添加文字,创造出独特的视觉效果。这个工具对于设计师、社交媒体运营者和内容创作者来说非常有用,因为它可以快速生成具有吸引力的视觉内容。

  • torchao:PyTorch原生量化和稀疏性训练与推理库

    torchao是PyTorch的一个库,专注于自定义数据类型和优化,支持量化和稀疏化权重、梯度、优化器和激活函数,用于推理和训练。它与torch.compile()和FSDP2兼容,能够为大多数PyTorch模型提供加速。torchao旨在通过量化感知训练(QAT)和后训练量化(PTQ)等技术,提高模型的推理速度和内存效率,同时尽量减小精度损失。

  • LFMs:新一代生成式AI模型

    Liquid Foundation Models (LFMs) 是一系列新型的生成式AI模型,它们在各种规模上都达到了最先进的性能,同时保持了更小的内存占用和更高效的推理效率。LFMs 利用动态系统理论、信号处理和数值线性代数的计算单元,可以处理包括视频、音频、文本、时间序列和信号在内的任何类型的序列数据。这些模型是通用的AI模型,旨在处理大规模的序列多模态数据,实现高级推理,并做出可靠的决策。

  • NVLM-D-72B:前沿的多模态大型语言模型

    NVLM-D-72B是NVIDIA推出的一款多模态大型语言模型,专注于视觉-语言任务,并且通过多模态训练提升了文本性能。该模型在视觉-语言基准测试中取得了与业界领先模型相媲美的成绩。

  • gradio-bot:将Hugging Face Space或Gradio应用转化为Discord机器人

    gradio-bot是一个可以将Hugging Face Space或Gradio应用转化为Discord机器人的工具。它允许开发者通过简单的命令行操作,将现有的机器学习模型或应用快速部署到Discord平台上,实现自动化交互。这不仅提高了应用的可达性,还为开发者提供了一个与用户直接交互的新渠道。

  • AI-Powered Meeting Summarizer:会议语音转文本并自动生成摘要的AI工具

    AI-Powered Meeting Summarizer是一个基于Gradio的网站应用,能够将会议录音转换为文本,并使用whisper.cpp进行音频到文本的转换,以及Ollama服务器进行文本摘要。该工具非常适合快速提取会议中的关键点、决策和行动项目。

  • VARAG:视觉增强的检索与生成系统

    VARAG是一个支持多种检索技术的系统,优化了文本、图像和多模态文档检索的不同用例。它通过将文档页面作为图像嵌入,简化了传统的检索流程,并使用先进的视觉语言模型进行编码,提高了检索的准确性和效率。VARAG的主要优点在于它能够处理复杂的视觉和文本内容,为文档检索提供强大的支持。

  • JoyHallo:数字人模型,支持生成普通话视频

    JoyHallo是一个数字人模型,专为普通话视频生成而设计。它通过收集来自京东健康国际有限公司员工的29小时普通话视频,创建了jdh-Hallo数据集。该数据集覆盖了不同年龄和说话风格,包括对话和专业医疗话题。JoyHallo模型采用中国wav2vec2模型进行音频特征嵌入,并提出了一种半解耦结构来捕捉唇部、表情和姿态特征之间的相互关系,提高了信息利用效率,并加快了推理速度14.3%。此外,JoyHallo在生成英语视频方面也表现出色,展现了卓越的跨语言生成能力。

  • PhysGen:基于物理的图像到视频生成技术

    PhysGen是一个创新的图像到视频生成方法,它能够将单张图片和输入条件(例如,对图片中物体施加的力和扭矩)转换成现实、物理上合理且时间上连贯的视频。该技术通过将基于模型的物理模拟与数据驱动的视频生成过程相结合,实现了在图像空间中的动态模拟。PhysGen的主要优点包括生成的视频在物理和外观上都显得逼真,并且可以精确控制,通过定量比较和全面的用户研究,展示了其在现有数据驱动的图像到视频生成工作中的优越性。

  • Whisper large-v3-turbo:高效自动语音识别模型

    Whisper large-v3-turbo是OpenAI提出的一种先进的自动语音识别(ASR)和语音翻译模型。它在超过500万小时的标记数据上进行训练,能够在零样本设置中泛化到许多数据集和领域。该模型是Whisper large-v3的微调版本,解码层从32减少到4,以提高速度,但可能会略微降低质量。

  • Realtime API:低延迟的实时语音交互API

    Realtime API 是 OpenAI 推出的一款低延迟语音交互API,它允许开发者在应用程序中构建快速的语音到语音体验。该API支持自然语音到语音对话,并可处理中断,类似于ChatGPT的高级语音模式。它通过WebSocket连接,支持功能调用,使得语音助手能够响应用户请求,触发动作或引入新上下文。该API的推出,意味着开发者不再需要组合多个模型来构建语音体验,而是可以通过单一API调用实现自然对话体验。

  • Saylo AI:探索无限的AI角色扮演游戏。

    Saylo AI是一个AI角色扮演游戏,让你与AI角色互动,探索多样化的戏剧性故事。它利用人工智能技术,提供沉浸式的互动体验,让玩家在虚拟世界中与AI朋友交流,体验不同的故事情节。Saylo AI的背景信息展示了其创新性和娱乐性,旨在为玩家提供一种全新的娱乐方式。目前产品处于推广阶段,价格未明确标注。

  • twinny:Visual Studio Code的免费且私密的AI扩展

    twinny是一个为Visual Studio Code用户设计的AI扩展,旨在提供个性化的编程辅助,提高开发效率。它通过集成先进的AI技术,帮助开发者在编码过程中快速解决问题,优化代码,并提供智能提示。twinny的背景是响应开发者对于更加智能和自动化编程工具的需求,它通过简化开发流程,减少重复劳动,从而让开发者能够专注于更有创造性的工作。

  • Buildpad:构建人们真正想要的产品

    Buildpad 是一个旨在帮助创始人从概念到成功最小可行产品(MVP)的在线平台。它通过提供智能验证工具、AI引导的开发流程、进度跟踪以及个性化的项目见解,帮助用户构建能够获得市场认可的产品。Buildpad 的主要优点包括简化产品开发流程、提高产品成功率、以及提供个性化的指导和支持。

  • Novela:AI时代的技能学习平台

    Novela是一个专注于AI时代技能学习的在线平台,提供早期访问服务,用户可以免费试用。它旨在帮助用户掌握AI相关的技能,以适应未来职场的需求。

今日大家都在搜的词: