11.11云上盛惠!海量产品 · 轻松上云!云服务器首年1.8折起,买1年送3个月!超值优惠,性能稳定,让您的云端之旅更加畅享。快来腾讯云选购吧!
腾讯云
12-20
今日AI热点:OpenAI发布三款实时语音模型,覆盖推理对话、翻译和转录场景;苹果首款AI硬件AirPods进入DVT阶段,内置摄像头;宇树科技UniStore平台开放,开启人形机器人应用商店时代;阶跃星辰完成25亿美元融资,冲刺香港IPO;美团推出首个数字生命共生社区“鲸游”公测;OpenAI推出GPT-5.5-Cyber预览版,专攻网络安全;Mozilla借助AI发现Firefox 271个安全漏洞;OpenAI发布Codex Chrome扩展,优化浏览器工作流。
DeepSeek-V4发布后,全球顶级Agent开源项目OpenClaw迅速完成对其Flash和Pro版本的全面适配。这标志着DeepSeek-V4正式成为智能体开发的主流底层基座。V4在自主决策、工具调用、长链任务执行等关键能力上深度优化,上下文承载、逻辑推理与复杂编码能力显著提升,更适配自动化工作流等前沿场景。此次适配将扩大DeepSeek在开源生态的渗透率,压缩海外大模型市场优势,并大幅降低开发者构建高性能AI智能体的成本与门槛,推动国产大模型在Agent赛道话语权持续提升。
TechCrunch报道,谷歌推出一项测试版功能,让用户通过耳机实时收听翻译内容。 与此同时,公司还将Gemini高级模型集成至谷歌翻译,并进一步扩展了应用内的语言学习工具。 全新的实时耳机翻译功能能完整保留说话者的语气、重音和语调,帮助用户在对话中更好地把握节奏、区分不同讲话者。该功能本质上可将任何耳机变为实时单向翻译设备。
ZEGO云端实时语音识别服务针对直播、语聊、在线课堂和会议等场景,提供低延迟(端到端600ms)、高准确率(提升40%)、低成本(节省50%以上)的解决方案。支持30多种语言及方言,适配多厂商接入,具备降噪和回声消除能力。核心应用包括实时字幕和AI观众互动,显著提升用户体验和业务效率,助力企业全球化布局。
今日,字节跳动豆包大模型团队宣布,豆包实时语音大模型今日正式上线,并在豆包App全量开放,将App升级至7.2.0版本即可体验。豆包实时语音大模型是一款语音理解和生成一体化的模型,实现了端到端语音对话。豆包大模型团队也坦言,现阶段的模型主要支持中文,其他语种尚未较好支持,中文范围内,模型也仅支持小部分方言和地方口音的理解和表达。
【新智元导读】今天,「天工大模型4.0」o1版/4o版在网页端和APP端正式上线了,人人可玩的那种。2024中国互联网价值榜发布。在这条通往AGI的道路上,他们正在用技术创新和产品落地,一步步将愿景变为现实。
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://top.aibase.com/1、阿里国际推出最新多模态大模型Ovis,看菜品就能提供烹饪步骤阿里国际AI团队发布了多模态大模型Ovis,为各行业带来新机遇。英特尔在2024年计划中稳步推进,展望2025年推出的FalconShores将进一步提升其在AI领域的竞争力。
腾讯宣布,腾讯主导的新一代实时语音编码行业标准AVS3P10,即将正式对外发布。由腾讯会议天籁实验室携手腾讯AILab研发的Penguins编解码器,把经典信号处理和最新的深度学习技术结合在一起,突破了传统编码器的天花板。AVS3P10标准,原型是腾讯首款神经网络语音编解码器腾讯会议PenguinsAl语音引擎,在稳定服务腾讯会议、QQ语音通话亿级用户后,开始用这项技术推动行业发展。
Cartesia发布了一个名为Sonic的低延迟语音生成模型,该模型以其快速的推理速度和超低的延迟引起了广泛关注。Sonic的延迟仅为135毫秒,能够生成具有逼真情感和表达能力的语音。他们希望能够实现对任何形式的模态进行即时理解和生成,进一步推动实时智能的发展。
SupertoneShift是一款创新的实时语音变换技术产品,它允许用户即时切换到任选的声音,为虚拟主播、内容创作者、游戏玩家以及希望准确表达角色声音的用户提供了强大的支持。官网:https://product.supertone.ai/shift主要功能实时语音变换:SupertoneShift支持用户即刻切换到选择的声音,进行实时语音变换,非常适合需要即时变声的场景。SupertoneShift目前提供开放测试版,用户可以下载并