11.11云上盛惠!海量产品 · 轻松上云!云服务器首年1.8折起,买1年送3个月!超值优惠,性能稳定,让您的云端之旅更加畅享。快来腾讯云选购吧!
腾讯云
12-20
云蝶科技在ICML2026提出POLIA方法,解决多模态大模型常忽视关键视觉信息、依赖语言猜答案的问题。核心创新是增加视觉对象级细粒度评价,分阶段评估答案正确性与证据可靠性,实现从“奖励正确答案”到“奖励正确使用视觉证据”的转变。在七项基准测试中大幅提升准确率,且计算开销低。该研究为具身智能的视觉证据建模与强化学习提供基础,依托联合实验室推动从算法验证走向真实场景应用。
2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。 A 天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。 MiniMax发布的H3,正是视频生成市场的一个全新选择。 官方博客中表示,定位H3
软件定义汽车趋势下,智能座舱高频OTA与多模态交互使传统人工测试面临场景覆盖不足、性能评估主观、兼容周期长等瓶颈。行业聚焦四大核心:车机性能测试以自动化采集量化指标;多模态交互仿真补齐全场景盲区;蓝牙/CarPlay兼容测试依托分布式真机池破解海量设备适配;选型强调一体化测试、无码脚本复用及私有化集成。标准化智能工具替代重复人工,实现效率与缺陷检出精度双向提升,从研发源头保障座舱品质。
虎牙在WAIC论坛发布实时多模态数字人模型VAM1.0。董事长林松涛指出,真实场景是AI价值第一现场,AI普惠在于让普通人变强。CEO黄俊洪强调,该模型基于一张照片即可实时生成能听、能说、能交互的虚拟人,通过三段式训练解决崩坏、自然度与成本问题。VAM瞄准直播互动痛点,将推动虎牙从“看别人玩”向“和AI一起玩”跨越,开启指数级增长。
多模态交互正成为提升通用Agent用户体验的关键。过去AI多为文本或图片问答,如今用户期望AI能透过摄像头实时讲解、在任务中持续对话。这背后需要低延迟、稳定、可打断的传输系统。豆包从WebSocket、QUIC到WebRTC逐步演进,火山引擎更自研多模态传输系统,通过C/S架构、MoQ协议和网关智能处理,解决弱网、高并发、成本等问题。该系统已在豆包亿级DAU场景落地,使业务规模翻10倍。长远看,多模态传输正从通信管道成为AI原生基础设施,支撑高频率、全场景的人机交互。
2026年越南河内IBTE国际玩具及婴童用品展上,搭载十方融海多模态AI交互系统的智能终端Lukie亮相,聚焦儿童陪伴、早教互动与情绪陪伴场景。它主打无屏护眼和情绪交互,样机售罄,已拓展本地渠道78家,首批订单超6000台。展会反映出中国AI出海正从单一硬件输出转向算法、交互与场景深度融合的新一代终端输出,更贴近东南亚家庭对儿童语言学习与成长陪伴的需求。背后是十方融海开源生态支撑,标志中国智造出海进入技术、产品与场景协同落地的新阶段。
AI伪造内容泛滥,不法分子利用AIGC技术实施诈骗,传统鉴伪技术受限于复杂传播环境。合合信息在2026中国图像图形大会上展示多模态可信鉴伪系统,能识别Chat-GPT、Midjourney等主流模型产出内容,应对身份造假、证件欺诈等风险。该系统已在金融、保险、电商等三十余场景落地,如某国有银行上线后人脸伪造拦截率提升8倍,有效净化交易环境。未来将持续迭代技术,筑牢数字安全屏障。
本期AI日报聚焦8大热点:字节跳动开源3B参数多模态大模型Lance,实现图像视频理解与生成统一;智谱发布GLM-5.1高速版API,以400 tokens/s刷新全球纪录;CapCut与Gemini合作实现AI创作智能互联;OpenAI推出ChatGPT for PowerPoint插件,一句话生成PPT;WordPress 7.0原生集成AI,开启智能建站新时代;Spotify联手环球音乐推出正版AI翻唱与混音功能;美团开源LongCat-Video-Avatar1.5数字人视频生成模型,�
多模态大模型时代,训练基础设施正面临结构性错位。传统框架基于“数据同质、结构单一、平台固定”设计,难以应对多模态异构数据、模型组件协同及跨平台算力需求。百度百舸开源的全模态训练框架LoongForge,以Megatron为核心引擎,通过统一模型抽象、系统层优化和硬件插件化设计,实现“一套代码多平台运行”。其CCT通算传并行、ChunkPipe流水线并行、自适应FP8等技术,在主流模型上实现15%-45%端到端训练加速,在DeepSeek等前沿架构上实现倍级性能提升,并在5000+卡昆仑P800集群上达到90%+线性扩展效率。
本期AI日报聚焦八大热点:月之暗面将推2.5万亿参数Kimi K3大模型,长文本处理能力突破;英伟达发布多模态模型Nemotron-3 Nano Omni,推理效率提升9倍;蚂蚁集团开源百灵Ling-2.6-flash模型;商汤推出原生多模态统一模型SenseNova U1;Claude深度集成Adobe等八大软件;字节TRAE SOLO上线语音输入;科大讯飞发布星火X2-Flash模型;ima上线知识Agent copilot,内置记忆系统。