首页 > 业界 > 关键词  > 京东开源最新资讯  > 正文

全球首个!京东全栈开源JoyAI-VL-Interaction:让大模型边看边说

2026-06-22 17:37 · 稿源: 快科技

本报讯 6月22日,京东正式向开发者社区开放了Joy视觉语言交互模型(Joy VL-Interaction)及其完整部署方案,这也是业界首套从模型权重到工程框架全栈开源的实时视频视觉交互系统。

该模型原生适配vLLM-Omni,彻底改变了传统多模态系统“一问一答”的被动交互方式,使设备能够在持续观察实时画面的同时,自主判断、主动响应,实现流畅的流式交互

与此前主流的图文、视频类大模型不同,新系统带来了三项关键突破:

主动自主判断:系统持续接入摄像头、监控、直播等实时视频流,能够自行识别关键事件并主动发出提醒,无事件时自动保持静默,无需人工触发指令。例如,监测到火情、老人跌倒等紧急情况时可即时预警。

低延迟实时响应:以流式方式对正在发生的画面进行处理,无需等待完整视频上传后再做分析,充分满足安防、实时翻译、直播讲解等高时效性场景的需求。

前台观测与后台分工协作:面对复杂推理、代码生成或工具调用等繁重任务时,可委托后台代理处理,前台模型则不间断地持续观测现场画面,任务完成后无缝接续交互过程。

与多数仅开放模型权重的项目不同,此次开源内容包含模型权重、专属交互数据集、完整训练方案以及可部署的全套工程框架,并支持灵活替换语音模块、可视化界面、第三方代理与业务接口。

该系统兼容摄像头、监控流、直播流等多路视频输入,内置长期记忆、语音收发和vLLM快速部署能力,能够快速搭建各类实景智能应用:居家老人与儿童看护、安防自动预警、直播实时解说、电商导购、智能眼镜无障碍辅助、工业操作指导等。

全球首个!京东全栈开源JoyAI-VL-Interaction:让大模型边看边说

在覆盖监控预警、实时计数、实时翻译、直播解说等58组真人盲测案例中,对比豆包视频交互助手,新模型整体胜率为77.6%;对比Gemini视频交互助手,整体胜率达到87.9%;在安防预警场景中,对两款竞品均取得100%的胜率。

这一表现源于交互模型将主动交互能力内化于模型自身,而非依赖外部触发,从根本上区别于传统的一问一答回合制模式。

举报

  • 相关推荐
  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

  • 京东开源JoyAI-Video-Edit模型!实现视频边播边改:综合性能全球领先

    京东正式开源自研实时流式视频编辑模型JoyAI-Video-Edit,打破传统视频先成片再剪辑的固有模式,实现播放画面同步实时修改,在流式实时视频编辑方向的各项指标全面领先,达到世界一流水平。 依托JoyAI基础大模型底座,设备在720P分辨率下可稳定实现30帧实时运算,画面处理无明显延迟卡顿,适配常规视频播放同步修改需求。模型摒弃行业只能剪辑短视频片段的短板,支持超

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

  • 豆包宣布视频通话功能升级!能听会看 主动交互 更像真人

    今日,豆包宣布视频通话功能迎来升级,正式接入原生音视频全双工大模型SeedRealtime。 据介绍,SeedRealtime原生支持音视频联合理解,能够综合声音、画面及时间信息,判断当前该听谁说话、何时回应或保持沉默。 实现边看、边听、边说的自然连续交互,在业界率先实现音视频全双工技术的规模化落地。 该模型上线后,豆包视频通话可在连续变化的真实场景中,实现更自然�

  • 从技术叙事走向商业化拐点,AI视频公司集体迎来价值重估?

    刚刚,快手发布2026年一季度财报。比起集团整体表现,市场的注意力更聚焦在可灵AI的经营数据。 财报显示,2026年第一季度,可灵AI营业收入超过人民币6.5亿元,同比增长超300%;2026年3月,其年化收入运行率(ARR)已接近5亿美元,较去年3月的1亿美元增长4倍,其商业化进程进一步加速。 几乎就在同一个时间窗口里,另外两件行业标志性事件同步发生。 一边是戛纳电影节上,

  • 模型打底、千问办公上桌,阿里再战 AI 局

    中国AI大模型的参数竞赛,已经进入到万亿规模时代。 8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,核心旗舰模型为Qwen3.8-Max,总参数达2.4万亿、单次激活95B、1M上下文长度、支持视觉理解。 就在Qwen3.8发布的同一周,Kimi K3以2.8万亿参数强势开源,MiniMax的M3Pro也达到2万亿参数级别,并传出即将开源的消息。 此外,包括DeepSeek V4Pro、文心5.0、MiMo-V2.5-Pro、LongCat-2.0等国产AI�

  • 让创新被看见!AI杭州 码动未来——2026 AI模型智能体创新大赛正式启动报名!

    2026“AI杭州·码动未来”大赛招募:聚焦智能体从“对话”走向“行动”,提供21万奖金、场地算力等百强赋能包。大赛设三大赛道:超级智能体(自主执行)、具身智能(精细操作)与时空智能(低空经济),并提供大厂实习、创投对接等全链路支持,助你代码落地物理世界。

  • AI日报:商汤甩出8B小钢炮 U1.5-Lite-Preview;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光

    微软推出支持16语言的全双工语音模型MAI Realtime;MiniMax开源视频模型H3但限制部分地区使用;商汤发布轻量统一多模态模型U1.5-Lite-Preview;面壁智能开源ForgeStencil实现工业软件自动化优化;Teams新增“举报会议”功能防AI诈骗;ChatGPT Atlas浏览器将停服;苹果诉OpenAI案曝内部数据管理漏洞;高德升级世界模型ABot-World-0,实现24小时连续稳定推理。

  • 字节跳动发布 Seedance 2.5 视频模型 可单次生成 30 秒视频

    字节跳动在7月31日正式对外发布新一代视频生成模型 Seedance2.5。官方称,该模型单次可生成时长30秒的高质量视频片段,并将陆续在即梦 AI 与豆包专业版中上线,API 服务也会在近期接入火山方舟平台。 新模型延续了 Seedance2.0统一的多模态音视频联合生成架构。研发团队把重点放在长叙事、多模态参考和编辑能力三个方向上,希望让生成结果更有逻辑感和连贯性。

  • 从通用到垂直:什么是专业的自媒体原创AI视频工具标准

    专业自媒体做原创AI视频,选工具需按需匹配。文章介绍了四款接入Seedance的AI工具:updream为工作流型,适合深度原创与系列化内容;即梦AI为玩法型,适合创意特效和追热点;剪映为剪辑型,适合实拍+AI混合;小云雀为平台型,适合矩阵号批量生产。AI视频工具正从通用走向垂直深耕,创作者可根据内容需求选择最适工具组合。

今日大家都在搜的词: