首页 > 原创 > 关键词  > AI最新资讯  > 正文

AI日报:美团LongCat-Flash-Omni发布;Qwen3-Max上线深度思考功能;百度“文心”5.0重磅回归

2025-11-03 16:14 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解https://app.aibase.com/zh

1、美团LongCat-Flash-Omni 正式发布,开启全模态实时交互新时代

美团推出的LongCat-Flash-Omni模型在全模态实时交互方面实现了重大突破,采用了最新ScMoE技术,并在多个领域表现出色,为开发者提供了高效的多模态应用场景解决方案。

QQ20251103-102218.png

【AiBase提要:】

🧠 集成高效的多模态感知模块和语音重建模块

🚀 采用Shortcut-Connected MoE技术,实现低延迟的实时音视频交互能力

🌐 支持全模态任务,文本、图像、视频理解及语音感知与生成均表现优异

详情链接:https://huggingface.co/meituan-longcat/LongCat-Flash-Omni

2、阿里通义千问Qwen3-Max 在官网上线深度思考功能

阿里通义千问最新旗舰语言模型Qwen3-Max正式上线了‘深度思考’模式,显著提升了处理复杂任务的效率。该模型参数量突破1万亿,预训练数据达到36T tokens,在多个基准测试中表现出色,展现了强大的推理和编程能力。

【AiBase提要:】

🧠 Qwen3-Max 是阿里通义团队推出的最新旗舰语言模型,参数量突破1万亿。

🔍 新上线的‘深度思考’模式提升了推理链分析与多步骤问题拆解能力。

🏆 Qwen3-Max-Thinking 版本在高难度推理基准测试中实现了100% 的准确率。

3、百度“文心”5.0重磅回归!一键生成漫画、修图、视频,全能AI助手全面升级

文章详细介绍了百度旗下AI助手‘文心’5.0版本的多项功能升级,包括魔法漫画、创意修图、‘放心写’、全模态交互、视频生成与多语种通话等,展示了其作为全能型AI平台的强大能力。

image.png

【AiBase提要:】

🎨 魔法漫画:用户上传照片并输入描述即可生成连贯漫画

🖼️ 创意修图:智能修图引擎支持艺术滤镜和风格迁移

🎥 视频生成:静态图片可转化为动态视频并支持多语种通话

4、云存储加速:百度网盘核心API兼容MCP协议,赋能开发者一键接入

百度网盘通过兼容MCP协议升级其核心API,显著简化了开发者接入流程,并增强了文件管理与检索能力,为云存储行业注入了新的活力。

【AiBase提要:】

📎 百度网盘核心API全面兼容MCP协议,简化开发者接入流程。

🔍 提供高效文件检索功能,支持语义搜索和多种文件操作。

🔄 强化上传方式,满足不同场景下的数据接入需求。

详情链接:https://github.com/baidu-netdisk/mcp

5、OpenAI 开放 Sora2视频工具,面向美国、加拿大、日本和韩国用户

OpenAI宣布取消Sora2的邀请码限制,正式向美国、加拿大、日本和韩国用户开放下载,标志着其首次大规模扩展并进入亚洲市场。同时,为应对资源紧张问题,推出了4美元的“点数包”以增加生成额度,并计划构建“Sora经济”,对版权角色和知名人物的出镜进行按次收费,回应了关于“默认采集”的争议。

【AiBase提要:】

🌍 OpenAI 开放 Sora2视频工具,面向美国、加拿大、日本和韩国用户。

💰 推出4美元 “点数包”,加快商业化进程,并提供额外生成次数。

📜 未来将构建 “Sora 经济”,计划对版权角色和知名人物的出镜进行收费。

6、谷歌CEO确认:Gemini3年内发布,AI Agent能力或成突破口

谷歌首席执行官桑达尔·皮查伊在财报电话会上确认,公司计划在年内推出下一代人工智能模型Gemini3。该模型将着重提升处理复杂、多模态任务的‘智能体’能力,以缩小与OpenAI GPT-5等竞争对手的差距。同时,Alphabet的季度营收首次突破千亿美元,显示出AI技术对业务增长的重要推动作用。

【AiBase提要:】

🚀 Gemini3将专注于提升多模态任务和智能体能力,以增强性能。

💰 Alphabeta的季度营收首次突破千亿美元,AI成为核心增长动力。

🤝 合作深化:Anthropic计划调用100万个谷歌TPU进行模型训练,显示谷歌AI基础设施的吸引力。

7、Siri要翻身了?苹果明年三月推“Apple Intelligence”大改版,竟用上谷歌Gemini!

苹果计划于2026年推出全新一代Siri,引入谷歌Gemini大模型技术,并配合新型智能家居显示屏设备,同时在WWDC上全面展示Apple Intelligence战略,以实现智能跃迁。

【AiBase提要:】

🍎 引入谷歌Gemini大模型技术,提升Siri的网页理解与实时信息检索能力。

🏠 推出新型智能家居显示屏设备,成为家庭AI交互的核心入口。

📅 2026年WWDC将全面集成Apple Intelligence能力,构建端到端的个人智能生态。

8、一句话生成AI Agent!Pokee AI零代码引爆自动化革命,OpenAI和n8n危险了?

Pokee AI通过自然语言指令实现零代码AI Agent开发,极大简化了传统复杂流程,推动自动化革命。

image.png

【AiBase提要:】

🤖 通过自然语言指令创建智能工作流,无需编程技能。

🧠 自研“提示到工作流”引擎支持交互式逻辑预览和调整。

🌐 兼容数千款主流应用,实现跨平台自动化操作。

举报

  • 相关推荐
  • 车机自动化测试降本增效实践:多模态交互与兼容性测试行业方案

    软件定义汽车趋势下,智能座舱高频OTA与多模态交互使传统人工测试面临场景覆盖不足、性能评估主观、兼容周期长等瓶颈。行业聚焦四大核心:车机性能测试以自动化采集量化指标;多模态交互仿真补齐全场景盲区;蓝牙/CarPlay兼容测试依托分布式真机池破解海量设备适配;选型强调一体化测试、无码脚本复用及私有化集成。标准化智能工具替代重复人工,实现效率与缺陷检出精度双向提升,从研发源头保障座舱品质。

  • 虎牙WAIC 2026首发实时多模态数字人VAM 1.0

    虎牙在WAIC论坛发布实时多模态数字人模型VAM1.0。董事长林松涛指出,真实场景是AI价值第一现场,AI普惠在于让普通人变强。CEO黄俊洪强调,该模型基于一张照片即可实时生成能听、能说、能交互的虚拟人,通过三段式训练解决崩坏、自然度与成本问题。VAM瞄准直播互动痛点,将推动虎牙从“看别人玩”向“和AI一起玩”跨越,开启指数级增长。

  • 7300个Skill、16万开发者:小红书开始种“AI”

    在2026WAIC被大模型参数与具身智能的机械骨骼包围时,小红书的展馆显得有些“另类”——选择将生态内的诸多开发者送往展厅,以及一场主角为00后甚至05后的“让Builder被看见”论坛。 小红书同步推出了两大产品新能力:RED Skill 全量上线、Vibe Coding 小工具启动内测,同时升级创作者平台“Builder Hub”。开发者可将AI应用挂载于笔记,用户无需跳转、直接使用。 不同于宏大的科

  • 豆包视频通话背后,火山引擎重构 Agent 时代多模态传输底座

    多模态交互正成为提升通用Agent用户体验的关键。过去AI多为文本或图片问答,如今用户期望AI能透过摄像头实时讲解、在任务中持续对话。这背后需要低延迟、稳定、可打断的传输系统。豆包从WebSocket、QUIC到WebRTC逐步演进,火山引擎更自研多模态传输系统,通过C/S架构、MoQ协议和网关智能处理,解决弱网、高并发、成本等问题。该系统已在豆包亿级DAU场景落地,使业务规模翻10倍。长远看,多模态传输正从通信管道成为AI原生基础设施,支撑高频率、全场景的人机交互。

  • GPASS AI眼镜智能体开发者大赛收官,176支团队竞逐AI新场景

    WAIC期间,蚂蚁集团、Rokid与雷鸟创新共同举办GPASS+AI眼镜智能体开发者大赛决赛。176支团队参赛,12支入围,最终揭晓生活健康、办公提效、文旅出行及无显示眼镜四大赛道一等奖。大赛技术底座GPASS为蚂蚁自研智能终端可信连接框架,通过封装硬件能力为标准化API,大幅降低跨品牌适配成本。优胜作品将入驻GPASS商店,获得生态落地机会,推动AI眼镜从“可体验”迈向“常用好用”。

  • 苹果iOS 27开发者预览版Beta 4发布:国行iPhone Siri AI继续缺席

    今天凌晨,苹果正式发布iOS 27开发者预览版Beta 4,版本号为24A5390f。 本次更新主要围绕功能完善、细节优化和系统流畅度提升展开,进一步修复此前版本存在的Bug,并对全新UI及交互体验进行持续打磨。 不过,国行iPhone用户期待的新一代苹果智能(Apple Intelligence)和Siri AI,依然没有在iOS 27开发者预览版Beta 4中上线。 国内用户之所以对Beta 4抱有较高期待,主要是因为7月中旬�

  • 十方融海多模态 AI 交互系统赋能终端硬件亮相河内IBTE展,中国 AI 出海受关注

    2026年越南河内IBTE国际玩具及婴童用品展上,搭载十方融海多模态AI交互系统的智能终端Lukie亮相,聚焦儿童陪伴、早教互动与情绪陪伴场景。它主打无屏护眼和情绪交互,样机售罄,已拓展本地渠道78家,首批订单超6000台。展会反映出中国AI出海正从单一硬件输出转向算法、交互与场景深度融合的新一代终端输出,更贴近东南亚家庭对儿童语言学习与成长陪伴的需求。背后是十方融海开源生态支撑,标志中国智造出海进入技术、产品与场景协同落地的新阶段。

  • 即构ZIM社群功能:构建Discord式实时互动社区

    社区成产品标配,ZIM推全新社群能力。采用“社群+频道”架构,实现内容分层与实时互动。三大升级:有序频道化管理、支持百万级规模、提供完整管理工具。同时迭代消息表情、会话音搜索、用户关系等。助力开发者低成本快速构建可承载大规模用户的成熟互动社区。

  • 苹果发布iOS 27开发者预览版Beta 3:支持Siri语音自定义

    今天凌晨,苹果正式发布了iOS 27开发者预览版Beta 3,目前整体体验已经比较稳定,如果本周没有太大问题,预计下周将会推送首个公测版本。 Beta 3中Siri语音自定义正式启用,此前测试版仅开放入口无法使用,现支持调节Siri语速、表达情绪强度,提供两款基础人声。 该功能依靠端侧运算,仅iPhone 17 Pro、iPhone Air可用,语音同步作用于Siri、地图、Safari。 辅助功能新增实时视觉

  • AI 应用关注点转向落地能力,广东一开源交互平台会后两月意向签约超 4000 万元

    AI产业关注点正从通用模型能力转向实际应用价值,更看重基础设施稳定性、持续入口、开源生态、终端接入和产业化路径。以开源交互平台“小智AI”为例,其会后主动对接近80家制造企业,意向签约超4000万元,说明产业侧讨论已从技术展示推进至合作测算层面。在广东制造业背景下,能覆盖硬件接入、多场景适配并贴近真实设备网络的项目,因兼顾交互入口与开发者生态,正成为观察AI落地的重要样本。

今日大家都在搜的词: