首页 > 原创 > 关键词  > 人工智能最新资讯  > 正文

AI日报:混元推四款小尺寸开源模型;昆仑万维发布新推理大模型MindLink;谷歌Gemini 2.5 Deep Think发布

2025-08-04 16:01 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解https://top.aibase.com/

1、腾讯混元开源并发布 0.5B、1.8B、4B、7B模型

腾讯混元团队推出四款小尺寸开源模型,适用于消费级显卡和低功耗场景,支持垂直领域的低成本微调。这些模型在推理速度、性价比和长文处理能力上表现出色,并已在多个开源平台上线。

image.png

【AiBase提要:】

✨ 四款小尺寸模型专为消费级设备设计,适合多种低功耗场景。

🚀 模型具备快速推理和长文处理能力,可一次性处理超长内容。

🔧 支持多种部署方式,适用于端侧到云端的多样化需求。

详情链接:https://hunyuan.tencent.com/modelSquare/home/list

2、昆仑万维发布并开源全新推理大模型 MindLink

昆仑万维发布并开源了最新推理大模型Skywork MindLink,该模型通过创新性推理框架实现动态路径选择,提升答案透明度与效率,并在多项评测中取得卓越成绩。

image.png

【AiBase提要:】

🧠 Skywork MindLink采用Plan-based Reasoning新范式,优化多轮对话体验。

🏆 在多项基准测试中表现优异,斩获多个数学竞赛金牌。

🔧 内置自适应推理系统,可根据任务难度自动调整生成策略。

详情链接:https://github.com/SkyworkAI/MindLink

3、B站推出AI原声翻译功能:保留UP主声线音色,破解二次元文化出海难题

B站推出了自主研发的AI原声翻译功能,旨在解决国际版与国内版合并后的内容互通问题。该技术能够保留UP主的原始声线、音色特征和说话习惯,为海外用户提供更自然的中文内容体验。

image.png

【AiBase提要:】

✅ B站推出AI原声翻译功能,支持英语翻译,保留UP主原始声线和音色。

🔄 采用对抗式强化学习和Deep Research技术,确保翻译精准并保留文化韵味。

🌐 未来将扩展日语等更多语言支持,助力B站国际化战略发展。

4、谷歌Gemini 2.5 Deep Think发布!IMO金牌加持,AI新王者能否重塑未来?

谷歌DeepMind推出的Gemini 2.5 Deep Think模型在多个领域展现出卓越的推理能力,尤其在2025年国际数学奥林匹克竞赛中获得金牌。该模型引入了并行思考和强化学习技术,提升了复杂任务处理能力,并在编码、跨领域知识测试中表现优异。

QQ20250804-110503.jpg

【AiBase提要:】

🧠 引入并行思考机制,提升复杂问题解决能力。

🏆 在IMO竞赛中取得金牌,展现顶尖数学推理实力。

🚀 支持多模态与长上下文,适用于多种场景。

5、OpenAI CEO展示 GPT-5 新特性,能高效整合网络信息

OpenAI首席执行官萨姆・奥尔特曼在社交媒体上分享了GPT-5的聊天记录截图,展示了其强大的信息整合能力。GPT-5对科幻动画《Pantheon》给出了积极评价,并提到该剧在烂番茄上获得了100%好评。这一事件标志着GPT-5的首次公开亮相,引发了科技界的广泛关注。

【AiBase提要:】

🌟 GPT-5首次公开亮相,展示了其强大的信息整合能力。

📺 OpenAI CEO推荐科幻动画《Pantheon》,并分享了模型的积极评价。

🔍 GPT-5在烂番茄网站上的评价为“100% 影评人好评”,引起广泛关注。

6、苹果组建AI答案引擎团队:挑战ChatGPT,或将重塑Siri和Safari搜索体验

苹果公司成立了一个专门团队,致力于开发类似ChatGPT的AI应用程序,旨在提升其核心产品的搜索和交互体验。该团队名为Answers, Knowledge, and Information,专注于构建一个能够利用全网信息回答用户问题的答案引擎。

【AiBase提要:】

🍎 苹果成立新团队开发类似ChatGPT的AI应用,以提升搜索和交互体验。

🔍 答案引擎可能作为独立应用或整合到Siri、Safari等产品中,提供更智能的搜索功能。

🌐 苹果希望减少对第三方AI服务的依赖,并应对谷歌反垄断案件带来的影响。

7、高德地图宣布全面AI化,上线全球首个AI原生地图应用“高德地图2025”

高德地图正式推出全球首个AI原生地图应用——高德地图2025,标志着其在技术领域的重大飞跃。该应用结合空间智能技术,通过多模态信息感知提升地图的智能化程度,并将在多个领域产生积极影响。

【AiBase提要:】

🚀 高德地图推出全球首个AI原生地图应用,实现技术突破。

🧠 空间智能技术提升地图的多模态信息感知能力。

🚗 应用将拓展至智能汽车、智能眼镜等多个领域,提升出行效率。

8、Adobe Photoshop 推出“Harmonize”:用 AI 自动匹配光影,实现无缝图像合成

Adobe 通过一系列生成式 AI 工具,如 "Harmonize",简化了复杂的图像编辑过程,提升了图像合成与修饰的效率,并引入了内容凭证以保障图像真实性。

image.png

【AiBase提要:】

🖼️ "Harmonize" 工具可自动匹配图像元素的光照、颜色和阴影,实现无缝合成。

🔍 AI 驱动的图像升级功能可将分辨率提升至高达800万像素,同时不损失画质。

🔒 内容凭证功能为图像编辑历史提供可信追踪链,确保数字内容的真实性。

9、NVIDIA 发布 Cosmos DiffusionRenderer:革命性视频渲染技术

NVIDIA 推出了 Cosmos DiffusionRenderer,这是一个用于高质量图像和视频重光源及去光源的新型视频扩散框架。该技术是原有 DiffusionRenderer 的重大升级,通过改进的数据策划流程提升了渲染质量。

image.png

【AiBase提要:】

🌟 技术是 NVIDIA 原有 DiffusionRenderer 的重大升级,提供更高质量的图像和视频渲染。

💻 用户需安装 Python3.10 和至少 16GB 显存的 NVIDIA GPU,并创建相关的 conda 环境。

🎥 支持对图像和视频进行去光源及重光源处理,并能使用多种环境光照地图进行渲染。

详情链接:https://github.com/nv-tlabs/cosmos1-diffusion-renderer

10、安卓开发革命!谷歌Android Studio免费Agent模式上线,完爆苹果生态?

谷歌在Google I/O2025大会上宣布推出Android Studio的免费Agent模式,该模式基于Gemini2.5Pro,通过自然语言交互提升开发效率,支持跨文件任务处理、UI代码修改和自定义规则。其功能不仅挑战了苹果的Xcode生态,还为开发者提供了更高效的工具。

QQ20250804-140505.jpg

【AiBase提要:】

🤖 Agent模式:基于Gemini2.5Pro,通过自然语言交互完成复杂开发任务。

🔍 核心功能:支持UI代码快速修改、自定义规则设置以及百万Token上下文窗口。

🚀 竞争优势:免费开放Agent模式,对苹果Xcode生态形成直接挑战。

11、谷歌开源结构化信息提取工具 langextract,可提供精确来源定位

谷歌开源了 LangExtract 工具,能够高效从非结构化文本中提取结构化信息,适用于医疗、文学和商业等多个领域,为开发者提供了强大的解决方案。

image.png

【AiBase提要:】

🧠 精准溯源:提取结果可映射到源文本的具体位置,便于验证和追溯数据准确性。

🧩 可靠结构化输出:通过少量示例定义输出格式,确保符合用户预设的 JSON 模式。

📊 交互式可视化:一键生成 HTML 报告,直观查看提取结果,提升审核效率。

详情链接:https://github.com/google/langextract

12、Figma开发者模式重磅更新:彩色批注与MCP协议双重升级,设计转代码效率暴增

Figma近期对开发者模式进行了全面升级,推出了彩色交互式批注系统和Model Context Protocol(MCP)协议的重大改进。这些更新显著提升了设计与开发协作的效率,为行业树立了新的标杆。

image.png

【AiBase提要:】

🎨 彩色交互式批注系统让设计师能够通过不同颜色标记信息,提高开发理解效率。

🔄 MCP协议升级支持传输结构化数据,使AI工具生成的代码更贴合实际需求。

🚀 新功能如Ready for Dev视图简化设计交接流程,提升团队协作效率。

举报

  • 相关推荐
  • 技术攻坚|itc保伦股份荣获2026人工智能创新奖,共探会议、应急、校园等场景人工智能落地新范式

    itc保伦股份深耕声光电视讯三十余年,以软硬件一体化全场景AI落地获“2026人工智能创新奖”。企业打通终端、传输、算法与云平台,构建全链路空间智能系统,在智慧会议(实时转写、超分4K)、应急指挥(50余类智能监测预警)和智慧校园等场景解决刚需痛点。坚持垂直赛道多模态智能,持续迭代协同平台,未来将深化AI与实体经济融合,助力千行百业数字化转型。

  • 予非知识图谱大模型完成生成式人工智能服务备案!潍坊市首个

    “予非知识图谱大模型”获国家生成式AI服务备案认证,系潍坊首例。模型聚焦非结构化数据治理,具备知识建模、实体对齐、动态图谱等全链能力,内置知识分级与访问控制,适配政务、金融等高合规场景。作为“予非·睿知”平台底座,通过“模型+平台”模式破解知识分散、检索难等痛点,赋能政企业务协同与决策。此举为区域生成式AI合规应用与数字经济发展树立新标杆。

  • 深耕算力筑基开源生态 寒武纪赋能人工智能产业高质量发展

    银河证券研报指出,国家六张网加速推进,算力网成AI关键基础设施。寒武纪作为智能芯片龙头,具备云边端一体化系列产品。2025年营收64.97亿元,+453%;净利20.59亿扭亏。公司深入推理生态、适配主流大模型,拥抱开源,持续赋能AI产业高质量发展。

  • 聚焦技术突破与产业落地 人工智能与机器人两展四大奖项启动申报

    新一轮科技革命推进AI与机器人产业步入应用与产品化新阶段。第28届深圳高交会将设AI与机器人双馆,同步启动四大奖项评选,构建从底层技术突破到场景落地的完整评价链。评选旨在识别能转化为现实生产力的创新,重点考察原创性、工程化、市场验证与场景成效,推动产业从“展示创新”走向“兑现价值”。依托上届展会超45万人次、1700多亿元签约成果的国家平台,获奖者将获对接市场与资本支持,中国机器人产业正迈入“生态竞争”新阶段。

  • 智谱发布 GLM-5.3,自称编程最强的开源模型

    智谱在8月14日正式推出 GLM-5.3。有意思的是,这一版的基座模型跟 GLM-5.2其实是同一个,提升全靠后训练 Scaling 把智能上限往上拉,用了几十倍的长程任务环境、更丰富的环境类型,还有超长的后训练时间。 编程是这次最被拿来当卖点的能力。智谱称 GLM-5.3是编程能力最强的开源模型,内部体感评测比上代提升50%,在 Terminal Bench3.0、Agents' Last Exam(CLI)这些公开基准上拿到开

  • 超擎数智与香港中文大学(深圳)签署协议,共建人工智能和边缘计算联合实验室

    2026年8月3日,超擎数智与香港中文大学(深圳)正式签署联合实验室协议,共同成立港中大(深圳)-超擎数智人工智能和边缘计算联合实验室(CUHK-Shenzhen-ChaoQing Joint Laboratory of AI and Edge Computing),双方依托高校国际一流科研力量与企业产业落地能力强强联合,聚焦人工智能、边缘计算核心技术开展深度产学研用协同攻关,搭建集科研创新、人才培育、成果产业转化于一体的长效科�

  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

  • 能生成MV/音乐视频的AI音乐模型推荐:音潮V4.0、Suno、Udio 音乐模型、视频模型边界厘清

    文章澄清“能生成MV的AI音乐模型”易误解:Suno、Udio等只出音频,可灵、Runway等只出画面;真正音画同源一体化产品很少,音潮是国产落地较完整代表,其V4.0升级指令理解、纯音乐开放、十大语种覆盖,并支持一键MV与商用。选购需先分清三类边界,按需求匹配。

  • CANN全面开源开放,共赢AI技术生态

    8月15日,2026 CCF中国开源大会CANN分论坛在重庆举行,华为、南京大学、魔芯科技等专家共议开源生态。论坛以人才生态为主线,构建“学练赛证聘”一体化闭环,将产业需求前置培养环节;并围绕昇腾950分享CANNLab平台、算子工具、DeepSeek优化及三维世界模型等实践。未来将联动产学研,持续开放开源,降低创新门槛,加速AI落地。

  • 智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5

    智谱创始人几个小时前才说GLM-5.3很快发布,没想到中午就发了,相比当前的GLM-5.2提升50%,是开源最强的,编程与智能体性能接近Fable 5。 与之前传闻的不同,GLM-5.3跟GLM-5.2基座模型还是一样的7400多亿参数量,升级到万亿参数是没有的,有可能是留给GLM-5.5了,但这也没有妨碍GLM-5.3通过后训练来提升性能水平。 根据智谱说法,在多项主流基准测试中GLM-5.3是当前排名最高的开源�

今日大家都在搜的词: