首页 > 原创 > 关键词  > AI日报最新资讯  > 正文

AI日报:可灵AI发布数字人新功能;腾讯混元新技术给大模型 “去油”;抖音上线AI求真功能

2025-09-18 16:19 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解https://app.aibase.com/zh

1、可灵AI发布数字人新功能:一张图片生成 1 分钟高清视频

可灵AI推出的数字人功能实现了从静态图片到动态视频的突破,用户只需提供角色图片和文字或音频输入,即可快速生成高质量视频。该技术基于多模态理解和视频生成模型,支持多种角色创建和多语种处理,为内容创作、教育培训和企业宣传提供了新的可能性。

image.png

【AiBase提要:】

📷 可灵AI推出数字人功能,实现静态图片到动态视频的转变。

🎙️ 支持多语种处理,涵盖中文、英语、日语、韩语等语言。

💡 降低视频制作门槛,让普通用户也能轻松创建专业水准的数字人视频。

详情链接:https://klingavatar.github.io/

2、腾讯混元新技术给大模型 “去油”,让AI生成图像更真实!

腾讯混元团队与香港中文大学(深圳)及清华大学合作,推出了SRPO技术,旨在提升AI生成图像的真实感,解决Flux模型在人物皮肤质感上的问题。该技术引入了“语义相对偏好优化”策略,并采用Direct-Align策略优化生成轨迹,显著提升了图像质量与训练效率。

image.png

【AiBase提要:】

🧪 引入“语义相对偏好优化”策略,通过正向和负向词汇引导信号以中和奖励模型的偏差。

📈 采用Direct-Align策略,注入可控噪声并利用其作为参考锚点进行图像重建,显著降低重建误差。

⚡ SRPO技术训练效率极高,仅需10分钟便能超越现有方法,真实度和美学评分提升超过三倍。

详情链接:https://tencent.github.io/srpo-project-page/

3、IBM 发布 Granite-Docling-258M:开源企业级文档 AI 模型

IBM 推出的 Granite-Docling-258M 是一个开源的视觉语言模型,专注于端到端文档转换。它能够保持文档的布局信息,提取表格、代码、公式等元素,并输出结构化的机器可读格式,相较于传统 OCR 技术有显著提升。

【AiBase提要:】

🌟 新模型 Granite-Docling-258M 旨在提高文档转换精度,并保持布局信息。

🔧 采用先进的技术架构,相较于前版本 SmolDocling 在多个领域表现出色。

🌍 新增对多种语言的支持,增强了模型的应用范围和灵活性。

详情链接:https://huggingface.co/collections/ibm-granite/granite-docling-682b8c766a565487bcb3ca00

4、Meta发布首款带屏幕AI眼镜Ray-Ban :随身佩戴的智能助理

Meta 推出首款带屏幕的 AI 眼镜 Ray-Ban,旨在提供更便捷的智能体验,并与神经腕带结合实现精准操控,进一步减少对移动设备的依赖。

image.png

【AiBase提要:】

📱 右侧镜片内置显示屏,可呈现应用程序、提醒和导航信息。

🧠 与神经腕带搭配使用,通过肌电图技术实现精准操控。

🌐 支持连接云端,可在眼镜上使用 Meta 旗下应用及查看路线和实时翻译。

5、DeepSeek 论文登上 Nature 封面,AI 大模型首次通过同行评审

DeepSeek R1的研究论文成功登上《Nature》封面,标志着大语言模型首次通过权威同行评审,为AI行业树立了新的学术标准。该模型通过强化学习实现自主演化,提升了推理能力,并在数学竞赛中表现出色。

【AiBase提要:】

🧠 DeepSeek R1通过强化学习在自主环境中自我演化,发展出复杂的推理能力。

📊 在AIME2024数学竞赛中,DeepSeek-R1的表现从15.6%跃升至71.0%,达到与OpenAI模型相当的水平。

🛠️ DeepSeek团队采用了结合拒绝采样和监督微调的多阶段训练框架,提升模型写作能力和整体表现。

6、OpenAI宣布ChatGPT 网页端新增 GPT-5 Thinking 调整功能

OpenAI推出了全新的‘Thinking 调整功能’,允许用户根据需求选择GPT-5模型的思考时长,从而平衡回复速度与智能程度。此外,OpenAI还在积极开发儿童版ChatGPT,以确保未成年人使用安全。

image.png

【AiBase提要:】

🌟 新功能上线:ChatGPT网页端推出可调节思考时长的功能,提升用户体验。

🛠️ 多种模式选择:用户可以选择标准、扩展、轻量或重度模式,以满足不同的交流需求。

👶 儿童版开发:OpenAI正在研发儿童版ChatGPT,确保未成年人在使用中的安全。

7、抖音上线 “AI求真” 功能,助你辨别谣言,寻找真相!

抖音推出“AI求真”功能,旨在帮助用户辨别谣言并寻找真相,提升信息透明度和用户保护能力。

【AiBase提要:】

🧠 AI 抖音求真功能上线,帮助用户识别和澄清误导性信息。

🔍 用户可点击链接跳转至“求真卡”页面获取完整信息。

📢 平台通过谣言治理大模型和辟谣团队提升信息透明度。

8、通义DeepResearch发布!全开源AI模型让研究更简单

通义 DeepResearch 团队发布的全开源AI模型在多个权威基准测试中表现出色,其性能甚至超过了许多国际知名模型,同时通过开放的方式推动了AI研究的发展。

image.png

【AiBase提要:】

🧠 通义 DeepResearch 团队发布了全开源AI模型,使AI从“能聊天”跃升至“会做研究”。

🚀 在多个权威基准测试中取得先进成绩,模型性能超越许多国际知名模型。

🌐 模型、框架及方案完全开源,为全球科技社区提供开放合作的范例。

举报

  • 相关推荐
  • AI日报:HeyGen发布AI视频翻译引擎;科大讯飞推星火 X1.5;QQ浏览器推出AI+小窗

    本期AI日报聚焦多项技术突破:HeyGen推出精准唇形同步的视频翻译引擎;科大讯飞发布星火X1.5大模型,提升多语言处理能力;QQ浏览器新增AI助手浮窗;科大讯飞推出软硬一体方案,实现高噪声环境精准识别;谷歌Gemini 3 Pro预览版支持百万级上下文窗口;Comfy Cloud让Stable Diffusion实现零门槛创作;谷歌Gemini新增深度研究功能,可整合邮件生成智能报告;上海AgiBot机器人10分钟完成复杂制造任务,重塑生产效率。

  • 短视频加速跑入AI时代

    「现在是西天取经的第996天,刚把师父从妖怪嘴里救出来,师父身上都还是热乎的,我们就马不停蹄开始出发了。」在抖音,都能看到《西游记》里师徒四人的取经vlog了。 采访高考完刚出考场的爱因斯坦、孟德尔、门捷列夫;慈溪逛颐和园Vlog、大禹治水现场直播,各种AI生成的视频成为网友「玩梗搞抽象」的核心生产力。 尽管在专业影视

  • 长视频,要MCN化?

    过去十多年,长视频平台习惯用头部综艺与大剧撬动增长:内容够强,自然破圈,声量带动会员与广告。 这套“内容中心逻辑”曾行之有效。 但短视频重写了注意力分配。用户不再愿意投入整段时间追一个叙事,三十秒的情绪刺激就足以满足娱乐需求。内容生命周期被压缩,哪怕是重金制作,也可能上线当周见顶、难以延展。 在这种环境下,平台不得不寻找新的增长方式。�

  • Sora App的AI视频社交,给了百度们新希望

    Sora2发布两周后,百度的蒸汽机AI视频模型,和谷歌Veo3.1撞了档期。 两家公司选择同期发布并非有多默契,而是Sora2带来的压迫感促使它们不得不加快脚步。 奥尔特曼将形容Sora2为“创意领域的ChatGPT3.5时刻”,不仅在物理逻辑、画面连贯性、真实感和音画同步等方面实现了质的飞跃,还把Sora从一个“文本到视频”的工具进化成一个“创意到生态”的平台。 这无疑是扔在AI视�

  • AI日报:广电整治AI动画乱象;360发布大模型安全白皮书;百度推出小度AI眼镜Pro

    国家广电总局宣布自2026年3月起全面整治AI生成内容,要求AIGC作品纳入分类分层审核体系。360发布《大模型安全白皮书》,提出全链路AI安全防线应对新型威胁。百度推出2299元小度AI眼镜Pro,集成智能翻译等多项功能。StepFun开源音频编辑模型Step-Audio-EditX,实现文本化语音编辑。Grok新增纯文本生成视频功能,17秒可生成带特效视频片段。研究发现谷歌Veo-3模型能生成逼真手术视频但缺乏医学逻辑。阿里Qwen3-Max-Thinking在全球数学竞赛夺冠,并在加密货币交易中取得显著回报。OpenAI推出轻量化GPT-5 Codex Mini模型,优化开发者体验。

  • 从SEO到GEO的范式革命,《生成式AI时代 品牌战略指南》白皮书正式发布

    11月4日,《生成式AI时代+品牌战略指南》白皮书发布,聚焦企业AI搜索优化需求。白皮书提出GEO全链路解决方案,结合E-E-A-T信任框架和3C指导法则,帮助企业破解AI搜索覆盖率低、合规风险高等痛点,推动从流量竞争转向价值竞争,构建可持续增长生态。

  • 逗哥配音团队:以硬核技术铺就AI创作未来,重塑短视频创作生态

    逗哥配音平台凭借AI语音技术革新,为短视频创作者提供全方位赋能。平台集成上千款覆盖多年龄风格的真人声音资源,支持多语言合成,具备媲美真人的情感表达能力。其核心功能包括AI角色分配、5秒极速克隆及20项精细调节工具,结合去水印、字幕生成等实用功能,实现一站式创作。已获超百位大V推荐,用户量破千万,累计播放量达十万亿级,显著降低创作门槛,助力各领域内容生产。团队将持续优化技术,拓展功能生态。

  • AI搜索可见性监控:品牌在生成式搜索时代的生存新法则

    AI搜索正颠覆传统SEO:58.5%的谷歌搜索已是零点击,用户看完AI摘要即离开。ChatGPT日处理超100亿查询,预计2030年流量将超谷歌。品牌需监控AI平台推荐情况,传统工具无法追踪豆包、通义千问等国产AI。建议建立监控体系:测试核心问题曝光率,每周追踪排名变化,持续优化内容。数据显示71%美国人用AI辅助购物决策,流量正加速从谷歌转向AI。生存法则很简单:看不见的,等于不存在。

  • AI日报:上海首例涉AI提示词著作权案宣判;Kimi K2 Thinking发布;中文图像编辑新王UniWorld-V2发布

    今日AI领域动态:上海首例AI提示词著作权案宣判,法院认定提示词不具独创性;月之暗面发布Kimi K2思考模型,实现自主多轮工具调用;UniWorld-V2图像编辑模型支持中文框选即改,性能超越GPT-Image;谷歌推出AI文件检测工具Magika 1.0,支持超200种格式;Sora安卓版首日下载量达47万次;我国发布全球首个AI海洋大模型“瞰海”,可精准预测10天内海洋变化;宇树科技“Embodied Avatar”系统实现低延迟远程机器人操控;谷歌Gemini API推出文件搜索工具,简化私有RAG系统集成。

  • “AI+文旅”释放赋能效应,数字王国推动综合型体验落地上海

    全球顶级视觉特效公司数字王国计划联合多家国际企业,在上海打造以人工智能为技术支撑、融合多个国际知名IP的综合性文旅项目。该公司拥有30年虚拟人、视觉特效技术积累,曾获奥斯卡奖项,并开发虚拟人邓丽君等经典IP。项目将结合VR/AR/MR技术,推出沉浸式体验,并计划引入好莱坞电影IP及中国原创文化内容,构建全球化沉浸体验空间。此举旨在推动科技与文化融合,助力上海静安、杨浦两区打造城市新地标与文旅新生态。

今日大家都在搜的词: