首页 > 原创 > 关键词  > 人工智能最新资讯  > 正文

AI日报:即梦灰测图片3.1模型;ElevenLabs推出AI语音助理11ai;百度发布多智能体协同AI IDE

2025-06-24 16:39 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、细节控!即梦灰测图片3.1模型 电影感增强,风格化艺术感更强

即梦灰测的图片3.1模型,相比3.0版本,3.1模型在生成图片时表现出更强的电影感和故事感,场景更加丰富。对于艺术类提示词的响应效果也更好,比如在生成小女孩特写照片时,3.1模型的皮肤细节和环境氛围都更出色。此外,3.1模型在风格化艺术感上也有显著提升,能够更准确地识别和表达特定的视觉特征。然而,对于需要高度一致性的用户来说,3.0模型可能仍然更合适。目前3.1模型还在灰测中,预计很快会全量上线。

image.png

【AiBase提要:】

🎭3.1模型在艺术风格化上表现更精准,视觉特征更明确。

🖼️3.1模型生成的图片细节更真实,如皮肤、毛发和材质纹理。

🎬3.1模型增强了电影感和故事感,场景更丰富。

2、ElevenLabs隆重推出AI语音助理11ai:语音优先并支持集成MCP

ElevenLabs推出的11ai,它以语音优先的设计理念,结合强大的多语言支持和MCP协议,为用户提供了高度个性化的生产力工具。

【AiBase提要:】

🗣️11ai以语音交互为核心,支持超过5000种声音和自定义专属语音。

🔄 支持MCP多通道协议,可集成多种工具实现高度个性化工作流。

🌐 支持70多种语言,具备自动检测功能,适合全球市场应用。

3、文心快码发布多模态、多智能体协同AI IDE“Comate AI IDE”

文心快码发布Comate AI IDE,这是一款多模态、多智能体协同的AI开发工具,能够显著提高开发效率和编程体验。

image.png

【AiBase提要:】

🧠 AI辅助编码全流程,提升开发效率。

🌐 多智能体协同,支持自定义任务。

🎨 设计稿一键转代码,增强前端开发体验。

详情链接:https://comate.baidu.com/zh/download

4、苹果利用 “归一化流” 技术推出创新 AI 生图模型

苹果公司最新发布的论文,他们采用了归一化流技术来开发AI生图模型,这与传统扩散模型不同。TarFlow和STARFlow模型在图像生成方面有显著改进,特别是在处理文本提示时更加灵活高效。

image.png

【AiBase提要:】

🖼️ TarFlow 模型通过拆分图像块生成,避免了压缩造成的质量损失。

🚀 STARFlow 在潜空间工作,并支持调用现有语言模型优化文本提示处理。

🌟 苹果采用 “归一化流” 技术开发新的 AI 生图模型,区别于传统的扩散模型。

5、Grok Web即将推出“文件”选项卡,整合多类型文件管理

Grok Web即将推出的‘文件’选项卡,它将为用户提供一站式文件管理体验,整合图像、电子表格、文本和代码等多种文件类型,显著提升工作效率与便捷性。这一功能将简化文件管理流程,为专业人士和开发者提供直观的体验。

image.png

【AiBase提要:】

🖼️整合多种文件类型,提升工作效率。

💻提供统一界面,便于浏览、创建和编辑文件。

🚀增强功能性,满足多样化工作需求。

6、从文本生成到指令编辑 OmniGen2重塑开源多模态模型应用场景

VectorSpaceLab在Hugging Face平台开源全能多模态模型OmniGen2的创新举措。这款模型通过双组件架构和强大的视觉处理能力,为研究者和开发者提供了高效的可控生成式AI基础工具,展示了其在视觉理解、文本生成图像、指令引导图像编辑和上下文生成四大核心场景中的领先性能。

image.png

【AiBase提要:】

🧠 双组件架构结合视觉语言模型和扩散模型,实现高效可控生成式AI。

🎨 文本生成图像功能支持高保真、符合美学标准的图像生成。

🖼️ 指令引导图像编辑性能达到开源模型前沿水平,可完成复杂修改任务。

详情链接:https://huggingface.co/OmniGen2/OmniGen2

7、ScholAI重磅来袭!基于MCP的智能学术神器,革新论文研究新体验

ScholAI这款智能学术研究工具,它集成了论文查找、分析、管理、CCF排名查询及语义查询分析等功能,为研究人员提供了高效、智能的解决方案。其多源论文搜索和语义查询功能让我印象深刻,极大地提升了我的研究效率。

image.png

【AiBase提要:】

📚 多源论文搜索:支持从arXiv、专业会议及期刊等多个权威学术平台检索论文,覆盖计算机科学、生物医学等多个学科领域。

📊 自动获取CCF排名:内置CCF排名查询功能,用户可快速了解目标期刊或会议的学术影响力,助力投稿决策。

🧠 语义查询分析:通过自然语言处理技术,理解用户研究兴趣,精准匹配相关论文,提升检索效率。

详情链接:https://github.com/oDaiSuno/ScholAI

8、告别代码恐惧症!豆包推出可视化AI编程,拖拽即可创建网页应用

豆包推出的可视化AI编程功能,它让编程变得更加简单和直观,即使是没有任何编程经验的人也能轻松创建网页应用。这种创新不仅降低了编程门槛,还为更多人提供了使用AI辅助开发的机会。

image.png

【AiBase提要:】

🧩 豆包推出可视化AI编程功能,用户可直接在预览界面编辑网页应用。

⚙️ 该功能降低了编程门槛,使非技术背景用户也能快速搭建网页应用。

🚀 豆包的AI编程功能已支持多文件上传、GitHub仓库引入等专业功能。

9、饿了么推出智能AI助手 “小饿”,骑手工作更轻松

饿了么推出的AI助手“小饿”确实为骑手们带来了极大的便利。它不仅简化了工作流程,还提升了配送的安全性和效率。通过语音控制和智能分析,骑手们能够更专注于配送任务,而无需担心繁琐的操作。此外,“带教师傅”功能也为新手骑手提供了很好的支持,帮助他们更快适应工作。

image.png

【AiBase提要:】

🤖 通过语音唤醒“小饿”,骑手可轻松完成接单、确认到店等操作。

🌤️ 实时分析骑手位置和订单状态,主动推送天气预警和路线封路提示。

📈 根据历史数据和订单热力图,提供收入预估和优化接单策略的建议。

10、张雪峰直言:AI 能取代我最好!教育博主对未来充满信心

张雪峰在直播中表达了对AI发展的乐观态度,认为AI可以取代部分工作,但教育工作者仍需与考生和家长沟通,以更好地利用AI工具。

【AiBase提要:】

🧠 张雪峰表示:“能被取代 最好 !” 反映出他对 AI 的乐观态度。

🚀 AI 在高考志愿填报中取得了显著进展,但仍面临挑战。

🤝 教育工作者需与考生和家长加强沟通,帮助他们更好地运用 AI 工具。

11、微软重磅发布设备端小模型 Mu:3.3 亿参数小模型 Windows11 设置 AI 助手的智能引擎

微软推出 Mu 语言模型,为 Windows11 设置应用提供智能 AI 代理,实现自然语言交互,提升用户体验。

【AiBase 提要:】

✨ Mu 模型拥有 3.3 亿参数,专为简化 Windows 设置设计。

⚡ 高效本地处理,响应速度快,降低隐私风险。

🚀 未来将支持更多硬件平台,扩展用户群体。

举报

  • 相关推荐
  • AI日报:百度发布“绘想”平台与MuseSteamer;阿里音频驱动全身数字人模型OmniAvatar

    【AI日报】今日AI领域重要动态:1.开源语音大模型Step-Audio-AQAA发布,实现音频到语音的端到端自然转换;2.百度推出"绘想"平台与MuseSteamer,通过AI一键生成专业级视频;3.浙大与阿里联合发布OmniAvatar,音频驱动数字人技术取得突破;4.百度搜索迎十年来最大改版,新增智能框、百看和AI助手功能;5.xAI开发者控制台新增Grok4及Grok4Code引用,预示新一代AI模型即将发布;6.Gemin

  • AI日报:腾讯元宝升级一句话搜索图片视频;微信支付MCP上线;谷歌在全球推出 Veo 3

    【AI日报】今日AI领域重要动态:1)腾讯元宝升级,支持一句话搜索呈现图文视频;2)微信支付MCP上线,AI与支付结合开启商业新纪元;3)谷歌Veo3视频生成模型向Pro/Ultra会员开放,新增"照片生成视频"功能;4)开源DeepSeek R1增强版推理效率提升200%;5)美图WHEE推出"一句话修图"功能;6)芯片公司Ambiq申请美国IPO,受益生成式AI需求;7)昆仑万维开源奖励模型Skywork-Reward-V2;8)Kyutai发布超低延迟开源语音合成技术;9)Figma拟以200亿美元估值登陆纽交所;10)字节跳动开源Trae-Agent智能开发工具。

  • AI日报:腾讯混元3D 2.1大模型开源;字节跳动AI Lab负责人李航卸任;OpenAI Codex 全新升级

    本文介绍了AI领域最新动态:1)腾讯开源混元3D2.1大模型,提升3D生成质量;2)OpenAI Codex升级,优化代码生成功能;3)字节跳动AI Lab负责人李航卸任;4)微软发布700个AI应用案例;5)微软推出Code Researcher工具,解决58%系统崩溃问题;6)Observer AI实现屏幕操作自动化;7)Genspark发布AI浏览器;8)麻省理工用AI技术3.5小时修复15世纪名画;9)蚂蚁集团推出开源多模态GPT-4o模型Ming-Omni;10)MagicTryOn视频换衣框架;11)字节跳动发布实时互动AI视频生成模型Seaweed APT2;12)ChatGPT搜索功能升级;13)字节跳动与老凤祥合作开发AI智能眼镜。

  • 「6月30日AI日报」百度开源文心大模型4.5系列;通义千问发布多模态生成模型Qwen VLo

    AI日报精选:1)百度开源文心大模型4.5系列,含10款新模型,性能优异;2)通义千问发布多模态模型Qwen-VL,支持图文交互;3)阿里开源3亿参数多模态模型Ovis-U1;4)华为开源盘古7B稠密和72B混合专家模型;5)美图MOKI推出AI创意广告功能,一键生成专业视频;6)谷歌Gemini 2.5 Pro API重新免费开放;7)豆瓣上线"深入研究"AI功能;8)小米"AI百宝箱"结束内测;9)北京智研院开源多模态系统OmniGen2;10)知乎升级"直答"知识库功能。

  • 一场没有“罗永浩”的直播,为百度AI正名

    5500万GMV,这可能是迄今为止,一个AI数字人单次直播带来的最高销量。 过去几年内,数字人直播代替真人主播的传言总是一波又一波,空无一人的直播基地无数手机屏幕“自动地”产生着GMV,这个画面曾经击中了无数网友的心。但现实是,这些数字人们机械重复的动作、无法随机应变的话术反而让真人主播们都松了一口气。 但这次,真正的转折点来了。6月15日,罗永浩数字�

  • AI日报:阿里通义开源音频生成模型ThinkSound;谷歌Veo3支态图片生成视频;昆仑万维发布 Skywork-R1V 3.0

    【AI日报】今日AI领域重要动态:1)阿里开源支持链式推理的音频生成模型ThinkSound,实现高保真空间音频生成;2)谷歌Veo3升级,支持静态图片生成生动视频;3)Hugging Face发布30亿参数小模型SmolLM3,性能优于Llama-3.2-3B;4)阿里开源网络智能体WebSailor,展现强大推理和检索能力;5)Moonvalley发布原生1080P视频生成模型Marey Realism v1.5;6)Vidu Q1支持最多七张参考图像生成一致性视频;7)苹果�

  • AI日报:MiniMax发布视频智能体Hailuo Agent;昆仑万维开源 Skywork-SWE-32B;B站接入Qwen 3等模型

    本期AI日报聚焦多项AI领域创新:1)MiniMax推出视频Agent工具,支持文本生成高清视频及人脸驱动;2)昆仑万维开源Skywork-SWE-32B模型,提升软件工程任务表现;3)B站接入通义千问模型,推出数据分析智能体InsightAgent;4)ChatGPT深度整合Gmail与日历功能;5)腾讯云发布全链路AI开发平台"AI Builder";6)HeyGen推出UGC广告数字人功能;7)研究显示过度依赖AI或削弱批判性思维。此外还涵盖AI音乐生成、内容检测工具停运等动态,展现AI技术快速发展的多元应用与潜在影响。

  • 「6月27日AI日报」腾讯开源轻量级混元-A13B模型;可灵AI推“视频音效”功能

    AI日报主要内容: 1. 腾讯开源混元A13B模型,采用MoE架构,总参数量800亿,激活参数130亿,支持低端GPU部署 2. 可灵AI推出"视频音效"功能,实现所见即所听的沉浸体验 3. Black Forest开源图像编辑模型FLUX.1Kontext,支持消费级硬件运行 4. OpenAI发布Deep Research API新模型o3/o4-mini,支持自动化网页搜索和数据分析 5. 小米推出1999元起AI眼镜,集成拍摄、支付、音乐等功能 6. 迅雷推出下载MCP服务,一句话指令让AI自动完成下载任务 7. HeyGen推出AI视频Agent,几分钟内生成专业级视频内容 8. 谷歌开源端侧多模态大模型Gemma3n,手机也能运行云端AI性能

  • AI日报:Midjourney重磅推出视频生成模型V1;OpenAI将在今年夏季发布GPT-5;谷歌推Search Live语音搜索功能

    本期AI日报聚焦多项AI领域重要进展:1) Midjourney推出首款视频生成模型V1,支持21秒视频生成;2) OpenAI CEO确认GPT-5将于今夏发布;3) Google上线语音对话搜索功能Search Live;4) OpenAI开源客户服务代理框架;5) MiniMax发布智能代理Agent;6) 恶意工具WormGPT出现新变种;7) OpenAI推出企业版ChatGPT折扣;8) DeepSite V2支持3D网页动画生成;9) AI工具可秒变PPT;10) 比亚迪与字节跳动合作开发动力电池技术;11) 马斯克否认xAI巨额亏损传闻。

  • IDC发布中国金融大模型市场份额报告:百度智能云居首

    IDC最新报告显示,百度智能云以12.2%的市场份额位居中国金融行业生成式AI平台及解决方案厂商首位。2024年中国金融生成式AI市场规模预计达9.14亿元,百度智能云全年营收1.113亿元领跑行业。其全栈大模型解决方案覆盖基础设施、基础模型、生成平台及场景应用,已服务超600家金融机构,包括65%的央企客户。典型案例包括某头部银行构建的全行级知识检索平台,覆盖1.6万用户;银河证券部署的衍生品交易机器人累计处理询价26万次;泰康保险的AI智训系统有效提升代理人获客能力。百度通过"算力云+数据飞轮+模型平台+智能体生态"四轮驱动体系,构建了包含300+培训课程的人才认证体系,并与工信部教考中心联合颁发认证证书,当前持证学员超1万人。2025年Q1财报显示,百度智能云营收同比激增42%,金融领域成为核心增长引擎。