首页 > 业界 > 关键词  > OpenAI最新资讯  > 正文

AI日报:推理更强!OpenAI新模型o1发布;Midjourney 7.0一次可生8张图;开源语音模型Fish Speech 1.4发布

2024-09-13 15:31 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、OpenAI推出全新的模型系列OpenAI o1

OpenAI推出了全新的模型系列OpenAI o1,这个新模型在推理能力上表现得更加出色,为解决复杂问题提供了更强的推理能力。用户需要调整提示方式以适应o1模型的工作方式,提示工程发生了重大变革,用户需要给出简单直接的提示,避免使用思路链提示,使用分隔符来明确模型解析的部分,并限制额外上下文以避免复杂回答。

【AiBase提要:】

🤖 OpenAI o1模型需要简单、直接的提示,而非复杂的指导。

🧠 避免使用思路链提示,因为o1模型已经具备内部推理能力。

📑 使用分隔符来明确模型解析的部分,并限制额外上下文以避免复杂回答。

详情链接:https://openai.com/index/introducing-openai-o1-preview/

2、谷歌Gemini Live语音聊天向安卓用户免费开放,随时随地与AI聊天!

谷歌宣布Gemini Live语音聊天模式现在免费向所有安卓用户开放,这意味着每个人都可以体验智能对话AI的乐趣。用户可以随时用声音提问,甚至在回答过程中打断,为用户带来流畅的语音交互体验。Gemini Live为用户提供了一种新的交互方式,无论在家中还是外出,都能随时与AI进行有趣的对话。

【AiBase提要:】

🌟 Gemini Live语音聊天功能现在免费向所有安卓用户开放!

🗣️ 用户可以直接用声音提问,甚至在回答时打断。

🌍 目前仅支持英文,未来将在iOS上推出并支持更多语言。

3、Midjourney 7. 0 版本或在 2 个月内发布 一次性可生成 8 张图,正开发3D系统

Midjourney创始人David Holz在Discord上分享公司最新项目进展,强调技术创新以竞争AI图像生成领域。公司推迟发布7.0版本,但功能更丰富。重点在提高技术可访问性和工具专业使用价值。计划推出多图生成、图像编辑器、3D系统、个性化功能和视频生成。公司选择稳健发展道路,注重提升用户体验。

【AiBase提要:】

🚀7.0版本推迟但功能更丰富,重点在提高技术可访问性和工具专业使用价值。

🎨 新功能包括多图生成、图像编辑器、3D系统、个性化和视频生成,提升用户体验。

💡 Midjourney选择稳健发展道路,注重实用功能和用户体验,以保持竞争优势。

详情链接:https://top.aibase.com/tool/midjourneywangyeban

4、元象发布MoE开源大模型XVERSE-MoE-A36B

作为中国最大的Mixture of Experts(MoE)开源大模型,XVERSE-MoE-A36B的发布标志着中国在AI领域的重大进步,将国产开源技术提升至国际领先水平。该模型的性能和效率带来了训练时间的缩短、推理性能的提升,以及降低了AI应用的成本,为中小企业、研究者和开发者提供了更多选择机会。

image.png

【AiBase提要:】

🚀 XVERSE-MoE-A36B拥有255B总参数和36B激活参数,性能可与超过100B参数的大模型相媲美,实现了跨级的性能跃升。

💡 MoE架构通过组合多个细分领域的专家模型,打破了传统扩展定律的局限,保持了模型性能最大化,降低了计算成本。

📈 元象MoE在权威评测中超越了多个同类模型,包括国内千亿MoE模型Skywork-MoE、传统MoE霸主Mixtral-8x22B等。

详情链接:https://huggingface.co/xverse/XVERSE-MoE-A36B

5、Fish Speech1.4发布:开源TTS模型迎来多语言突破

Fish Speech1.4版本的发布标志着这款开源文本转语音(TTS)模型在多语言支持和性能方面取得了重大突破。更新展现了强大的技术实力和广阔的应用前景。

【AiBase提要:】

🌐 多语言支持大幅提升: 训练数据量翻倍至70万小时,支持8种主要语言,拓展了应用范围。

⚡ 性能与功能全面升级: 超快速度与低延迟,即时语音克隆功能,灵活部署选项和API服务。

🚀 应用前景广阔: 教育领域支持语言学习,娱乐产业即时语音克隆,辅助技术视障人士工具,智能客服和跨文化交流。

详情链接:https://fish.audio/zh-CN/auth/

6、告别幻觉!谷歌推新模型DataGemma,统计数据准确率暴涨58%

谷歌推出新的开源AI模型DataGemma,旨在解决大语言模型在处理统计数据时常出现的“幻觉”问题,标志着谷歌在AI领域的重要进展。DataGemma利用谷歌的数据共享平台,显著提升模型回答统计问题的准确性。初步测试显示,DataGemma在统计查询准确性方面有显著提升。

【AiBase提要:】

🌟 DataGemma模型旨在减少AI在统计查询中的错误,提高准确性。

📊 DataGemma利用Data Commons平台数据,增强模型回答的准确性。

🔍 DataGemma在初步测试中表现出显著的统计查询准确性提升。

详情链接:https://huggingface.co/collections/google/datagemma-release-66df7636084d2b150a4e6643

7、Jina AI推出Reader-LM小型语言模型

Jina AI推出的Reader-LM小型语言模型为将原始HTML内容转化为干净整洁的Markdown格式提供了便利,摆脱了繁琐的网页数据处理。该模型快速高效,自动剔除杂乱内容,展现出优异性能和高准确性。

image.png

【AiBase提要:】

✨ Reader-LM能快速高效转换网页内容为Markdown,无需复杂规则或正则表达式。

🔍 提供两个参数模型,优化HTML转Markdown任务,性能超越大型模型。

💡 具备强大长上下文处理能力,在资源受限环境中也能高效运行。

详情链接:https://jina.ai/news/reader-lm-small-language-models-for-cleaning-and-converting-html-to-markdown/

8、估值2000万美元!AI工具Shopsense AI 支持拍照就能买到明星同款

在MTV音乐录像带大奖(VMAs)上,观众们通过Shopsense AI技术可以即时购买明星造型相似的服装,展现出未来购物体验的可能性。虽然技术仍需提升准确性,但Shopsense正不断改进,以与其他媒体公司竞争。其商业模式多元,通过点击付费和销售分成获取收入,市场潜力巨大。

image.png

【AiBase提要:】

🌟 观众可通过上传照片获取与明星造型相似的商品推荐,包括高端和亲民选择。

🛍️ Shopsense AI计划扩展到旅游、运动等其他领域的商品推荐,实现内容与购物的无缝连接。

📈 Shopsense AI与Paramount合作,为观众提供即时购买明星造型相似服装的便利体验。

9、一场商标之战!谷歌因使用 “Gemini” 标名称被起诉侵权

最近,谷歌因其新推出的 AI 服务 “Gemini” 而被一家名为 Gemini Data 的公司起诉,指控其侵犯商标权。这起纠纷揭示了大型科技公司在商标使用上的挑战和法律风险,警示企业在命名新产品或服务时需谨慎考虑已有商标。

【AiBase提要:】

🌟 谷歌因使用 “Gemini” 商标被 Gemini Data 起诉,指控其侵犯商标权。

🔍 谷歌在申请商标时遭到拒绝,因该名称与其他商标相似。

🤖 谷歌的 Gemini 聊天机器人承认正在侵犯商标,反映出双方的法律纠纷。

10、阿联酋国有投资公司 MGX 考虑向 OpenAI 投资数十亿美元

阿联酋国有投资公司MGX考虑向OpenAI投资数十亿美元,这一举动将进一步推动OpenAI的融资计划,显示出OpenAI强劲的商业表现。同时,MGX的成立旨在加速人工智能和先进技术的发展,巩固阿联酋在全球科技领域的领先地位。

【AiBase提要:】

💰 MGX考虑向OpenAI投资数十亿美元,推动OpenAI融资计划。

🤖 OpenAI年化经常性收入达40亿美元,展现强劲商业表现。

🌍 MGX由穆巴达拉与G42共同创办,专注于人工智能和先进技术的发展。

11、强得可怕!有人测试用OpenAI o1解答高中数学期末考题,竟全对了

这篇文章介绍了一位Reddit网友使用OpenAI最新模型OpenAI o1解答高中数学题的惊人效果。他对人工智能的能力充满好奇,通过测试发现OpenAI o1在短时间内准确解答了中国高中数学考题,引起了网友的关注与讨论。结果显示了AI在处理复杂数学问题上的强大能力,引发了对AI未来应用前景的讨论。

image.png

【AiBase提要:】

🤖 AI能力惊人:OpenAI o1在短时间内准确解答高中数学考题,全对

💡 科技进步引发思考:网友对AI未来发展提出疑问,讨论教育领域的影响

🌐 智能化学习辅助:AI在教育领域有巨大潜力,为学生提供智能化学习辅助

举报

  • 相关推荐
  • AI日报:豆包大模型1.6发布;OpenAI推o3-pro模型、o3价格暴降80%;Figma官方MCP重磅上线

    【AI日报】今日AI领域重要动态:1)火山引擎发布豆包大模型1.6和视频生成模型Seedance1.0pro,性能显著提升;2)OpenAI推出o3-pro模型,专注可靠性但响应较慢;3)Figma推出Dev Mode MCP服务,实现设计到代码一键转换;4)Krea AI发布图像生成模型Krea1,解决传统AI绘图问题;5)火山引擎豆包日调用量突破16.4万亿次;6)法国Mistral发布推理模型Magistral;7)苹果系统整合ChatGPT图像生成功能;8)OpenAI大幅下调o3价格80%并推出o3-pro;9)Hugging Face开源榜单显示中国团队Qwen与DeepSeek进入全球前15;10)阿里开源MaskSearch框架,提升AI解决复杂问题能力。

  • AI日报:腾讯混元图像2.0毫秒级生图;Windsurf重磅发布SWE-1系列;MiniMax Speech-02登顶全球TTS榜首

    本期AI日报重点报道了多项AI领域最新进展:1)腾讯发布混元图像2.0模型,实现毫秒级图像生成;2)Windsurf推出全流程软件工程AI模型SWE-1系列;3)DeepSeek发布V3模型论文,揭示低成本训练大模型方法;4)Manus推出图像生成Agent,支持多工具协同完成任务;5)ElevenLabs发布可定制音效控制面板工具;6)MiniMax语音模型Speech-02超越OpenAI和ElevenLabs;7)DeepL升级翻译服务并推出写作助手;8)OpenAI占据AI工具市场80%份额;9)Llamafile 0.9.3支持Qwen3模型;10)Hugging Face推出WebGPU驱动的实时摄像头AI SmolVLM;11)Hugging Face上线免费MCP教程;12)复旦与腾讯联合推出视频生成工具DICE-Talk。

  • AI日报:通义千问开源Qwen3向量模型;字节跳动图像编辑模型SeedEdit 3.0;ElevenLabs推v3语音模型

    本文汇总了近期AI领域的重要动态:1)通义千问发布Qwen3-Embedding系列模型,在多语言文本处理表现优异;2)字节跳动推出图像编辑模型SeedEdit3.0,提升细节保持能力;3)ElevenLabs发布情感语音合成系统Eleven v3 Alpha;4)Anthropic推出面向国家安全的Claude Gov模型;5)可灵AI月收入连续两月超1亿元;6)Meta公布智能眼镜Aria Gen2技术细节;7)爱诗科技上线AI视频工具"拍我AI";8)富国银行预测2030年ChatGPT广告收入将达千亿美元。

  • AI日报:ChatGPT支持MCP和会议记录功能;Cursor 1.0 版本重磅发布;Midjourney视频功能将在本月上线

    本期AI日报聚焦多项AI领域突破:1)OpenAI为ChatGPT新增企业数据连接和会议记录功能;2)Cursor 1.0发布集成BugBot等开发工具;3)Midjourney即将推出视频生成功能;4)秘塔AI搜索新增PPT导出功能;5)Manus推出文本生成视频工具挑战Sora;6)法国Mistral发布企业级编程助手;7)英伟达推出文档处理专用AI模型;8)腾讯公益引入大模型提升互动体验;9)Firecrawl推出网页抓取API工具;10)Bland AI实现超真实语音克隆;11)报告显示AI训练成本逼近百亿美元;12)开源设计工具Jaaz支持批量图像生成;13)《逆水寒》手游接入AI实现图片动效玩法。

  • DeepSeek更新R1推理AI模型,已发布Hugging Face

    更新后的 R1 拥有 6850 亿个参数,体量庞大。由于模型规模极大,普通消费者级别的硬件很可能无法直接运行。

  • AI日报:阿里开源长文本深度思考模型QwenLong-L1;GPT-4o语音模式上线唱歌功能;秘塔AI搜索推出全新“极速”模型

    本文汇总了AI领域最新动态:1)中国信通院发布智能体开发标准,推动AI商业化进程;2)阿里推出QwenLong-L1-32B长文本推理模型,性能媲美Claude-3;3)GPT-4o语音模式升级,新增唱歌功能;4)秘塔AI搜索推出极速模型,响应速度达400tokens/秒;5)谷歌发布LMEval评估框架,统一大模型评测标准;6)Chrome浏览器集成Gemini AI助手;7)阿联酋全民免费使用ChatGPT Plus;8)苏州成立60亿元AI产业基金;9)法国Kyutai实验室推出10秒定制语音的Unmute系统;10)UAV-Flow项目实现无人机语音精准控制;11)Claude将升级支持百万字上下文和记忆功能;12)百度心响iOS版上线;13)夸克推出高考深度搜索功能;14)Chrome v137开发者工具升级;15)美团AI业务接近GPT-4o水平;16)Direct3D-S2实现3D生成速度提升10倍;17)OpenAI计划2026年推出首款AI硬件。

  • AI日报:DeepSeek开源新版R1-0528;字节发布图像Agent小云雀AI;可灵2.1重磅上线

    本期AI日报聚焦多项AI领域突破:1)DeepSeek发布R1-0528模型,支持128K上下文且性能媲美GPT-4;2)字节推出"小云雀AI"图像创作工具;3)可画2.1版本价格降65%性能提升;4)Opera发布全球首款AI浏览器Neon;5)Meta推出多模态空间理解模型;6)北大团队研发ZeroSearch框架降低大模型训练成本88%;7)字节推出AI视频剪辑应用"剪小映";8)MotionPro实现40ms/帧精准视频控制;9)xAI与Telegram达成3亿美元合作部署Grok聊天机器人;10)OpenAI重组架构为IPO铺路;11)像素蛋糕"方糖大模型"获国内首个影像行业备案;12)Paper2Poster实现论文自动转海报;13)Resemble AI开源TTS模型性能比肩ElevenLabs;14)蚂蚁集团开源对标GPT-4o的多模态模型Ming-lite-omni。

  • AI日报:昆仑万维天工超级智能体发布;OpenAI核心API支持MCP;百度飞桨PaddleOCR 3.0开源

    【AI日报】汇总了近期AI领域重要动态:1)百度飞桨发布PaddleOCR3.0,提升文字识别精度13%;2)昆仑万维发布天工超级智能体,AI办公成本仅为OpenAI的40%;3)OpenAI API新增MCP支持简化开发流程;4)xAI推出实时网页搜索API;5)谷歌Sparkify可将问题秒变动画;6)Mistral发布高效代码模型Devstral;7)Video Ocean推出4K视频生成工具;8)谷歌推出AI内容识别工具SynthID;9)谷歌NotebookLM使用量半年增长56%;10)硅基流动升级128K长文本模型;11)DeepMind发布音乐生成模型Lyria2;12)多模态大模型MMaDA实现跨模态推理;13)微软发布网页智能体Magentic-UI;14)Framer推出AI建站套件。

  • 小米玄戒O1发布 雷军:目前体验超出我预期 欢迎大家评测

    小米发布首款3nm旗舰芯片玄戒O1,成为全球第四家拥有自研手机SoC的厂商。该芯片采用24核四丛集CPU设计,集成190亿晶体管,安兔兔跑分超300万。雷军表示其GPU功耗比苹果A18 Pro降低35%,CPU性能功耗比达到当前3nm旗舰芯片第一梯队水平。极客湾评测显示玄戒O1在中低负载场景表现突出,整体表现远超预期。雷军坦言与苹果A18 Pro仍有差距,但强调"一点点超越都很难得"。该芯片将搭载于小米15系列手机。

  • OpenAI 提升o3多模态模型推理实力,微美全息(WIMI.US)加速引领产业新变革征程

    OpenAI推出突破性的o3推理模型,首次实现图像直接融入推理过程,在多模态基准测试V* Bench上准确率达95.7%。DeepSeek完成R1模型升级,上下文窗口从12K扩展至23K,幻觉率降低45%-50%。行业呈现开源趋势,DeepSeek开源策略促使多家企业跟进,OpenAI也考虑开源。微美全息加速布局多模态大模型,计划提供实时多模态AI体验。专家指出AI发展重心正从大模型向智能体演进,开源技术显著降低训练门槛,提升泛化能力,为多模态智能探索开辟新路径。企业需紧跟趋势把握机遇,在大模型驱动的新时代找准定位。