首页 > 业界 > 关键词  > OpenAI最新资讯  > 正文

AI日报:推理更强!OpenAI新模型o1发布;Midjourney 7.0一次可生8张图;开源语音模型Fish Speech 1.4发布

2024-09-13 15:31 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、OpenAI推出全新的模型系列OpenAI o1

OpenAI推出了全新的模型系列OpenAI o1,这个新模型在推理能力上表现得更加出色,为解决复杂问题提供了更强的推理能力。用户需要调整提示方式以适应o1模型的工作方式,提示工程发生了重大变革,用户需要给出简单直接的提示,避免使用思路链提示,使用分隔符来明确模型解析的部分,并限制额外上下文以避免复杂回答。

【AiBase提要:】

🤖 OpenAI o1模型需要简单、直接的提示,而非复杂的指导。

🧠 避免使用思路链提示,因为o1模型已经具备内部推理能力。

📑 使用分隔符来明确模型解析的部分,并限制额外上下文以避免复杂回答。

详情链接:https://openai.com/index/introducing-openai-o1-preview/

2、谷歌Gemini Live语音聊天向安卓用户免费开放,随时随地与AI聊天!

谷歌宣布Gemini Live语音聊天模式现在免费向所有安卓用户开放,这意味着每个人都可以体验智能对话AI的乐趣。用户可以随时用声音提问,甚至在回答过程中打断,为用户带来流畅的语音交互体验。Gemini Live为用户提供了一种新的交互方式,无论在家中还是外出,都能随时与AI进行有趣的对话。

【AiBase提要:】

🌟 Gemini Live语音聊天功能现在免费向所有安卓用户开放!

🗣️ 用户可以直接用声音提问,甚至在回答时打断。

🌍 目前仅支持英文,未来将在iOS上推出并支持更多语言。

3、Midjourney 7. 0 版本或在 2 个月内发布 一次性可生成 8 张图,正开发3D系统

Midjourney创始人David Holz在Discord上分享公司最新项目进展,强调技术创新以竞争AI图像生成领域。公司推迟发布7.0版本,但功能更丰富。重点在提高技术可访问性和工具专业使用价值。计划推出多图生成、图像编辑器、3D系统、个性化功能和视频生成。公司选择稳健发展道路,注重提升用户体验。

【AiBase提要:】

🚀7.0版本推迟但功能更丰富,重点在提高技术可访问性和工具专业使用价值。

🎨 新功能包括多图生成、图像编辑器、3D系统、个性化和视频生成,提升用户体验。

💡 Midjourney选择稳健发展道路,注重实用功能和用户体验,以保持竞争优势。

详情链接:https://top.aibase.com/tool/midjourneywangyeban

4、元象发布MoE开源大模型XVERSE-MoE-A36B

作为中国最大的Mixture of Experts(MoE)开源大模型,XVERSE-MoE-A36B的发布标志着中国在AI领域的重大进步,将国产开源技术提升至国际领先水平。该模型的性能和效率带来了训练时间的缩短、推理性能的提升,以及降低了AI应用的成本,为中小企业、研究者和开发者提供了更多选择机会。

image.png

【AiBase提要:】

🚀 XVERSE-MoE-A36B拥有255B总参数和36B激活参数,性能可与超过100B参数的大模型相媲美,实现了跨级的性能跃升。

💡 MoE架构通过组合多个细分领域的专家模型,打破了传统扩展定律的局限,保持了模型性能最大化,降低了计算成本。

📈 元象MoE在权威评测中超越了多个同类模型,包括国内千亿MoE模型Skywork-MoE、传统MoE霸主Mixtral-8x22B等。

详情链接:https://huggingface.co/xverse/XVERSE-MoE-A36B

5、Fish Speech1.4发布:开源TTS模型迎来多语言突破

Fish Speech1.4版本的发布标志着这款开源文本转语音(TTS)模型在多语言支持和性能方面取得了重大突破。更新展现了强大的技术实力和广阔的应用前景。

【AiBase提要:】

🌐 多语言支持大幅提升: 训练数据量翻倍至70万小时,支持8种主要语言,拓展了应用范围。

⚡ 性能与功能全面升级: 超快速度与低延迟,即时语音克隆功能,灵活部署选项和API服务。

🚀 应用前景广阔: 教育领域支持语言学习,娱乐产业即时语音克隆,辅助技术视障人士工具,智能客服和跨文化交流。

详情链接:https://fish.audio/zh-CN/auth/

6、告别幻觉!谷歌推新模型DataGemma,统计数据准确率暴涨58%

谷歌推出新的开源AI模型DataGemma,旨在解决大语言模型在处理统计数据时常出现的“幻觉”问题,标志着谷歌在AI领域的重要进展。DataGemma利用谷歌的数据共享平台,显著提升模型回答统计问题的准确性。初步测试显示,DataGemma在统计查询准确性方面有显著提升。

【AiBase提要:】

🌟 DataGemma模型旨在减少AI在统计查询中的错误,提高准确性。

📊 DataGemma利用Data Commons平台数据,增强模型回答的准确性。

🔍 DataGemma在初步测试中表现出显著的统计查询准确性提升。

详情链接:https://huggingface.co/collections/google/datagemma-release-66df7636084d2b150a4e6643

7、Jina AI推出Reader-LM小型语言模型

Jina AI推出的Reader-LM小型语言模型为将原始HTML内容转化为干净整洁的Markdown格式提供了便利,摆脱了繁琐的网页数据处理。该模型快速高效,自动剔除杂乱内容,展现出优异性能和高准确性。

image.png

【AiBase提要:】

✨ Reader-LM能快速高效转换网页内容为Markdown,无需复杂规则或正则表达式。

🔍 提供两个参数模型,优化HTML转Markdown任务,性能超越大型模型。

💡 具备强大长上下文处理能力,在资源受限环境中也能高效运行。

详情链接:https://jina.ai/news/reader-lm-small-language-models-for-cleaning-and-converting-html-to-markdown/

8、估值2000万美元!AI工具Shopsense AI 支持拍照就能买到明星同款

在MTV音乐录像带大奖(VMAs)上,观众们通过Shopsense AI技术可以即时购买明星造型相似的服装,展现出未来购物体验的可能性。虽然技术仍需提升准确性,但Shopsense正不断改进,以与其他媒体公司竞争。其商业模式多元,通过点击付费和销售分成获取收入,市场潜力巨大。

image.png

【AiBase提要:】

🌟 观众可通过上传照片获取与明星造型相似的商品推荐,包括高端和亲民选择。

🛍️ Shopsense AI计划扩展到旅游、运动等其他领域的商品推荐,实现内容与购物的无缝连接。

📈 Shopsense AI与Paramount合作,为观众提供即时购买明星造型相似服装的便利体验。

9、一场商标之战!谷歌因使用 “Gemini” 标名称被起诉侵权

最近,谷歌因其新推出的 AI 服务 “Gemini” 而被一家名为 Gemini Data 的公司起诉,指控其侵犯商标权。这起纠纷揭示了大型科技公司在商标使用上的挑战和法律风险,警示企业在命名新产品或服务时需谨慎考虑已有商标。

【AiBase提要:】

🌟 谷歌因使用 “Gemini” 商标被 Gemini Data 起诉,指控其侵犯商标权。

🔍 谷歌在申请商标时遭到拒绝,因该名称与其他商标相似。

🤖 谷歌的 Gemini 聊天机器人承认正在侵犯商标,反映出双方的法律纠纷。

10、阿联酋国有投资公司 MGX 考虑向 OpenAI 投资数十亿美元

阿联酋国有投资公司MGX考虑向OpenAI投资数十亿美元,这一举动将进一步推动OpenAI的融资计划,显示出OpenAI强劲的商业表现。同时,MGX的成立旨在加速人工智能和先进技术的发展,巩固阿联酋在全球科技领域的领先地位。

【AiBase提要:】

💰 MGX考虑向OpenAI投资数十亿美元,推动OpenAI融资计划。

🤖 OpenAI年化经常性收入达40亿美元,展现强劲商业表现。

🌍 MGX由穆巴达拉与G42共同创办,专注于人工智能和先进技术的发展。

11、强得可怕!有人测试用OpenAI o1解答高中数学期末考题,竟全对了

这篇文章介绍了一位Reddit网友使用OpenAI最新模型OpenAI o1解答高中数学题的惊人效果。他对人工智能的能力充满好奇,通过测试发现OpenAI o1在短时间内准确解答了中国高中数学考题,引起了网友的关注与讨论。结果显示了AI在处理复杂数学问题上的强大能力,引发了对AI未来应用前景的讨论。

image.png

【AiBase提要:】

🤖 AI能力惊人:OpenAI o1在短时间内准确解答高中数学考题,全对

💡 科技进步引发思考:网友对AI未来发展提出疑问,讨论教育领域的影响

🌐 智能化学习辅助:AI在教育领域有巨大潜力,为学生提供智能化学习辅助

举报

  • 相关推荐
  • OpenAI发布语音模型GPT-realtim:具备情感感知能力 多语言无缝切换

    OpenAI正式发布语音模型GPT-realtime。 据介绍,GPT-realtime是一款专注于语音AI Agent的多模态模型,能够生成高度自然流畅的语音,精准还原人类语调、情感和语速的丰富变化。该模型支持图像理解,并可结合语音或文本对话使用,非常适合应用于客服、教育、金融、医疗等领域,用于构建高质量的语音智能体。 官方表示,新模型在复杂指令遵循、工具精确调用以及生成更自然、�

  • OpenAI的开源模型现已在IBM watsonx.ai上提供

    OpenAI发布两款开源AI模型GPT-OSS-120B和GPT-OSS-20B,允许开发者自由下载、运行和定制。其中120B模型已部署在IBM Watsonx.ai平台,采用专家混合架构,支持本地或云端部署,不受商业用途限制。模型具备高透明度,输出完整推理链,在多项基准测试中表现优异。此次发布标志着OpenAI首次加入开源生态,IBM强调其开放战略,为企业提供灵活、安全的AI开发选择。

  • OpenAI CEO:GPT-6将具备个性化记忆 记住用户偏好习惯

    OpenAI的首席执行官萨姆奥尔特曼(Sam Altman)在近日的一次专访中,透露了下一代大模GPT-6的最新进展。他表示,GPT-6 的开发正在积极推进中,其发布节奏将比从GPT-4到GPT-5的周期更快。 奥尔特曼特别强调,GPT-6将不再局限于单纯回答问题,而是朝着与用户深度适配”的方向演进。他举例描述

  • AI日报:海螺AI首尾帧功能上线;元石科技发布问小白5;OpenAI发布全新语音模型GPT-Realtime

    AI日报栏目每日提供人工智能领域热点内容,聚焦开发者,帮助洞悉技术趋势、了解创新AI产品应用。最新动态包括:MiniMax海螺AI首尾帧功能上线;元石科技发布问小白5挑战GPT-5;OpenAI推出语音模型GPT-Realtime;谷歌Gemini AI优化表格处理;腾讯黑科技实现AI配音;百度计划培养千万AI人才;MathGPT.ai反作弊功能推广;苹果Xcode集成Claude Sonnet4;微软发布自研AI模型MAI系列;xAI推出高效编码模型Grok Code Fast1;SuperCLUE多模态评测Gemini-2.5-Pro居首;9月1日起AI内容标识新规实施,违规将承担法律风险。

  • OpenAI和科大讯飞,瞄准了同一件事

    OpenAI正式发布GPT-5大模型,距离GPT-4推出已29个月。GPT-5虽仍是当前最全面的模型,但性能提升未与主流模型拉开显著差距,部分场景甚至被Grok4和Claude+Opus4.1超越。OpenAI强调此次升级重点在于减少幻觉、提升指令遵循能力和降低模型谄媚性,而非单纯追求性能突破。与此同时,国产大模型代表星火X1也在7月25日升级,同样聚焦解决幻觉问题,在事实性幻觉和忠诚性幻觉治理上取得突破。全球顶尖大模型正从"能用"向"好用"转变,OpenAI和科大讯飞都通过多目标奖励机制和思维链监控等技术手段改善模型可靠性。星火X1已全面赋能教育、医疗、企业应用等行业,在复杂场景任务上满足用户核心需求。大模型产业已进入规模化落地关键期,中国人工智能产业正从追赶走向领先阶段。

  • 奥尔特曼称自己不适合担任CEO OpenAI上市后或卸任

    OpenAI首席执行官Sam Altman近日接受采访时透露,虽然公司正推进数万亿美元级的计算基础设施投资计划,但他对上市后继续担任CEO持保留态度。 Altman坦言,尽管主导着OpenAI多项战略级项目,但自认缺乏上市公司CEO所需的核心管理素质与市场敏感度。 他特别强调,上市企业领导者需具备应对复杂投资者关系与监管环境的综合能力,而自己可能并非最优人选。

  • 博士水平的GPT-5依然翻车 OpenAI奥特曼:AGI已失去意义

    上周末OpenAI公司发布了传闻已久的GPT-5大模型,号称迄今为止最先进的人工智能模型,具备博士级别的智能水平。 GPT-5发布之后在多个榜单上确实刷榜了,包括编程、数学等,总计拿到了25个榜单的第一,评分表现很震撼。 然而上线之后,GPT-5的实际表现引发质疑,跑分第一不代表实际体验第一,甚至被不少用户认为表现倒退了,反应也变慢,这可能是OpenAI翻车最快的旗舰大�

  • GPT-5有望明天发布 OpenAI:免费无限使用

    OpenAI宣布将于太平洋时间7月4日上午10点(北京时间7月5日凌晨1点)举办重要直播活动。官方预告中"LIVESTREAM"误写为"LIVE5TREAM",引发网友猜测可能暗示GPT-5即将发布。消息称免费版ChatGPT将在标准设置下开放GPT-5对话功能,但会设置防滥用阈值;Plus和Pro用户则可享受更智能的GPT-5服务,包括语音交互、绘图创作等高级功能。此前CEO奥特曼曾透露GPT-5将整合多项前沿技术。若属实,这将是AI爱好者的重大福利,也将进一步提升ChatGPT的实用性和用户体验。

  • OpenAI正式发布GPT-5模型 网友:写作像诗人

    OpenAI在直播活动中正式推出新一代人工智能模型GPT-5,宣称其覆盖编程、数学、写作、健康咨询、视觉感知等核心领域,实现"公司迄今为止最重大的模型升级"。OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)形容,与GPT-5交互如同与各领域专家对话,其多维度能力突破将重塑人机协作模式。 分层开放策略满足多元需求 GPT-5将于本周四启动全球用户分批推送,免费用户与付�

  • 健合旗下Swisse PLUS携手TEDx举办抗衰沙龙,发布NAD+新生瓶系列

    《全球抗衰老市场研究报告》显示,2024年全球抗衰老产品市场规模达2662亿美元。高端消费群体需求从粗放式营养补充转向精准干预,推动行业向细胞级解决方案升级。Swisse PLUS与TEDx合作举办主题沙龙,发布NAD+新生瓶系列,汇聚专家学者探讨细胞抗衰科学路径,倡导建立个人健康管理系统,实现精准抗衰与主动健康管理。

今日大家都在搜的词: