首页 > 业界 > 关键词  > OpenAI最新资讯  > 正文

AI日报:推理更强!OpenAI新模型o1发布;Midjourney 7.0一次可生8张图;开源语音模型Fish Speech 1.4发布

2024-09-13 15:31 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、OpenAI推出全新的模型系列OpenAI o1

OpenAI推出了全新的模型系列OpenAI o1,这个新模型在推理能力上表现得更加出色,为解决复杂问题提供了更强的推理能力。用户需要调整提示方式以适应o1模型的工作方式,提示工程发生了重大变革,用户需要给出简单直接的提示,避免使用思路链提示,使用分隔符来明确模型解析的部分,并限制额外上下文以避免复杂回答。

【AiBase提要:】

🤖 OpenAI o1模型需要简单、直接的提示,而非复杂的指导。

🧠 避免使用思路链提示,因为o1模型已经具备内部推理能力。

📑 使用分隔符来明确模型解析的部分,并限制额外上下文以避免复杂回答。

详情链接:https://openai.com/index/introducing-openai-o1-preview/

2、谷歌Gemini Live语音聊天向安卓用户免费开放,随时随地与AI聊天!

谷歌宣布Gemini Live语音聊天模式现在免费向所有安卓用户开放,这意味着每个人都可以体验智能对话AI的乐趣。用户可以随时用声音提问,甚至在回答过程中打断,为用户带来流畅的语音交互体验。Gemini Live为用户提供了一种新的交互方式,无论在家中还是外出,都能随时与AI进行有趣的对话。

【AiBase提要:】

🌟 Gemini Live语音聊天功能现在免费向所有安卓用户开放!

🗣️ 用户可以直接用声音提问,甚至在回答时打断。

🌍 目前仅支持英文,未来将在iOS上推出并支持更多语言。

3、Midjourney 7. 0 版本或在 2 个月内发布 一次性可生成 8 张图,正开发3D系统

Midjourney创始人David Holz在Discord上分享公司最新项目进展,强调技术创新以竞争AI图像生成领域。公司推迟发布7.0版本,但功能更丰富。重点在提高技术可访问性和工具专业使用价值。计划推出多图生成、图像编辑器、3D系统、个性化功能和视频生成。公司选择稳健发展道路,注重提升用户体验。

【AiBase提要:】

🚀7.0版本推迟但功能更丰富,重点在提高技术可访问性和工具专业使用价值。

🎨 新功能包括多图生成、图像编辑器、3D系统、个性化和视频生成,提升用户体验。

💡 Midjourney选择稳健发展道路,注重实用功能和用户体验,以保持竞争优势。

详情链接:https://top.aibase.com/tool/midjourneywangyeban

4、元象发布MoE开源大模型XVERSE-MoE-A36B

作为中国最大的Mixture of Experts(MoE)开源大模型,XVERSE-MoE-A36B的发布标志着中国在AI领域的重大进步,将国产开源技术提升至国际领先水平。该模型的性能和效率带来了训练时间的缩短、推理性能的提升,以及降低了AI应用的成本,为中小企业、研究者和开发者提供了更多选择机会。

image.png

【AiBase提要:】

🚀 XVERSE-MoE-A36B拥有255B总参数和36B激活参数,性能可与超过100B参数的大模型相媲美,实现了跨级的性能跃升。

💡 MoE架构通过组合多个细分领域的专家模型,打破了传统扩展定律的局限,保持了模型性能最大化,降低了计算成本。

📈 元象MoE在权威评测中超越了多个同类模型,包括国内千亿MoE模型Skywork-MoE、传统MoE霸主Mixtral-8x22B等。

详情链接:https://huggingface.co/xverse/XVERSE-MoE-A36B

5、Fish Speech1.4发布:开源TTS模型迎来多语言突破

Fish Speech1.4版本的发布标志着这款开源文本转语音(TTS)模型在多语言支持和性能方面取得了重大突破。更新展现了强大的技术实力和广阔的应用前景。

【AiBase提要:】

🌐 多语言支持大幅提升: 训练数据量翻倍至70万小时,支持8种主要语言,拓展了应用范围。

⚡ 性能与功能全面升级: 超快速度与低延迟,即时语音克隆功能,灵活部署选项和API服务。

🚀 应用前景广阔: 教育领域支持语言学习,娱乐产业即时语音克隆,辅助技术视障人士工具,智能客服和跨文化交流。

详情链接:https://fish.audio/zh-CN/auth/

6、告别幻觉!谷歌推新模型DataGemma,统计数据准确率暴涨58%

谷歌推出新的开源AI模型DataGemma,旨在解决大语言模型在处理统计数据时常出现的“幻觉”问题,标志着谷歌在AI领域的重要进展。DataGemma利用谷歌的数据共享平台,显著提升模型回答统计问题的准确性。初步测试显示,DataGemma在统计查询准确性方面有显著提升。

【AiBase提要:】

🌟 DataGemma模型旨在减少AI在统计查询中的错误,提高准确性。

📊 DataGemma利用Data Commons平台数据,增强模型回答的准确性。

🔍 DataGemma在初步测试中表现出显著的统计查询准确性提升。

详情链接:https://huggingface.co/collections/google/datagemma-release-66df7636084d2b150a4e6643

7、Jina AI推出Reader-LM小型语言模型

Jina AI推出的Reader-LM小型语言模型为将原始HTML内容转化为干净整洁的Markdown格式提供了便利,摆脱了繁琐的网页数据处理。该模型快速高效,自动剔除杂乱内容,展现出优异性能和高准确性。

image.png

【AiBase提要:】

✨ Reader-LM能快速高效转换网页内容为Markdown,无需复杂规则或正则表达式。

🔍 提供两个参数模型,优化HTML转Markdown任务,性能超越大型模型。

💡 具备强大长上下文处理能力,在资源受限环境中也能高效运行。

详情链接:https://jina.ai/news/reader-lm-small-language-models-for-cleaning-and-converting-html-to-markdown/

8、估值2000万美元!AI工具Shopsense AI 支持拍照就能买到明星同款

在MTV音乐录像带大奖(VMAs)上,观众们通过Shopsense AI技术可以即时购买明星造型相似的服装,展现出未来购物体验的可能性。虽然技术仍需提升准确性,但Shopsense正不断改进,以与其他媒体公司竞争。其商业模式多元,通过点击付费和销售分成获取收入,市场潜力巨大。

image.png

【AiBase提要:】

🌟 观众可通过上传照片获取与明星造型相似的商品推荐,包括高端和亲民选择。

🛍️ Shopsense AI计划扩展到旅游、运动等其他领域的商品推荐,实现内容与购物的无缝连接。

📈 Shopsense AI与Paramount合作,为观众提供即时购买明星造型相似服装的便利体验。

9、一场商标之战!谷歌因使用 “Gemini” 标名称被起诉侵权

最近,谷歌因其新推出的 AI 服务 “Gemini” 而被一家名为 Gemini Data 的公司起诉,指控其侵犯商标权。这起纠纷揭示了大型科技公司在商标使用上的挑战和法律风险,警示企业在命名新产品或服务时需谨慎考虑已有商标。

【AiBase提要:】

🌟 谷歌因使用 “Gemini” 商标被 Gemini Data 起诉,指控其侵犯商标权。

🔍 谷歌在申请商标时遭到拒绝,因该名称与其他商标相似。

🤖 谷歌的 Gemini 聊天机器人承认正在侵犯商标,反映出双方的法律纠纷。

10、阿联酋国有投资公司 MGX 考虑向 OpenAI 投资数十亿美元

阿联酋国有投资公司MGX考虑向OpenAI投资数十亿美元,这一举动将进一步推动OpenAI的融资计划,显示出OpenAI强劲的商业表现。同时,MGX的成立旨在加速人工智能和先进技术的发展,巩固阿联酋在全球科技领域的领先地位。

【AiBase提要:】

💰 MGX考虑向OpenAI投资数十亿美元,推动OpenAI融资计划。

🤖 OpenAI年化经常性收入达40亿美元,展现强劲商业表现。

🌍 MGX由穆巴达拉与G42共同创办,专注于人工智能和先进技术的发展。

11、强得可怕!有人测试用OpenAI o1解答高中数学期末考题,竟全对了

这篇文章介绍了一位Reddit网友使用OpenAI最新模型OpenAI o1解答高中数学题的惊人效果。他对人工智能的能力充满好奇,通过测试发现OpenAI o1在短时间内准确解答了中国高中数学考题,引起了网友的关注与讨论。结果显示了AI在处理复杂数学问题上的强大能力,引发了对AI未来应用前景的讨论。

image.png

【AiBase提要:】

🤖 AI能力惊人:OpenAI o1在短时间内准确解答高中数学考题,全对

💡 科技进步引发思考:网友对AI未来发展提出疑问,讨论教育领域的影响

🌐 智能化学习辅助:AI在教育领域有巨大潜力,为学生提供智能化学习辅助

举报

  • 相关推荐
  • 大家在看
  • Canvas:与ChatGPT协作的新方式

    Canvas是OpenAI推出的一个新界面,旨在通过与ChatGPT的协作来改进写作和编码项目。它允许用户在一个单独的窗口中与ChatGPT一起工作,超越了简单的聊天界面。Canvas利用GPT-4o模型,能够更好地理解用户的上下文,并提供内联反馈和建议。它支持直接编辑文本或代码,并提供快捷操作菜单,帮助用户调整写作长度、调试代码等。Canvas还支持版本回溯,帮助用户管理项目的不同版本。

  • Text Behind Image:轻松创建文字背景图片设计。

    Text Behind Image 是一个开源的设计工具,允许用户轻松创建文字背景图片设计。它提供了一个简洁的界面,让用户可以自由地在图片上添加文字,创造出独特的视觉效果。这个工具对于设计师、社交媒体运营者和内容创作者来说非常有用,因为它可以快速生成具有吸引力的视觉内容。

  • torchao:PyTorch原生量化和稀疏性训练与推理库

    torchao是PyTorch的一个库,专注于自定义数据类型和优化,支持量化和稀疏化权重、梯度、优化器和激活函数,用于推理和训练。它与torch.compile()和FSDP2兼容,能够为大多数PyTorch模型提供加速。torchao旨在通过量化感知训练(QAT)和后训练量化(PTQ)等技术,提高模型的推理速度和内存效率,同时尽量减小精度损失。

  • LFMs:新一代生成式AI模型

    Liquid Foundation Models (LFMs) 是一系列新型的生成式AI模型,它们在各种规模上都达到了最先进的性能,同时保持了更小的内存占用和更高效的推理效率。LFMs 利用动态系统理论、信号处理和数值线性代数的计算单元,可以处理包括视频、音频、文本、时间序列和信号在内的任何类型的序列数据。这些模型是通用的AI模型,旨在处理大规模的序列多模态数据,实现高级推理,并做出可靠的决策。

  • NVLM-D-72B:前沿的多模态大型语言模型

    NVLM-D-72B是NVIDIA推出的一款多模态大型语言模型,专注于视觉-语言任务,并且通过多模态训练提升了文本性能。该模型在视觉-语言基准测试中取得了与业界领先模型相媲美的成绩。

  • gradio-bot:将Hugging Face Space或Gradio应用转化为Discord机器人

    gradio-bot是一个可以将Hugging Face Space或Gradio应用转化为Discord机器人的工具。它允许开发者通过简单的命令行操作,将现有的机器学习模型或应用快速部署到Discord平台上,实现自动化交互。这不仅提高了应用的可达性,还为开发者提供了一个与用户直接交互的新渠道。

  • AI-Powered Meeting Summarizer:会议语音转文本并自动生成摘要的AI工具

    AI-Powered Meeting Summarizer是一个基于Gradio的网站应用,能够将会议录音转换为文本,并使用whisper.cpp进行音频到文本的转换,以及Ollama服务器进行文本摘要。该工具非常适合快速提取会议中的关键点、决策和行动项目。

  • VARAG:视觉增强的检索与生成系统

    VARAG是一个支持多种检索技术的系统,优化了文本、图像和多模态文档检索的不同用例。它通过将文档页面作为图像嵌入,简化了传统的检索流程,并使用先进的视觉语言模型进行编码,提高了检索的准确性和效率。VARAG的主要优点在于它能够处理复杂的视觉和文本内容,为文档检索提供强大的支持。

  • JoyHallo:数字人模型,支持生成普通话视频

    JoyHallo是一个数字人模型,专为普通话视频生成而设计。它通过收集来自京东健康国际有限公司员工的29小时普通话视频,创建了jdh-Hallo数据集。该数据集覆盖了不同年龄和说话风格,包括对话和专业医疗话题。JoyHallo模型采用中国wav2vec2模型进行音频特征嵌入,并提出了一种半解耦结构来捕捉唇部、表情和姿态特征之间的相互关系,提高了信息利用效率,并加快了推理速度14.3%。此外,JoyHallo在生成英语视频方面也表现出色,展现了卓越的跨语言生成能力。

  • PhysGen:基于物理的图像到视频生成技术

    PhysGen是一个创新的图像到视频生成方法,它能够将单张图片和输入条件(例如,对图片中物体施加的力和扭矩)转换成现实、物理上合理且时间上连贯的视频。该技术通过将基于模型的物理模拟与数据驱动的视频生成过程相结合,实现了在图像空间中的动态模拟。PhysGen的主要优点包括生成的视频在物理和外观上都显得逼真,并且可以精确控制,通过定量比较和全面的用户研究,展示了其在现有数据驱动的图像到视频生成工作中的优越性。

  • Whisper large-v3-turbo:高效自动语音识别模型

    Whisper large-v3-turbo是OpenAI提出的一种先进的自动语音识别(ASR)和语音翻译模型。它在超过500万小时的标记数据上进行训练,能够在零样本设置中泛化到许多数据集和领域。该模型是Whisper large-v3的微调版本,解码层从32减少到4,以提高速度,但可能会略微降低质量。

  • Realtime API:低延迟的实时语音交互API

    Realtime API 是 OpenAI 推出的一款低延迟语音交互API,它允许开发者在应用程序中构建快速的语音到语音体验。该API支持自然语音到语音对话,并可处理中断,类似于ChatGPT的高级语音模式。它通过WebSocket连接,支持功能调用,使得语音助手能够响应用户请求,触发动作或引入新上下文。该API的推出,意味着开发者不再需要组合多个模型来构建语音体验,而是可以通过单一API调用实现自然对话体验。

  • Saylo AI:探索无限的AI角色扮演游戏。

    Saylo AI是一个AI角色扮演游戏,让你与AI角色互动,探索多样化的戏剧性故事。它利用人工智能技术,提供沉浸式的互动体验,让玩家在虚拟世界中与AI朋友交流,体验不同的故事情节。Saylo AI的背景信息展示了其创新性和娱乐性,旨在为玩家提供一种全新的娱乐方式。目前产品处于推广阶段,价格未明确标注。

  • twinny:Visual Studio Code的免费且私密的AI扩展

    twinny是一个为Visual Studio Code用户设计的AI扩展,旨在提供个性化的编程辅助,提高开发效率。它通过集成先进的AI技术,帮助开发者在编码过程中快速解决问题,优化代码,并提供智能提示。twinny的背景是响应开发者对于更加智能和自动化编程工具的需求,它通过简化开发流程,减少重复劳动,从而让开发者能够专注于更有创造性的工作。

  • Buildpad:构建人们真正想要的产品

    Buildpad 是一个旨在帮助创始人从概念到成功最小可行产品(MVP)的在线平台。它通过提供智能验证工具、AI引导的开发流程、进度跟踪以及个性化的项目见解,帮助用户构建能够获得市场认可的产品。Buildpad 的主要优点包括简化产品开发流程、提高产品成功率、以及提供个性化的指导和支持。

  • Novela:AI时代的技能学习平台

    Novela是一个专注于AI时代技能学习的在线平台,提供早期访问服务,用户可以免费试用。它旨在帮助用户掌握AI相关的技能,以适应未来职场的需求。

  • interview.co:视频面试软件,简化招聘流程

    interview.co是一个专注于简化招聘流程的视频面试软件。它通过提供在线视频面试、AI问题生成器和面试管理工具,帮助企业高效地筛选和评估候选人。产品背景信息显示,interview.co旨在解决传统面试中的时间消耗、日程安排困难和成本高昂等问题。价格方面,interview.co提供试用版,具体定价信息需进一步探索。

  • Open NotebookLM:将任何PDF转换为播客集!

    Open NotebookLM是一个利用开源语言模型和文本到语音模型的工具,它可以处理PDF内容,生成适合音频播客的自然对话,并将其输出为MP3文件。该项目的灵感来自于NotebookLM工具,通过使用开源的大型语言模型(LLMs)和文本到语音模型来实现。它不仅提高了信息的可访问性,还为内容创作者提供了一种新的媒体形式,使他们能够将书面内容转换为音频格式,扩大其受众范围。

  • Chital:macOS平台的Ollama模型聊天应用

    Chital是一个为macOS平台设计的应用程序,它允许用户与Ollama模型进行聊天。这个应用具有低内存占用和快速启动的特点,支持多聊天线程,能够在不同的模型间切换,并支持Markdown格式。此外,它还能自动为聊天线程生成标题摘要。Chital的开发主要是为了满足开发者个人的使用需求,但也鼓励社区成员通过fork代码库来添加新功能。

  • SafeEar:保护隐私的音频深度检测

    SafeEar是一个创新的音频深度检测框架,它能够在不依赖于语音内容的情况下检测深度音频。这个框架通过设计一个神经音频编解码器,将语义和声学信息从音频样本中分离出来,仅使用声学信息(如韵律和音色)进行深度检测,从而保护了语音内容的隐私。SafeEar通过在真实世界中增强编解码器来提高检测器的能力,使其能够识别各种深度音频。该框架在四个基准数据集上的广泛实验表明,SafeEar在检测各种深度技术方面非常有效,其等错误率(EER)低至2.02%。同时,它还能保护五种语言的语音内容不被机器和人类听觉分析破译,通过我们的用户研究和单词错误率(WER)均高于93.93%来证明。此外,SafeEar还构建了一个用于反深度和反内容恢复评估的基准,为未来在音频隐私保护和深度检测领域的研究提供了基础。

今日大家都在搜的词: