首页 > 业界 > 关键词  > Gemini最新资讯  > 正文

AI日报:谷歌推Gemini 1.5 Pro实验版本0801;图像生成开源模型FLUX1横空出世;极速3D图像生成模型Stable Fast 3D发布;阿里语音合成模型CosyVoice更新

2024-08-02 15:05 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、谷歌推超强多模态模型实验版Gemini1.5Pro,排名领先GPT-4o、Claude-3.5Sonnet

谷歌今天推出了Gemini1.5Pro实验版本0801,在人工智能领域取得重大突破。Gemini1.5Pro在多任务表现出色,具有多模态能力和广阔上下文窗口,引发了AI发展和社会影响的讨论。

image.png

【AiBase提要:】

🚀 谷歌推出Gemini1.5Pro实验版本0801,在排行榜上领先竞争对手。

💪 该模型在多任务中表现出色,具有多模态能力和广阔上下文窗口。

⚖️ 发布引发AI发展和社会影响的讨论,谷歌寻求反馈以完善模型。

详情链接:https://top.aibase.com/tool/gemini-pro

2、AI图像生成迎来新霸主!开源模型FLUX.1横空出世,Midjourney、DALL·E3紧张了?

在人工智能领域,每一天都可能发生颠覆性的变革。FLUX.1作为一匹令人瞩目的黑马,以其强大性能和开源特性引爆了AI圈。创始人Robin Rombach的权威背景和FLUX.1的创新架构使其成为AI图像生成领域的新霸主,为整个AI行业注入新活力。

image.png

【AiBase提要:】

🚀 FLUX.1超越闭源模型和开源SD3系列,性能大幅领先

💡 基于Vision Transformer架构,采用流程匹配训练方法,提升模型性能

🌟 FLUX.1展现出在文本嵌入图片等方面的明显优势

详情链接:https://github.com/black-forest-labs/flux

3、Stability AI推新AI模型Stable Fast3D:半秒内生成3D图像 速度提升1200倍

Stability AI最新推出的Stable Fast3D技术实现了从单张图像快速生成3D图像,处理速度比之前快1200倍,具有广泛的实用价值。该技术基于先进的生成式AI模型,为设计、建筑、零售、虚拟现实和游戏开发等多个行业带来革命性变革。

image.png

【AiBase提要:】

😃Stable Fast3D技术实现半秒内生成3D图像,速度大幅提升

👍新模型在设计、建筑、零售、虚拟现实和游戏开发等多个行业具有实用价值

👏Stability AI持续引领图像生成技术发展,从2D到4D不断创新

详情链接:https://top.aibase.com/tool/stable-fast-3d

4、AI视频创作平台Hedra融资1000万美元

近日,AI视频创作领域迎来重磅消息,Hedra成功筹集1000万美元种子资金,引发广泛关注。Hedra推出了视频基础模型Character-1,已有超35万用户创作超160万视频,部分走红网络。多家公司推出视频生成模型,大公司积极参与AI驱动的视频创作。

【AiBase提要:】

🔥 Hedra获1000万美元种子资金,推出Character-1模型。

💡 超35万用户使用Character-1创作超160万视频,部分走红网络。

🚀 多家公司推出视频生成模型,大公司积极参与AI驱动的视频创作。

详情链接:https://www.hedra.com/blog/announcement

5、阿里语音合成模型CosyVoice更新 让AI说话更有人味儿

阿里巴巴推出的最新语音合成模型CosyVoice展示了未来人机交互的美好蓝图,逼真度和灵活性令人惊叹。该技术不仅能生成符合特定性别、年龄和个性的声音,还能模拟人类说话时的自然特征,添加情感和风格,使AI表达更加丰富多彩。CosyVoice与SenseVoice构成FunAudioLLM框架,提升语音交互体验,支持多语言识别和情感识别。技术突破预示着人机交互将迎来全新时代,为教育、娱乐、客户服务等领域带来革命性变化。

【AiBase提要:】

🤖 CosyVoice模型展示未来人机交互蓝图,逼真灵活,生成符合性别、年龄、个性声音,模拟自然特征,添加情感风格。

🔊 FunAudioLLM框架提升语音交互体验,SenseVoice支持多语言识别和情感识别,反应速度快,应用前景广泛。

📚 技术突破预示人机交互新时代,CosyVoice和FunAudioLLM为教育、娱乐、客户服务等领域带来革命性变化。

详情链接:https://top.aibase.com/tool/cosyvoice

6、阿里国际站AI生意助手再升级:文本类AI生成能力完全免费

阿里巴巴国际站总裁张阔宣布AI生意助手的全新发布,包括极简发品功能和AI自动接待功能。AI技术的应用显著降低外贸行业门槛,已有3万家中小企业使用,优化后的商品曝光量提高了37%,支付转化率提升了50%。AI生意助手成为商家高效经营和快速接单的得力助手。更新的三大权益提供更灵活的使用方式,文本类AI生成能力免费,不满意的功能可免费二次生成。将持续更新更多功能。

【AiBase提要:】

🚀 AI生意助手极简发品功能缩短商家发布时间至最快60秒。

💬 AI自动接待功能提升海外买家二次回复率约40%。

💡 AI技术应用降低外贸行业门槛,3万家中小企业使用,商品曝光量提高37%,支付转化率提升50%。

7、桌面ChromeAI搜索升级,引入类似Circle to Search的功能

Google Lens在桌面版Chrome中进行AI驱动的升级,为用户带来更便捷的搜索体验。用户可以通过点击搜索框中的新按钮激活Google Lens,实现多重搜索并查看文本和图像搜索结果。此更新将全球推出,部分功能仅对美国用户开放。另外,Chrome还新增了AI功能,允许用户通过提问搜索历史来查找链接。这些功能将逐步在未来几天或几周内在美国用户中推出。

image.png

【AiBase提要:】

🌐 Google Lens在桌面版Chrome进行AI驱动升级,用户可通过点击搜索框按钮激活并进行多重搜索。

📅 更新将在“未来几天”全球推出,部分功能仅对美国用户开放。

💬 Chrome新增可询问搜索历史的AI功能,将“在未来几周内”在美国推出,用户可选择,目前依靠云模型提供结果。

8、以色列人工智能初创公司aiOla推出超高速开源语音识别模型Whisper-Medusa

aiOla推出的Whisper-Medusa语音识别模型在速度上比OpenAI的Whisper提升了50%,并保持了准确性。这一举措将加快语音应用的响应速度,提升效率,降低成本。

image.png

【AiBase提要:】

💥 速度提升50%: Whisper-Medusa比OpenAI的Whisper速度快50%

🎯 不损准确性: Whisper-Medusa在提升速度的同时保持了与原模型相同的准确性

📈 应用前景广: Whisper-Medusa有望加快语音应用的响应速度,提升效率,降低成本

9、Suno声称用受版权保护的音乐进行训练模型是“合理使用”

本文报道了美国唱片业协会(RIAA)对音乐生成初创公司 Udio 和 Suno 提起诉讼的情况。Suno 承认使用受版权保护的音乐训练其 AI 模型,并声称这属于合理使用。RIAA 对此表示不认同,认为这是侵权行为。案件结果可能影响相关领域的先例。

【AiBase提要:】

🎶 RIAA 起诉 Udio 和 Suno 使用版权音乐训练模型。

💻 Suno 承认用受版权保护的音乐进行训练模型,但称此为合理使用。

👀 案件结果可能开创影响相关领域的先例。

10、微软首次在SEC文件中将OpenAI列为竞争对手

微软近日在提交给美国证券交易委员会(SEC)的年度10K报告中,首次将其长期合作伙伴OpenAI列为竞争对手,引发业界猜测。这一举动可能受当前反垄断环境影响,微软与OpenAI的关系走向仍有待观察。

【AiBase提要:】

🔍 微软将OpenAI列为竞争对手,引发业界关注。

💰 微软投资OpenAI130亿美元,成为独家云提供商。

🔄 合作伙伴与竞争对手并非互斥,微软与OpenAI关系变化有先例。

11、库克称苹果AI将推动用户升级

苹果公司在2024年第三财季取得了稳健的财务业绩,尤其是服务营收实现了增长。蒂姆·库克透露了关于Apple Intelligence的部分特性和未来发布的新款iPhone16,展望了苹果在人工智能领域的发展。

image.png

【AiBase提要:】

📈 苹果公司2024年第三财季总净营收达857.77亿美元,同比增长5%。

📱 iPhone营收达392.96亿美元,Mac和iPad营收增长,服务营收达242.13亿美元。

🚀 Apple Intelligence功能将逐步推出,新款iPhone16即将发布,将支持AI技术。

12、300余名视频游戏演员联合抗议 声讨好莱坞无监管AI使用!

在好莱坞星光闪耀的背后,演员们团结起来抗议无监管AI使用,维护自身权益。这场抗议凸显了人工智能时代下演员生存权的重要性。

【AiBase提要:】

🎭 演员抗议无监管AI使用,维护权益。

💼 人工智能威胁演员生存,声音形象或被滥用。

💰 演员与游戏公司谈判僵局,关键在于谁是表演者。

13、港大与MIT联手打造ItiNera:你的私人AI导游,一键规划完美Citywalk路线!

在都市的喧嚣中,每个人都渴望一场说走就走的citywalk,穿梭于大街小巷,探索历史遗迹,沉浸在当地文化之中。ItiNera系统通过结合空间优化与大型语言模型,提供个性化的城市行程规划服务,为旅行者带来全新的探索城市方式。

image.png

【AiBase提要:】

🌆 ItiNera是开放域城市行程规划系统,能根据用户自然语言描述生成个性化行程。

🗺️ ItiNera利用LLM与空间优化模块,提取和排序POIs,打造空间连贯的行程。

🔓 ItiNera已在TuTu在线旅行服务上部署,吸引数千用户使用其城市旅行规划服务。

详情链接:https://arxiv.org/pdf/2402.07204

举报

  • 相关推荐
  • 大家在看
  • FlyCode:利用AI优化订阅收入,减少客户流失。

    FlyCode是一款基于机器学习和人工智能技术的应用,旨在通过智能支付重试和优化支付流程来最大化订阅收入并减少客户流失。它为不同规模的品牌提供企业级的收入恢复服务,利用成千上万的数据点来确保尽可能高的恢复率。此外,FlyCode通过与客户电子邮件同步的智能逻辑来改善客户体验,确保在最佳时间和日期发送恢复电子邮件,提高打开率。这些电子邮件是事务性的且可定制的。

  • Coho AI:通过个性化体验,最大化每个用户的收益。

    Coho AI 是一款专注于用户旅程优化和客户留存管理的人工智能平台。它通过分析用户数据,自动发现最有价值的客户,个性化他们的体验,并自动增加每个用户的收入。该平台能够无缝集成到企业的数据中,自动对用户进行细分,识别最佳行动方案,并实时与用户互动,同时跟踪成功并持续优化增长策略。Coho AI 以其无需编码设置、实时行动、简单易用、智能自动化和快速见效等特点,帮助企业提升客户参与度和生命周期价值。

  • Superflex:前端开发助手,提升10倍开发效率。

    Superflex是一款前端开发助理插件,旨在帮助开发者通过各种输入方式快速构建UI组件和页面。它支持从Figma设计、草图、截图或文本提示生成代码,同时分析并重用现有代码库中的组件,以适应开发者的编码风格。Superflex通过VSCode插件的形式提供服务,支持多种输入源生成代码,并且能够适应开发者的编码风格,提供透明的定价策略,旨在帮助开发者提高工作效率,减少重复劳动,专注于创新和复杂问题的解决。

  • 博思AIPPT:AI一键生成PPT,开启做PPT新方式。

    博思AIPPT是一款利用人工智能技术,为用户快速生成PPT演示文稿的在线工具。它通过结构化大纲解析、导入文件、智能排版和AI重写等功能,帮助用户节省大量时间,专注于内容创作。产品背景信息显示,博思AIPPT覆盖全行业场景,包括市场营销、教育、设计等,适用于需要制作演示文稿的各类专业人士。产品提供免费试用,用户可以在线编辑PPT内容,零基础也能快速上手。

  • AI Comic Factory.com:利用AI技术,无需绘画技巧即可创造漫画。

    AI Comic Factory是一个在线AI漫画书生成器,它允许用户通过简单的描述来生成个性化的漫画。这个工具使用尖端的AI技术,使得即使是没有绘画技能的用户也能轻松创作出具有专业视觉效果的漫画。它支持多种漫画风格,包括美国、日本等,并提供多种布局选项。用户可以上传自己的图片,个性化故事,并利用AI保持角色在漫画中的一致性。此外,AI Comic Factory还提供了一个用户友好的界面,让用户能够轻松编辑和精细化他们的漫画作品。

  • 美图证件照:一分钟拍出专业证件照

    美图证件照是由美图秀秀出品的一款专业证件照制作APP,它通过提供多种照片规格和一键上传自拍照的功能,结合智能抠图剪裁、超清美颜和AI换装等技术,让用户可以轻松制作出理想的证件照。这款应用满足了用户在不同场合对证件照的需求,无需前往照相馆,即可在家中完成高质量的证件照制作。

  • Image to Video AI:在线将图片转换成视频的AI工具

    Image to Video AI是一个利用人工智能技术将静态图片转换成动态视频的在线工具。它通过用户上传图片和输入提示文本,快速生成具有动画文本和引人注目的过渡效果的视频。这种技术简化了视频制作流程,使得即使没有视频编辑经验的用户也能轻松创建专业级别的视频内容。产品的主要优点包括易用性、快速生成视频、无需下载安装、支持多种图片格式以及直接分享到社交媒体。

  • PicLumen:免费AI图像生成器,一键生成创意图像。

    PicLumen是一个在线AI图像生成器,它利用先进的人工智能技术,允许用户通过简单的文本输入快速生成高质量的图像。用户无需具备专业的设计技能,只需输入描述性文本,PicLumen的AI就能理解并创造出相应的图像。这个工具特别适合需要快速生成创意图像的个人和商业用户,无论是用于社交媒体内容创作、广告设计还是个人项目。PicLumen提供了多种图像风格,包括动漫、写实艺术、线条艺术和艺术风格,满足不同用户的需求。此外,它还支持图像到图像的个性化编辑,以及AI图像扩展功能,使用户能够无缝扩展图像并智能填充扩展区域。PicLumen的AI图像生成器是完全免费的,适用于个人和商业用途,但用户在使用时需要遵守其使用条款和条件。

  • Microsoft Teams:智能团队协作平台,提升工作效率。

    Microsoft Teams 是一款集成了聊天、会议、通话和协作功能的智能团队协作平台。它通过提供多种AI驱动的功能,如Copilot提示、Mesh虚拟协作和Teams电话服务,帮助团队更高效地沟通和协作。Teams 支持与Microsoft 365应用无缝集成,为不同规模的企业和教育领域提供定制化的解决方案。

  • My Storybook:创作并分享你的故事书

    My Storybook是一个在线平台,旨在帮助所有年龄段的作家创作、出版故事书。它提供写作、插图和角色创建等功能,让学习写作变得有趣。平台还为教师和学生提供教育解决方案,包括无缝的课堂集成和无限打印副本。

  • 阿贝智能:利用AI技术创作个性化儿童绘本

    阿贝智能是一家位于科技与教育交汇点的创新型企业,致力于通过尖端的人工智能技术,开启儿童教育的新纪元。我们相信每个孩子都拥有无限的潜能,而我们的使命是通过科技的力量,解锁这些潜能,帮助孩子们在愉悦的环境中成长和学习。

  • DeepLearning.AI:AI领域的专业课程和资源平台

    DeepLearning.AI 是由著名人工智能专家Andrew Ng创立的在线教育平台,专注于提供机器学习和深度学习领域的高质量课程和专业证书。该平台为初学者和专业人士提供了一个学习AI技能和应用它们的实践机会。通过与行业领导者的合作,DeepLearning.AI 确保了课程内容的前沿性和实用性,帮助学习者在AI领域建立坚实的基础,并推动他们的职业发展。

  • Microsoft Word:智能写作助手,文档设计和协作工具。

    Microsoft Word 是一款强大的文字处理软件,它通过智能写作辅助、文档设计和协作工具,帮助用户提升文档处理的效率和质量。Word 提供了丰富的模板、实时协作编辑、语音输入和命令、以及沉浸式阅读器等功能,支持多种语言,并与 Microsoft 365 其他应用无缝集成,适用于个人和企业用户。

  • ReadLecture:轻松视频转图文,加速内容学习与传播

    ReadLecture 是一款专注于讲座类视频转换为图文结合文档的平台,通过AI技术精准截取视频中的PPT和将演讲者的语言转换为文字稿,大幅提升视频内容的观看效率。该产品通过智能AI笔记生成,提供多维度笔记,包括内容大纲思维导图、自我问答、金句摘抄、专业术语解释、内容翻译等,助力用户高效学习和传播知识。

  • 数美智能文本检测:高效识别各类敏感、违禁、色.情等风险文本内容

    数美科技的智能文本检测产品基于先进的语义模型和海量多语种样本库,能够精准识别并过滤各种敏感、违禁、色.情、暴恐、辱骂、广告导流等风险文本内容。该产品支持多种海外语言检测和风险标签识别,适用于多种应用场景,如文档、帖子、评论、签名、昵称、弹幕等,帮助企业维护网络环境的清洁和安全。

  • 龙源AI检测系统:智能AI写作检测系统,保障文本原创性和学术诚信

    龙源AI检测系统是一款利用大数据和人工智能技术,为学术研究、教育评估、文化传媒等领域提供服务的高科技产品。该系统能够高精度地检测出AI生成的文本和抄袭内容,无论文本长度、类型和语境的限制。系统采用分布式计算和云端部署技术,快速响应和处理大量的文本请求,并自动识别和过滤出有效的文本,提高检测效率和准确度。

  • 知网个人AIGC检测服务:快速、准确识别学术文本中疑似AI生成内容。

    知网个人AIGC检测服务系统利用结构化、碎片化和知识元化的高质量文献大数据资源,结合知识增强AIGC检测技术和多种检测算法,从语言模式和语义逻辑两个维度,使用AI技术检测AIGC生成的内容,旨在帮助用户快速、准确地识别学术文本中的AI生成内容。该服务对于维护学术诚信和提高研究质量具有重要意义。

  • 有道翻译AI写作:一键生成论文、邮件等,提升写作效率。

    有道翻译·AI写作是一款旨在提高写作效率和内容质量的在线工具。它支持一键生成论文、邮件、公文通知、营销文案等,同时提供润色、扩写、总结、去重等高级功能。该产品支持100多种语言,通过多端同步技术,用户可以在不同设备上继续之前的工作,保证了数据的安全性和创作的连续性。

  • 触站AI:AI技术驱动的一站式智能绘画解决方案。

    触站AI绘画是广州触站科技有限公司旗下的一款利用尖端AI技术,为用户打造一站式智能绘画解决方案的平台。它整合了艺术与商业,使用户能够轻松地将想象力转化为现实,提高工作效率,同时开拓更多的商业机会。该平台的应用范围广泛,不仅适用于美术创作、动画制作,还可用于游戏开发、虚拟现实等多领域。

  • Influenbase:AI驱动的TikTok达人营销智能管家

    Influenbase是BrandPal旗下硅谷研发团队打造的AI驱动的TikTok达人营销智能管家。它通过AI算法精细化筛选达人,一键自动与优质达人批量建联,实现从达人建联、合作沟通、物流跟踪、达人视频审核及二次合作等功能,帮助品牌降本增效、实现高质量持续增长。

今日大家都在搜的词: