首页 > 业界 > 关键词  > Gemini最新资讯  > 正文

AI日报:谷歌Gemini 1.5 Flash可免费使用;哩布哩布完成数亿元融资;苹果AI新功能将推迟至iOS 18.1版本

2024-07-29 14:59 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解:https://top.aibase.com/

1、告别P图困扰!Diffree直接通过文字描述就可无痕添加物体

在这个AI技术飞速发展的时代,Diffree作为一项能让设计师和摄影师们欢呼雀跃的AI图像处理技术,通过文本引导实现在图片中无缝添加新物体,降低了图像编辑门槛,让每个人都能成为创造者。

【AiBase提要:】

🎨 Diffree利用文本引导功能,根据简单文字描述在图像中添加新物体,实现无缝融合。

🔍 基于"文本到图像"模型,Diffree通过训练学会生成图像内容,利用"Stable Diffusion"扩散模型预测新物体位置。

✨ Diffree不仅能单次添加物体,还能多次添加并保持背景一致性,在实验证明中表现优越,降低了图像编辑难度。

详情链接:https://top.aibase.com/tool/diffree

2、谷歌推Alchemist技术 实现图片材质精准编辑

谷歌研究团队最近推出了一项突破性技术Alchemist,使用户能够精确编辑图片中物品的材质属性,无需专业技能。这项技术基于经过微调的Text-to-Image生成模型,通过合成数据集和修改模型架构实现精细控制。实验结果显示技术有效改变物品外观,应用前景广阔。尽管存在局限性,但研究团队对其潜力充满信心,有望为图像编辑领域带来革命性变革。

image.png

【AiBase提要:】

✨ 突破性技术Alchemist实现精准编辑图片材质属性,无需专业技能。

🌟 实验结果显示技术有效改变物品外观,应用前景广阔。

💡 研究团队对Alchemist技术的潜力充满信心,有望为图像编辑领域带来革命性变革。

详情链接:https://prafullsharma.net/alchemist/

3、Google Gemini重大更新Gemini1.5Flash可免费使用

Google近日宣布了其AI助手Gemini的一系列重大更新,旨在提高用户体验并扩大其应用范围。更新涵盖了性能提升、新功能引入以及用户群体的扩展。Gemini1.5Flash版本带来了免费版Gemini的全面升级,提升了响应速度、推理能力和图像理解。

image.png

【AiBase提要:】

✨ Gemini1.5Flash版本全面升级,提升性能和功能。

🔗 文件上传功能即将推出,便于处理复杂任务。

🌐 Gemini功能将推广到更多平台和地区,支持更多语言。

4、苹果新AI功能或将推迟至iOS18.1版本发布

苹果公司备受期待的新AI功能 Apple Intelligence 可能无法赶上iOS18的首次发布。尽管用户对于新功能的推迟可能感到失望,但这也展现了苹果注重产品稳定性和完善度的态度。

image.png

【AiBase提要:】

📅 新AI功能可能推迟至iOS18.1版本发布,Beta测试将在本周开始。

📉 升级版Siri等其他AI更新或推迟至2025年才能与用户见面。

📈 苹果公司在整合AI技术到产品中时更注重稳定性和完善度,而非急于赶上发布日期。

5、Llama4启动训练 Meta科学家揭秘Llama3.1训练背后的故事

在播客节目Latent Space中,Meta的科学家Thomas Scialom揭开了Llama3.1的研发秘籍,透露了Llama4的神秘面纱。文章深入探讨了Llama3.1的诞生背后的平衡挑战与技术突破,展示了Meta在AI领域的领先地位和未来展望。

【AiBase提要:】

🔍 Llama3.1的诞生是参数规模、训练时间与硬件限制的完美平衡,挑战GPT-4o,展现了Meta的技术实力。

🔑 在研发过程中重视训练数据总量,选择增加训练token数,通过15T的token海洋实现知识深度与广度的飞跃。

💡 创新地选择合成数据进行后训练,尝试多种模型评估与改进方法,展示了Meta在AI技术上的探索与突破。

6、亚马逊云发布Amazon Q Apps:允许用户构建自己的生成式 AI 应用程序

在亚马逊云科技纽约峰会上,亚马逊云科技发布了Amazon Q Apps服务,为用户提供便捷的生成式AI应用程序构建方式。这项服务将AI技术应用变得更加简单易用,为用户提供了更多机会探索AI应用的可能性。

image.png

【AiBase提要:】

🚀 Amazon Q Apps服务让用户可以根据简单描述创建应用程序,无需技术背景也能使用。

💻 Amazon Q Developer集成到Amazon SageMaker Studio,为机器学习模型开发带来便捷。

🔒 Amazon Bedrock更新了功能,帮助用户轻松访问高性能大语言模型和构建安全、隐私的生成式AI应用程序。

7、AI离人类有多远?一个晾衣问题暴露GPT-4致命缺陷

在Quanta Magazine的播客中,华盛顿大学计算机教授Yejin Choi与主持人Steven Strogatz展开了关于人工智能的深刻对话,探讨AI是否需要具备身体和情感才能发展出与人类相似的常识。虽然大型语言模型(LLM)在语言能力上取得进展,但在理解基本常识方面仍存在挑战。Choi教授的实验室致力于教授AI常识,认为AI应该拥有情商和意识,以更人性化地与人类互动。

【AiBase提要:】

🧠 LLM表现接近人类智能,但训练方式与人类不同

🤖 AI在理解基本常识方面存在挑战,如ChatGPT回答问题出错

📚 Choi教授实验室研究教授AI常识,通过提供声明性知识帮助神经网络学习

详情链接:https://www.quantamagazine.org/will-ai-ever-have-common-sense-20240718/

8、AI图像生成平台LiblibAI完成数亿元融资 创国内行业新高

LiblibAI是国内领先的AI图像生成平台,最近完成了数亿元人民币的三轮融资,创下国内AI图像赛道的最大总融资纪录。公司快速发展得益于明确的产品战略和强大的社区生态,面临的挑战是平衡先进模型发展速度与用户需求。团队成员来自知名高校,具备丰富的互联网和设计行业背景,为公司的持续创新提供支持。

image.png

【AiBase提要:】

🚀 LiblibAI完成数亿元融资,创下国内AI图像赛道最大总融资纪录。

💡 公司快速发展得益于明确的产品战略和强大的社区生态,积累近1000万专业AI图像创作者。

⚖️ 面临的挑战是平衡先进模型发展速度与用户需求,团队强调用AI-native思维设计产品。

9、Hierarchical3D Gaussian:实时渲染大规模高质量3D场景

在虚拟现实和计算机图形学领域,Hierarchical3D Gaussian方法突破了传统瓶颈,实现了高质量3D场景的实时渲染,提升了视觉效果和处理效率。该方法采用分块训练和层级优化技术,具有广泛应用潜力。

image.png

【AiBase提要:】

🌟 突破传统瓶颈: Hierarchical3D Gaussian解决了超大数据集渲染的瓶颈问题,提升了视觉效果和处理效率。

🚀 高效训练与渲染: 采用分块训练和层级优化技术,使得超大规模场景的实时渲染成为现实。

📈 广泛应用潜力: Hierarchical3D Gaussian能处理数万张图像的复杂场景,并适应各种资源条件,展现了显著的实用性。

详情链接:https://top.aibase.com/tool/hierarchical-3d-gaussian

举报

  • 相关推荐
  • 当GPT-5遇上Gemini 2.5,谁更适合你的业务?这份对比报告说了算

    某跨境电商CTO复盘会上展示:GPT-5 Standard处理百万级商品描述时,费用比Gemini 2.5 Flash-Lite高35%,响应速度慢0.8秒。大模型选型面临参数迷雾、场景错配、隐藏成本三重困境。AIbase选型对比平台通过真实数据测试,提供透明价格拆解和性能雷达图,帮助规避预算陷阱。实测显示GPT-5在合同逻辑分析准确率高3.2%,而Gemini表格解析速度快40%、月总成本低26%。工具可动态追踪官方调价,生成定制化决策报告,用数据替代经验主义,提升技术选型效率。

  • 谷歌透露Gemini每次回答消耗能量:相当于微波炉运行1秒钟

    近日,谷歌发布了一份技术报告,详细说明了其Gemini大模型在每次查询中消耗的能源量。 据谷歌介绍,这是迄今为止大型人工智能公司发布的最透明估算,也是研究人员期待已久的报告。 报告称,Gemini应用的文字回答平均每次消耗0.24瓦特小时(Wh)的能量,大约相当于运行微波炉一秒钟,并排放0.03克二氧化碳当量。 据此前媒体报道,谷歌近日发布Gemini系列最轻量版本Gemma 3

  • 豆包1.5轻量版 vs Gemini 2.5闪存版:生成5000字深度文章,哪个模型更合适?

    AIbase选型工具通过多维度数据对比,帮助用户精准选择AI模型。文章以豆包和Gemini为例,展示平台如何解决模型选型痛点:自动生成对比报告,评估关键指标如术语准确性、本土案例适配度等。实际案例显示,使用该工具后内容团队效率提升40%,编辑成本下降65%。核心价值在于用数据驱动决策,规避局部优势导致的全局误判,实现场景化精准匹配。

  • Gemini 2.5 Flash-Lite与 DeepSeek-V3 深度对比:谁在性价比上更胜一筹?

    面对琳琅满目的大模型API,开发团队常陷入选择困境。文章指出,2024年既是机遇也是挑战的时代,闭源模型选择丰富但性能与成本平衡复杂。通过AIbase等数据驱动平台进行客观对比至关重要。以Gemini 2.5 Flash-Lite和DeepSeek-V3为例,前者综合能力强适合多语言场景,后者在代码生成和成本控制上优势明显。建议开发者明确需求,通过实际测试验证模型表现,理性选择最适合的方案。

  • 别再猜了!手把手教你用数据选择AI模型,我的Gemini 2.5 Flash-Lite vs DeepSeek选型心得

    开发者分享模型选择心路历程:从盲目试错到数据驱动。曾因追求低价模型导致成本飙升,后通过AIbase平台对比Gemini 2.5 Flash-Lite和DeepSeek-V3,基于价格、上下文长度和代码能力等数据,最终选择更适合代码生成任务的DeepSeek-V3。强调没有“最好”的模型,只有“最适合”的模型,建议开发者善用专业工具进行数据驱动决策,避免隐性成本。

  • 自研遇阻!苹果考虑用谷歌Gemini升级Siri

    苹果正与谷歌就使用Gemini AI引擎为新一代Siri提供技术支持进行初步谈判,这一动向表明苹果可能进一步将人工智能能力外包,成为其AI战略的关键一步。 据知情人士透露,这家iPhone制造商近期已与Alphabet旗下谷歌接触,商讨合作构建一款定制化AI模型,以用于明年预计推出的新版本Siri。 谷歌目前已开始训练一款可在苹果服务器上运行的模型。苹果在生成式人工智能领域起步�

  • AI日报:字节视频模型Waver 1.0发布;百度AI搜索APP“梯子AI”发布;谷歌推全新Gemini 2.5 Flash图像编辑模型

    本文汇总了AI领域最新动态:谷歌推出Gemini 2.5 Flash图像编辑模型,字节发布Waver 1.0视频生成工具;百度“梯子AI”提供无广告搜索;文心快码新增终端编码功能;腾讯游戏VISVISE工具集提升动画制作效率;自动驾驶配送机器人RM5进军外卖行业;DeepSeek V3.1出现字符Bug已修复;谷歌翻译升级实时同传和AI陪练;全球首现AI勒索软件PromptLock威胁网络安全;Anthropic推出Chrome浏览器AI助手Claude。

  • Google Gemini vs Deepseek:谁更适合你的业务场景?AI大模型选型终极对比指南

    企业在选择大模型时面临两难:国际大厂的Gemini技术先进,但国内DeepSeek性价比突出。AIbase平台通过真实场景测试数据指出:1)跨境电商客服场景中,Gemini多语言识别准确率提升12%,但需注意API延迟问题;2)金融研报分析场景下,DeepSeek支持128K长文本且成本仅为Gemini的1/3。决策关键:抛开参数迷雾,聚焦成本、响应速度、语言支持和场景匹配四大维度。AIbase提供可视化对比工具,3分钟生成专属选型报告,让技术决策不再玄学。

  • AI大模型选型决策指南:10分钟数据对比 Gemini 2.5 Flash-Lite 与 DeepSeek R1

    本文探讨大模型选型困境与解决方案。2025年全球可调用大模型超300个,但选型面临三大难题:单位混乱、定价波动快、87%团队无法量化模型价值。提出三层漏斗筛选法:1)场景刚需筛选80%选项;2)验证核心性能;3)评估边际效益。以Gemini和DeepSeek为例,前者适合常规FAQ场景年省$16,000,后者适用于金融计算场景可降低15%人工复核。建议建立动态评估体系,将3小时选型会议压缩至18分钟,错误率下降40%。核心观点:选型应从参数争论转向场景验证,通过自动化工具为工程师节省时间,聚焦提示词优化而非参数对比。

  • 华为MatePad Mini外观公布 支持蜂窝网络通话功能

    华为今日正式官宣,将于9月4日推出全新MatePad Mini小尺寸平板,并同步公开产品外观海报。这款被业界称为"大号手机"的新品,采用圆形后摄模组设计,内置双摄像头与闪光灯组件,正面配备侧边单挖孔全面屏,整体造型兼具便携性与辨识度。 海报细节透露关键功能突破——通话界面与信号标识的显示,证实MatePad Mini将支持蜂窝网络通话功能,实现平板与手机的形态融�

今日大家都在搜的词: