首页 > 业界 > 关键词  > DeepMind最新资讯  > 正文

谷歌DeepMind新方法Gecko,为测试AI图像生成器引入严格新标准

2024-04-30 09:52 · 稿源:站长之家

划重点:

⭐ 谷歌 DeepMind 发布了新的基准 Gecko,揭示了当前文本到图像 AI 评估方法的缺陷,并引入了一个包含超过10万份人类评分的严格新标准。

⭐ “Gecko” 基准通过2000个文本提示对文本到图像模型全面评估,同时提供了增强的自动评估指标,揭示了先前未被发现的模型优和劣势。

⭐ 研究人员希望通过 “Gecko” 基准的引入,能够更准确地评估和诊模型的能力,促进 AI 技术的进一步发展。

站长之家(ChinaZ.com)4月30日 消息:谷歌 DeepMind 最近的研究示了当前我们对文本到图像 AI 模型性能评估的隐藏局限性。在其发布在预印本服务器 ariv 上的研究中,他们引入了一种全新的方法称为 “Gecko”,承诺提供一个更全和可靠的基准,以评估这一蓬勃发展的技术。

image.png

研究团队在其题为 “用 Gecko 审视文本到图像评估:对度量、提示和人类评分” 的论文中警告称:“虽然文到图像生成模型已经变得无处不在,但它们并不一定生成与给定提示相一致的图。” 他们指出,目前主要用于评估 DALL-E、Midjourney 和 Stable Diffusion 等模型能力数据集和自动度量并不能全面反映实际情况。

小规模的人类评估提供了有限的解,而自动度量可能会忽略重要细微之处,甚至与人类评委产生分歧。 为了揭示这些问题,研究人员开发了 “Gecko”—— 一个新的基准套件,它为文本到图模型提供了更高难度的测试。Gecko基准通过2000个文本提示对模型进行全面考核,探究各种技能和复杂程度。它将这些提示分成具体的子技能,超越模糊的类,以准确找出限制模型的确切弱点。

研究人员还收集了对数个领先模型生成的图像进行的超过10万份人类评分。这一基准可以揭示模型性能差距是源自模型真正的局限性、模糊的提示,还是评估方法的不一致。

“Gecko” 基准还采用了一个基于问的增强自动评估指标,与人类判断更为相关。当用于比较新基准下的最先进模型时,这一组合揭示了先前未被发现的模型优势和劣势。 研究人员希望他的工作能够证明使用多样的基准和评估方法来真正了解文本到图像 AI 在实际部署前能做什么,不能做什么的重要性。他们计划免费公开 “Gecko” 代码和数据,推动进一步的进展。 因此,尽管那些看似令人印象深刻的作品可能乍一看令人印象深刻,但我们仍然需要严格的测试来区分真假。Gecko为我们展示了如何做到这一。

论文:https://arxiv.org/pdf/2404.16820

举报

  • 相关推荐
  • 品牌在deepseek、豆包里排第几?免费GEO排名查询工具帮你一键看清

    随着AI搜索普及,传统SEO正被GEO(生成式引擎优化)取代。GEO核心是提升品牌在AI生成答案中的可见度,而非获取点击流量。数据显示超60%用户已使用AI搜索,若品牌未被AI提及将失去流量入口。文章推荐免费工具AIBase,支持多平台一键检测品牌在主流AI助手的曝光排名、竞品对比及可视化报告,并提供内容权威性、语义化表达等GEO优化策略,帮助品牌在AI时代建立竞争优势。

  • 全新开源的DeepSeek-OCR,可能是最近最惊喜的模型。

    ​AI圈虽然天天卷,但是很多的模型,真的越来越无聊了。 每天就是跑分又多了几个点。 直到昨天,DeepSeek久违的发了一个新模型。 DeepSeek-OCR。 这玩意,是真的有点酷。

  • 百度智能云这项开源,让 DeepSeek-V3.2 推理服务吞吐提升 2 倍

    10月28日,百度智能云联合SGLang社区开源针对DeepSeek-V3.2优化的多token预测(MTP)技术代码。该技术通过批量生成和集中验证机制,使模型解码吞吐量提升超2倍,突破传统自回归解码的序列化瓶颈。此次开源的MTP方案已完成与DeepSeek-V3.2稀疏注意力架构的深度适配,并经过百度内部业务验证,开发者可"开箱即用"获得稳定可靠的推理加速能力。

  • Uber与Checkout.com官宣战略合作伙伴关系,为全球企业平台提供高速可靠支付服务

    英国数字支付服务商Checkout.com与出行平台Uber达成全球战略合作,将为Uber在全球主要市场的网约车及外卖平台提供收单和网关服务。凭借其全球覆盖能力与本地化专长,Checkout.com将助力Uber每日处理数百万笔交易,并通过AI技术优化支付流程,提升交易成功率与安全性。此次合作将强化Uber的全球支付体验,支持其数字出行领域的持续创新。

  • DeepSeek开源3B OCR模型:长文本识别达97%精度

    DeepSeek在GitHub开源新一代OCR模型,采用创新光学二维映射压缩技术,在长文本识别场景实现97%准确率。模型通过动态压缩生成最优视觉特征令牌,较传统方法减少60%计算冗余。实验显示在1:20压缩率下仍保持60%以上准确率,显著优于同类模型。该技术路径为OCR系统小型化提供解决方案,其动态压缩策略对大型语言模型的记忆管理机制具有重要启示。

  • 2025 PMI项目管理大会|多个活动板块首发,早鸟报名通道开启

    自2008年起,PMI项目管理大会汇聚数百位国内外顶尖企业代表、行业领袖与专家,分享洞见与实践,启发数十万参与者。当前,生成式AI、大数据等前沿科技正重塑商业生态与项目管理模式。2025年大会以“智驱万象,项启新篇”为主题,聚焦科技带来的颠覆性变革与机遇,通过行业趋势、跨界交流等多维度活动,打造最具影响力的共创平台,推动合作突破边界。报名已开启,微信搜索“2025PMI项目管理大会”即可参与。

  • 中国AI算力突围:东方超算Deep X算力盒子超国际竞品82%,重新定义行业标准

    中国公司东方超算发布Deep X G20系列AI工作站,在MLPerf测试中性能超越NVIDIA DGX Spark达82%,价格持平,实现性能与性价比"双超越"。产品搭载Intel Ultra 9285处理器和NVIDIA RTX PRO 5000显卡,AI算力达1824 TOPS,体积仅2.7L。通过三大技术创新实现突破:智能异构计算引擎提升资源利用率40%;统一推理运行时支持多框架;深度硬件优化提升关键算子性能50-200%。该产品打破国际巨头垄断,已在量化金融、医疗影像等领域实现显著投资回报,标志着中国AI硬件实现重要突破。

  • AI日报:豆包视频1.0pro fast发布;谷歌Gemini新功能上线;百度推上体体育大模型 2.0

    本期AI日报聚焦多项技术突破:火山引擎发布豆包视频生成模型1.0pro+fast,速度提升3倍且价格下降72%;百度与上海体育大学推出“上体体育大模型2.0”,拓展AI在运动员训练等场景应用;谷歌Gemini新增一键生成PPT功能;美团发布LongCat-Video模型,支持5分钟连贯视频生成;xAI推出虚拟女友Mika引发热议;MiniMax开源高性能M2编码模型;OpenAI上线企业知识管理功能;另报道20岁辍学生开发的AI笔记工具Turbo AI半年用户破500万,展现年轻创业者的技术影响力。

  • 未来iPad mini/iPad Air/MacBook都将升级OLED屏:LCD退场

    苹果正在研发搭载OLED显示屏的iPad mini、iPad Air、MacBook Pro和MacBook Air机型,苹果已在iPad Pro中采用OLED屏,并计划在未来数月及数年内将OLED推广到更多设备上,从而淘汰LCD屏幕。 具体来看,iPad mini最快会在2026年配备OLED屏,同时会提升防水性能,新款iPad mini也因此涨价100美元。 至于iPad Air,其商用OLED的时间要晚于iPad mini,爆料称2026年春季亮相的iPad Air将继续使用LCD屏幕,但后续

  • 未来AI内容竞争的本质是GEO竞争

    AI搜索崛起正改变流量格局:Google搜索零点击率升至58.5%,AI Overview导致传统结果点击率下降34.5%。未来竞争核心从SEO转向GEO(生成引擎优化),需关注三大战场:品牌在AI回答中的曝光率、推荐排名位置(首位点击率达40%)、细分场景覆盖。优化策略包括持续更新内容、增强权威背书、结构化呈现。数据显示AI推荐转化率是传统搜索的4.4倍,预计2030年AI搜索将占总量62.2%。建议立

今日大家都在搜的词: