首页 > 业界 > 关键词  > AIM最新资讯  > 正文

苹果AIM自回归视觉模型验证性能与模型规模有关

2024-01-18 17:01 · 稿源:站长之家

要点:

1. 随着容量或预训练数据量的增加,模型性能不断提升。

2. 论文证实自回归训练对于图像模型学习表征能力具有扩展性。

3. 自回归目标足以满足视觉特征的训练要求,且没有饱和的迹象。

站长之家(ChinaZ.com)1月18日 消息:苹果公司的研究者通过自回归图像模型(AIM)验证了视觉模型“参数越多性能越强”的规律,进一步证明随着容量或预训练数据量的增加,模型能不断提升性能。AIM能有效利用大量未经整理的图像数据,训练方法和稳定性与最近的大型语言模型(LLM)类似。这一观察结果与之前关于扩展大型语言模型的研究结果是一致的。

虽然本文实验所使用的模型规模有限,还需进一步探索是否能在更大参数量级的模型上验证此规律。研究者使用的预训练目标遵循应用于图像 patch 序列的标准自回归模型,通过一系列实验和研究,验证了模型容量可以轻松扩展到数十亿个参数,同时对下游任务有很好的性能。

image.png

项目地址:https://top.aibase.com/tool/aim

此外,研究者对自回归目标训练 ViT 模型的多方面进行了探讨,并且重新审视了之前的工作。研究者的实验报告显示,在整个训练过程中,优化目标直接带来更好的下游性能,而随着模型容量的增加,损失值和下游任务的准确性都有所提高。这一观察结果与在 LLMs 中观察到的趋势一致,反映了优化目标会直接带来更好的下游性能。

image.png

在 AIM 的设计参数中,除了扩展宽度,研究者还特别采用了一种简单设计,使用多层感知机块,独立地对每个 patch 进行处理。研究者同时强调,研究的模型规模有限,对更大参数量级的模型上验证此规律还有待进一步探索。

论文的实验结果证明了视觉模型同样遵循「参数越多性能越强」的规律,自回归训练对图像模型具有很好的扩展性,并能够满足视觉特征的训练要求。对未来图像模型性能提升和优化提供了新的研究方向和思路。

举报

  • 相关推荐
  • 当大模型公司开始造手机

    喧嚣的国内AI赛道,阶跃星辰一直是相对低调的那一家。可随着智谱、MiniMax首批限售股解禁,月之暗面连拿融资,估值逼近300亿美元,这家自诩“静水深流”的公司,似乎也已按捺不住心中的浪涌。 7月13日,阶跃星辰一口气打出了三张牌:大模型原生AI终端品牌STEPX、智能体原生操作系统Step AOS,以及个人智能体阶跃Amoo。 作为STEPX的首款产品,搭载Step AOS、内置Amoo的全球首款大

  • 苹果研发AI模型压缩技术:把270亿参数大模型装进iPhone

    苹果正与硅谷初创公司PrismML进行早期洽谈,后者宣称能将大型AI模型压缩至可在iPhone上本地运行。若技术验证成功,此举将强化苹果的隐私主张,并为其进展缓慢的Siri升级提供关键支撑。 PrismML首席执行官表示,苹果已开始评估其技术。洽谈尚处于早期阶段,前景虽不明朗,但进展顺利”。 消息发布正值苹果推出iOS 27公测版次日这是苹果大幅改版Siri后首次面向公众的广泛测�

  • 上线仅仅一周!腾讯混元大模型Hy3总调用量增长超68倍

    腾讯混元官方发文称,截至今日,腾讯混元大模型Hy3总调用量较上一代模型(Hy2)增长已超68倍。 同时,延续了Hy3 preview版本的增长态势,Hy3展现出更高的增长斜率;发布一周后,Hy3在OpenRouter全球大模型调用量总榜排名第一。 在Agent产品中,Hy3也展现出更强的竞争力,WorkBuddy自选模型的用户中,选择Hy3的占比达到60%。

  • 手机新物种!阶跃推出全球首款大模型原生智能体手机

    阶跃终端于7月13日推出全球首款大模型原生智能体手机,搭载智能体原生系统Step+AOS与智能体Amoo,打造模型、软件、硬件“三位一体”的AI新物种。 Step+AOS具备记忆、决策与执行、安全三大能力,采用端云协同架构实现快反应与深思考,通过层级协调机制动态选择模型,并将交互从过程转向结果,支持多模态自然表达,实现意图直达服务。 Amoo能主动学习用户习惯、感知环境,越用越聪明。生态方面已与携程、支付宝、滴滴等达成合作,覆盖出行、政务、生活、办公等全场景服务,构建智能体新体验。

  • “首发,前沿大模型突破渗透测试新范式”——绿盟智能渗透测试系统2.0正式发布

    绿盟科技发布AI-PTS2.0,基于智谱GLM-5.2大模型,实现端到端自动化渗透测试闭环。核心突破在于从工具调度转向复杂业务逻辑漏洞挖掘,支持长周期、高对抗场景。通过Web测绘、威胁建模与跨接口关联推理,首次自主验证业务逻辑漏洞;并具实时编程突破高防护能力。依托专家知识资产化、三层上下文压缩与长程记忆,结合数据飞轮持续进化,推动渗透测试从“按规则执行”迈向“按目标推理”,抢占人机协同的AI对抗新高点。

  • 超越Opus 4.7美国顶级大模型 Kimi K3即将发布:2.5万亿怪兽级AI

    这个月会有多款国产重量级大模型发布,除了DeepSeek V4正式版之外,最受关注的当属月之暗面Kimi K3,最新内测显示其超越了美国顶级大模型Opus 4.7。 Kimi官方昨晚实际上都预告了K3的发布,显示会从今天开始有充值优惠活动,但很快又把页面下架,即便如此K3的发布也就是这一两天的事了。 至于Kimi K3的性能水平,有提前测试的网友给出了一些对比结果,跑分结果超越了Opus 4.7、

  • 撞期DS V4 谷歌Gemini 3.5 Pro大模型被指17日发布:性能显著提升

    5月份的IO大会上谷歌宣布旗舰大模型Gemini 3.5 Pro会在6月发布,但最终还是跳票了,期间又经历了多位AI大牛离职跳槽到对手公司中,士气大落。 最新消息称,Gemini 3.5 Pro大模型会在7月17日发布,有意思的是7月中旬这个时间点恰好是DeepSeek V4正式版发布的日子,国内外两款旗舰大模型同场比拼值得关注下。 Gemini 3.5 Pro之所以延期发布,原因就在于团队希望用额外的时间来进行新�

  • 腾讯WorkBuddy首发接入混元Hy3大模型:限时免费!适配办公全场景

    腾讯办公AI WorkBuddy首发接入295B参数的混合专家模型Hy3,开启两周免费试用。该模型采用快慢双思考机制,任务解决率达90%,交付周期缩短近1/3。办公场景下强化了长文档处理与多工具自主协同,代码方面重点优化前端全链路生成调试能力,成本控制友好,适合长期作为主力模型。

  • 月之暗面最强模型!Kimi K3发布:全球首个开源3万亿级别模型

    月之暗面发布Kimi迄今最强模型K3,参数达2.8万亿,是全球首个开源3万亿级模型,支持100万Token上下文与原生视觉理解。它面向长程编程、知识工作与复杂推理,擅长长时工程任务、视觉闭环迭代与芯片设计等场景。API已开放,百万Token缓存命中输入仅2元,编程场景缓存命中率超90%,实际输入成本约标价1/4。整体表现虽落后最强闭源模型,但内部评估达前沿水平。

  • 小米发布并开源Xiaomi-Robotics-U0:380亿参数具身生成大模型!生成效率提升83倍

    今日,小米正式发布并全量开源380亿参数多模态自回归具身生成基础模型Xiaomi-Robotics-U0,是行业首个可统一覆盖四类核心具身生成任务的一体化方案。 该模型打破以往机器人场景、轨迹、视频生成模型相互割裂的行业现状,能够自主生成、扩增机器人训练所需图像与视频数据,解决真机采集极端、危险、长尾场景数据成本高、难度大的痛点。 依托自研FlashAR 推理加速方案,�

今日大家都在搜的词: