首页 > 业界 > 关键词  > 多模态最新资讯  > 正文

马毅团队新研究:微调多模态大模型会灾难性遗忘

2023-09-28 10:13 · 稿源:站长之家

要点:

1. 马毅团队提出了EMT框架,评估微调后的多模态大模型(MLLM)的灾难性遗忘。

2. 实验表明,微调MLLM在提升微调数据集性能的同时,也导致其他数据集性能下降。

3. 微调过程中,MLLM会产生与微调数据集相关的幻觉文本,忽略原始问题。

站长之家(ChinaZ.com)9月28日 消息:随着GPT-4的发布,多模态大模型(MLLM)成为热点。业界常将视觉编码器与语言模型集成构建MLLM。尽管微调后的MLLM在视觉语言任务上表现强劲,但仍面临灾难性遗忘的问题,即过拟合微调数据集后,在其他任务上的性能下降。

image.png

论文地址:https://arxiv.org/pdf/2309.10313.pdf

马毅团队提出了EMT框架,专门评估MLLM的灾难性遗忘。流程是:

1)输入图像;

2)要求MLLM分类;

3)用另一个语言模型评估分类正确性。

结果显示,测试的MLLM大多无法保持与视觉编码器相近的分类性能。

研究还针对LLaVA做了微调实验。证实了适度微调有益,但过度微调会导致非微调任务遗忘。另外,微调后的MLLM会产生与微调数据集相关的幻觉文本,而非原始问题。

本研究首次系统评估了MLLM中的灾难性遗忘问题,为后续工作提供了框架和基准。遗忘问题的产生也启示我们,在追求单任务性能的同时,还需注意保持模型的泛化能力,防止过拟合。模型设计和训练技巧仍需进一步优化,以平衡不同能力之间的权衡。

举报

  • 相关推荐
  • 华数云与支付宝就业达成战略合作 多模态人才测评能力进入规模化应用阶段

    外滩大会上,华数云与支付宝就业签署战略合作,联合诚通人力、富士康等企业,围绕数字化就业平台、多模态AI评测、岗位对接等打造AI就业服务体系。华数云以自研“华数灵芯—行为与人格大模型”,通过多模态数据建模替代简历匹配,形成人才画像与人岗精准匹配闭环,已服务超10万人次。

  • AI日报:World Labs推多模态世界模型Atlas;WorkBuddy宣布开放平台上线;网信办重点整治AI换脸、魔改名著

    本期AI日报:World Labs发布首个多模态世界模型Atlas,像素级镜头控制生成3D视频;腾讯WorkBuddy全面开放Agent基座;网信办整治AI换脸等乱象;努比亚与豆包合作推出AI智能体手机NaviX Ultra;Meta发布实时音频感知模型;Anthropic发布Fable 5.1,性能提升成本降四成;谷歌Gemini 3.8 Flash即将上线,并推出AI修图工具Pics。

  • 天下苦闭源模型久矣,MiniMax H3要做多模态领域的Deepseek

    2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。 A 天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。 MiniMax发布的H3,正是视频生成市场的一个全新选择。 官方博客中表示,定位H3

  • AI日报:千问办公首发上线Qwen3.8-Flash;智谱开源多模态大模型GLM-5.3-Flash;京东“超脑”3.0大模型亮相

    AI日报要点:千问办公上线Qwen3.8-Flash,推双模式;智谱开源GLM-5.3-Flash,价格降至1/40;腾讯混元1.8B翻译模型压缩至440MB,用于B站弹幕实时翻译;北京首例AIGC商业秘密案罚10万;京东发布“超脑”3.0物流大模型;FF发布两款机器人;谷歌升级Gemini Live语音;Claude Cowork内置浏览器,可独立完成网页操作。

  • AI日报:商汤开源8B轻量多模态大模型;腾讯新一代大模型Hy4将发布;Grok Build重磅上线网页与移动端

    AI日报要点:商汤开源8B多模态模型;腾讯Hy4将发布,驱动WorkBuddy;Grok Build上线,自然语言生成应用;Adobe Firefly音频工具上线;阿里Qwen-UI-Agent在GUI基准超越GPT/Claude;研究称ChatGPT后超三成网页现AI痕迹;千问新增GLM-5.3、DeepSeek-V4-Pro;豆包上线技能、连接器与工作伙伴。

  • 语音、手势、触控、人脸等,思必驰多模态交互开启智能经济时代

    人类的交互通道有眼耳鼻舌口等器官,他们充当着外在世界信号的“接收器”,将范围内的信号接收并传递给“大脑”。在机器世界里,从过去鼠标键盘转变成当下的触控、语音、手势、视觉等,多模态人机交互技术正在彼此融合。目前智能语音具备兼顾老人、儿童以及地方方言的能力,语音与视觉,触屏,LCD反馈显示结合的交互体验,令交互门槛的不断降低。国内专业的对话式AI企业思必驰,结合全链路语音交互技术及自研计算机视觉技术推出多?

  • 支付安全再升级,瑞银信押注多模态技术

    支付业务作为所有金融服务的基础入口,安全性始终是其最关键的考量因素。从最基础的密码验证,到数字密钥、指纹识别、面部识别等支付验证技术,每一次支付安全背后都是越来越严峻的风险形势。在支付领域深耕十余年的瑞银信,对支付安全技术有着长期的探索积累,并在近期将目光投向了多模态技术。模态是指任何一种信息的来源,例如指纹、人脸、声纹、步态、虹膜、语音等都可以被称之为一种模态。而所谓多模态识别技术,则是指综合运

  • 多模态生物识别成趋势,指静脉识别优势显著!

    随着生物识别技术不断发展,在日常人们更容易感受到生物识别技术带来的便利,例如AI人脸识别破案、指纹手机解锁、刷指静脉过闸等,生物识别越来越频繁地出现在大众的视野。在当下众多生物识别方式中,指纹识别是我们最常见的识别方式之一,成本也相对较低,但是关于指纹识别存在的安全隐患频频出现在新闻之中。对于国内的技术工作者甚至是创新型企业,无疑是一种对更高安全识别技术挑战。近年人脸识别、虹膜识别、指静脉识别技术有

  • Turing OS 机器人操作系统大升级,多模态交互再增强

    今年7月的图灵机器人创新大会上,图灵机器人团队正式对外发布了Turing OS 1.5。图灵机器人曾在2015年发布首款人工智能级的机器人操作系统——Turing OS,是智能机器人专属的操作系统。半年后,伴随着升级版本的到来,团队一次连发几十款机器人应用,并全面加强Turing OS系统,开放图灵机器人平台新服务。经过紧张的调试与准备,10月13日,Turing OS 1.5测试版正式上线。据了解,除了之前会上特别介绍过的机器人应用、视觉能力及主?

  • 亚略特助力非洲首个多模态生物识别国家身份证中心落成

    2019 年 11 月 8 日,安哥拉司法和人权部国家身份与犯罪综合管理平台项目(以下简称“国家身份证中心”)举行落成仪式,这标志着非洲首个多模态生物识别国家身份证体系正式上线。安哥拉总统洛伦索出席剪彩仪式并对该项目给予高度评价,表示该中心将有效提高安哥拉公共服务水平,为经济社会良好稳定发展发挥重要作用。安哥拉国家身份证中心于 2018 年 6 月开始筹建,是安哥拉最高级别的身份证管理机构,具备数据处理、身份证制作等?

今日大家都在搜的词: