首页 > 业界 > 关键词  > GPT最新资讯  > 正文

清华、浙大推GPT-4V开源平替!LLaVA、CogAgent等开源视觉模型大爆发

2024-01-04 09:29 · 稿源:站长之家

要点:

1、清华、浙大等中国顶尖学府提供了性能优异的GPT-4V开源替代方案。

2、LLaVA、CogAgent和BakLLaVA是三种具有极大潜力的开源视觉语言模型。

3、LLaVA在视觉聊天和推理问答方面表现出接近GPT-4水平的能力。

站长之家(ChinaZ.com)1月4日 消息:近期,GPT-4V的开源替代方案在中国的顶尖学府清华、浙大等的推动下,出现了一系列性能优异的开源视觉模型。其中,LLaVA、CogAgent和BakLLaVA是三种备受关注的开源视觉语言模型。

LLaVA是一个端到端训练的多模态大模型,它将视觉编码器和用于通用视觉和语言理解的Vicuna相结合,具备令人印象深刻的聊天能力。而CogAgent是在CogVLM基础上改进的开源视觉语言模型,拥有110亿个视觉参数和70亿个语言参数。

另外,BakLLaVA是使用LLaVA1.5架构增强的Mistral7B基础模型,已经在多个基准测试中优于LLaVA213B。这三种开源视觉模型在视觉处理领域具有极大的潜力。

LLaVA在视觉聊天和推理问答方面表现出接近GPT-4水平的能力。在视觉聊天方面,LLaVA的表现相对于GPT-4的评分达到了85%,在推理问答方面更是达到了92.53%的超过GPT-4的新SoTA。LLaVA在回答问题时,能够全面而有逻辑地生成回答,并且可以以JSON格式输出。

它不仅可以从图片中提取信息并回答问题,还可以将图片转化为JSON格式。LLaVA还可以识别验证码、识别图中的物体品种等,展现出了强大的多模态能力。在性能上接近GPT-4的情况下,LLaVA具有更高的成本效益,训练只需要8个A100即可在1天内完成。

CogAgent作为在CogVLM基础上改进的开源视觉语言模型,拥有更多的功能和性能优势。它支持更高分辨率的视觉输入和对话答题,能够处理超高分辨率图像输入。

image.png

论文地址:https://arxiv.org/pdf/2312.08914.pdf

CogAgent还提供了可视化代理的能力,能够返回任何给定任务的计划、下一步行动和带有坐标的具体操作。它还增强了与图形用户界面相关的问题解答功能,可以处理与网页、PC应用程序、移动应用程序等任何图形用户界面截图相关的问题。另外,通过改进预培训和微调,CogAgent还增强了OCR相关任务的能力。这些功能的提升使得CogAgent在多个基准测试上实现了最先进的通用性能。

BakLLaVA是使用LLaVA1.5架构增强的Mistral7B基础模型,具备更好的性能和商用能力。BakLLaVA在多个基准测试中优于LLaVA213B,并且可以在某些数据上进行微调和推理。虽然BakLLaVA在训练过程中使用了LLaVA的语料库,不允许商用,但BakLLaVA2则采用了更大的数据集和更新的架构,超越了当前的LLaVA方法,具备商用能力。

举报

  • 相关推荐
  • 像真人聊天!OpenAI发布GPT-Live:AI可同步听与说

    OpenAI发布新一代语音模型GPT-Live,让人与AI的对话更加自然流畅,体验更接近真人交流。 据介绍,目前每周有超过1.5亿人使用ChatGPT的语音和听写功能,应用场景涵盖免提日常帮助、语言练习、睡前故事讲述,以及通勤途中的闲聊陪伴。 此前的语音功能依赖于较为传统的回合制模型,在回答准确性和对话自然度方面存在局限,有时难以维持顺畅的交互节奏。 而GPT-Live实现了边�

  • OpenAI最强模型!Gpt-5.6系列发布:Codex、ChatGpt Work智能体三合一

    OpenAI全面开放GPT-5.6系列模型,采用Sol、Terra、Luna三档分层体系,旗舰Sol在编程测试中刷出高分,相较竞品输出Token减少54%、耗时缩短57%,Terra性能打平上代旗舰但价格减半。同步上线ChatGPT Work原生智能体,可跨软件自主执行复杂任务,并整合独立编码工具Codex至统一桌面客户端,聊天、办公与代码开发一站汇聚。

  • AI日报:GPT5.6系列模型发布 Codex消失;腾讯拟接盘Manus成最大股东;MiniMax创始人宣布零薪酬直至实现AGI

    本文汇总AI领域最新动态:ChatGPT扩展程序深度融入Chrome浏览器,实现网页浏览与文件操作;OpenAI发布主打网络安全与性价比的GPT-5.6系列,并推出企业工具ChatGPT+Work。此外,Anthropic推出AI使用分析功能,腾讯拟以20亿美元入股Manus,字节跳动视频模型Seedance2.5即将全面开放API。硬件方面,蚂蚁灵波发布原生动作模型,三星正研发4nm AI PC芯片“GAIA”,MiniMax则以160亿港元融资加码AGI研

  • 重磅福利!OpenAI官宣:GPT 5.5 Instant明日全民免费

    OpenAI今日正式宣布,旗下最新模型GPT-5.5 Instant已向全球付费用户开放,并将于26日全面推送至所有免费用户。 这是OpenAI进入2026年以来规模最广的一次产品升级,GPT-5.5 Instant将直接取代原有的GPT-5.3 Instant,成为ChatGPT全平台默认模型,承载数亿活跃用户的日常对话。 在性能表现上,Open AI官方数据显示,新版模型在医疗、法律、金融等高风险领域的幻觉率较上一代GPT-5.3 Instant下�

  • AI日报:Claude Cowork登陆网页和手机端;美国放行GPT-5.6;Meta超级智能实验室首发图像生成模型

    AI日报要点:1. Meta发布免费图像模型Muse,登陆Instagram/WhatsApp并推视频计划;2. 美国解除GPT-5.6限制,OpenAI本周将推Sol等新模型;3. Claude Cowork转型全能办公搭子,支持跨设备非编程场景;4. 淘宝高管指行业缺乏AI交互,强调即时零售核心三要素;5. 微软在Excel/Outlook中引入自研AI模型,逐步替代OpenAI;6. 推出内置大模型的AI电子宠物Domi,主打环保与智能陪伴;7. OpenAI前研究员田永龙加入腾讯混元团队,主攻视觉语言模型;8. Steam调查显示43%玩家接受AI游戏,多数不将其作为购买决策关键。

  • AI日报:苹果Xcode 26.6正式发布;美团“小店有AI”行动落地北京;OpenAI受限发布GPT-5.6

    苹果Xcode 26.6集成谷歌Gemini编程助手并升级SDK,提升开发效率;OpenAI受限监管仅向少数伙伴开放GPT-5.0,需政府审批;美团“小店有AI”落地北京,免费课程服务超百万餐饮商家;Adobe收购Topaz Labs深化Firefly生态;Patronus AI融资5000万美元,构建数字世界测试智能体;Notion将于9月关闭AI邮箱;Claude付费用户激增75%,挑战ChatGPT消费市场;Mistral AI发布OCR4,支持170种语言输出质量领先。

  • GPT-3

    最近 GPT-3 火了!这一个新的语言模型 GPT-3 在硅谷迅速成为了推特的热搜关键词。这个由 OpenAI 创建的大型机器学习模型,它不仅可以自己写论文,还会写诗歌,就连你写的代码都能帮你写了。

  • 微软独家授权OpenAI的突破性GPT-3文本生成模型

    微软扩大了与旧金山人工智能研究公司OpenAI的持续合作关系,并获得了AI公司开创性的GPT-3语言模型的新独家许可,该模型是一种自动生成的文本程序,已成为业内同类软件中最复杂的一种。两家公司已经通过OpenAI 正在进行的Azure云计算合同相互纠缠,其中Azure是OpenAI用来访问其训练许多模型所需的大量计算资源的平台,并且微软去年做出了10亿美元的重大投资,成为OpenAI的独家授权云提供商。现在,微软通过获得GPT-3的?

  • OpenAI将向更多开发者开放GPT-3自然语言处理模型的访问

    OpenAI 在周四上午的公告中表示,GPT-3 已经变得更加开放。随着这家人工智能研究机构取消访问其自然语言处理(NLP)应用程序接口(API)的等候名单,此举意味着 OpenAI 已对该程序感到足够安全和自信,后续将有助于推动业内领先的读写 AI 模型的访问。Axios 指出,来自受支持地图的开发者们,将很快能够注册访问 OpenAI 的 GPT-3 API 并立即开展体验。此前,开发者需要先坐在等候名单上、静待官方审核通过,然后才能获得实验性质的

  • 微软宣布推出Azure OpenAI服务 为开发者带来GPT-3机器学习模型

    微软今日宣布推出 Azure OpenAI 服务,意味着广大客户将可在 Azure 上轻松使用 OpenAI 的 GPT-3 机器学习模型。作为 OpenAI 的开创性语言模型,在适当的条件下,你甚至只需输入几条简短的提示信息,就可以让 GPT-3 输出像是人类的文本。不过目前 Azure OpenAI 仍处于有限体验的阶段,即使愿意付费,也要再等待一段时间。微软表示,Azure OpenAI 现仅限邀请、适用于“计划实施定义明确的用例的客户”,包括使用人工智能技术来制定负

今日大家都在搜的词: