首页 > 业界 > 关键词  > 大模型最新资讯  > 正文

南洋理工推80亿参数多模态大模型OtterHD

2023-11-27 16:58 · 稿源:站长之家

要点:

1、OtterHD 是一个80亿参数的多模态大模型,可以处理高分辨率图像并具有通用性。

2、OtterHD 通过基于 Fuyu-8B 进行指令微调,并使用 FlashAttention 资源库中的算子融合技术来提高性能。

3、OtterHD 在新的基准测试 MagnifierBench 上展现出出色的表现,特别是在处理复杂场景中的细节方面。

站长之家(ChinaZ.com)11月27日 消息:最近,南洋理工华人团队提出的80亿参数多模态大模型 OtterHD 引起了人们的关注。与其他模型相比,OtterHD 具有处理高分辨率图像的能力,并且具有通用性,能够应对各种推理需求。团队通过在 Fuyu-8B 上进行指令微调,并使用 FlashAttention 资源库中的算子融合技术,进一步提高了模型的性能。

通过这些改进,OtterHD 在直接处理高分辨率输入时表现出色,尤其在新的基准测试 MagnifierBench 上的表现令人印象深刻。MagnifierBench 旨在评估语言模型在复杂场景中辨别细节的能力,OtterHD 在这个测试中取得了优秀的成绩。这些结果表明,OtterHD 是一个非常有潜力的模型,可以用于处理各种高分辨率图像,并在细节辨别方面表现出色。

image.png

论文地址:https://arxiv.org/pdf/2311.04219.pdf

这项研究的一个关键点是 OtterHD 的处理能力。由于其80亿参数的规模,OtterHD 能够处理高分辨率图像,并且具有通用性,可以适应不同的推理需求。与传统模型不同,OtterHD 具有处理灵活输入尺寸的能力,这使得它能够应对各种不同分辨率的图像,并且在处理高分辨率输入时表现出色。团队还通过基于 Fuyu-8B 进行指令微调和算子融合技术的运用,进一步提高了模型的性能。这些改进使得 OtterHD 在处理高分辨率图像和复杂场景中的细节方面表现出色。

另一个关键点是团队提出的基准测试 MagnifierBench。这个基准测试旨在评估语言模型在复杂场景中辨别细节的能力。通过使用 PVSG 数据集制作了一个涵盖283组问题的测试基准,团队可以更好地评估模型的性能。结果显示,OtterHD 在 MagnifierBench 上表现出色,特别是在处理高分辨率图像和复杂场景中的细节方面。这表明 OtterHD 具有较强的辨别细节的能力,对于处理复杂场景中的图像具有优势。

总的来说,OtterHD 是一个具有80亿参数的多模态大模型,具有处理高分辨率图像和通用性的能力。通过基于 Fuyu-8B 进行指令微调和算子融合技术的应用,OtterHD 在处理高分辨率图像和复杂场景中的细节方面表现出色。通过新的基准测试 MagnifierBench 的评估,团队展示了 OtterHD 在细节辨别方面的优势。这些结果表明,OtterHD 是一个非常有潜力的模型,在处理各种高分辨率图像和复杂场景中具有广泛应用的前景。

举报

  • 相关推荐
  • 苹果研发AI模型压缩技术:把270亿参数大模型装进iPhone

    苹果正与硅谷初创公司PrismML进行早期洽谈,后者宣称能将大型AI模型压缩至可在iPhone上本地运行。若技术验证成功,此举将强化苹果的隐私主张,并为其进展缓慢的Siri升级提供关键支撑。 PrismML首席执行官表示,苹果已开始评估其技术。洽谈尚处于早期阶段,前景虽不明朗,但进展顺利”。 消息发布正值苹果推出iOS 27公测版次日这是苹果大幅改版Siri后首次面向公众的广泛测�

  • 上线仅仅一周!腾讯混元大模型Hy3总调用量增长超68倍

    腾讯混元官方发文称,截至今日,腾讯混元大模型Hy3总调用量较上一代模型(Hy2)增长已超68倍。 同时,延续了Hy3 preview版本的增长态势,Hy3展现出更高的增长斜率;发布一周后,Hy3在OpenRouter全球大模型调用量总榜排名第一。 在Agent产品中,Hy3也展现出更强的竞争力,WorkBuddy自选模型的用户中,选择Hy3的占比达到60%。

  • 手机新物种!阶跃推出全球首款大模型原生智能体手机

    阶跃终端于7月13日推出全球首款大模型原生智能体手机,搭载智能体原生系统Step+AOS与智能体Amoo,打造模型、软件、硬件“三位一体”的AI新物种。 Step+AOS具备记忆、决策与执行、安全三大能力,采用端云协同架构实现快反应与深思考,通过层级协调机制动态选择模型,并将交互从过程转向结果,支持多模态自然表达,实现意图直达服务。 Amoo能主动学习用户习惯、感知环境,越用越聪明。生态方面已与携程、支付宝、滴滴等达成合作,覆盖出行、政务、生活、办公等全场景服务,构建智能体新体验。

  • “首发,前沿大模型突破渗透测试新范式”——绿盟智能渗透测试系统2.0正式发布

    绿盟科技发布AI-PTS2.0,基于智谱GLM-5.2大模型,实现端到端自动化渗透测试闭环。核心突破在于从工具调度转向复杂业务逻辑漏洞挖掘,支持长周期、高对抗场景。通过Web测绘、威胁建模与跨接口关联推理,首次自主验证业务逻辑漏洞;并具实时编程突破高防护能力。依托专家知识资产化、三层上下文压缩与长程记忆,结合数据飞轮持续进化,推动渗透测试从“按规则执行”迈向“按目标推理”,抢占人机协同的AI对抗新高点。

  • 超越Opus 4.7美国顶级大模型 Kimi K3即将发布:2.5万亿怪兽级AI

    这个月会有多款国产重量级大模型发布,除了DeepSeek V4正式版之外,最受关注的当属月之暗面Kimi K3,最新内测显示其超越了美国顶级大模型Opus 4.7。 Kimi官方昨晚实际上都预告了K3的发布,显示会从今天开始有充值优惠活动,但很快又把页面下架,即便如此K3的发布也就是这一两天的事了。 至于Kimi K3的性能水平,有提前测试的网友给出了一些对比结果,跑分结果超越了Opus 4.7、

  • 当大模型公司开始造手机

    喧嚣的国内AI赛道,阶跃星辰一直是相对低调的那一家。可随着智谱、MiniMax首批限售股解禁,月之暗面连拿融资,估值逼近300亿美元,这家自诩“静水深流”的公司,似乎也已按捺不住心中的浪涌。 7月13日,阶跃星辰一口气打出了三张牌:大模型原生AI终端品牌STEPX、智能体原生操作系统Step AOS,以及个人智能体阶跃Amoo。 作为STEPX的首款产品,搭载Step AOS、内置Amoo的全球首款大

  • 撞期DS V4 谷歌Gemini 3.5 Pro大模型被指17日发布:性能显著提升

    5月份的IO大会上谷歌宣布旗舰大模型Gemini 3.5 Pro会在6月发布,但最终还是跳票了,期间又经历了多位AI大牛离职跳槽到对手公司中,士气大落。 最新消息称,Gemini 3.5 Pro大模型会在7月17日发布,有意思的是7月中旬这个时间点恰好是DeepSeek V4正式版发布的日子,国内外两款旗舰大模型同场比拼值得关注下。 Gemini 3.5 Pro之所以延期发布,原因就在于团队希望用额外的时间来进行新�

  • 腾讯WorkBuddy首发接入混元Hy3大模型:限时免费!适配办公全场景

    腾讯办公AI WorkBuddy首发接入295B参数的混合专家模型Hy3,开启两周免费试用。该模型采用快慢双思考机制,任务解决率达90%,交付周期缩短近1/3。办公场景下强化了长文档处理与多工具自主协同,代码方面重点优化前端全链路生成调试能力,成本控制友好,适合长期作为主力模型。

  • 小米发布并开源Xiaomi-Robotics-U0:380亿参数具身生成大模型!生成效率提升83倍

    今日,小米正式发布并全量开源380亿参数多模态自回归具身生成基础模型Xiaomi-Robotics-U0,是行业首个可统一覆盖四类核心具身生成任务的一体化方案。 该模型打破以往机器人场景、轨迹、视频生成模型相互割裂的行业现状,能够自主生成、扩增机器人训练所需图像与视频数据,解决真机采集极端、危险、长尾场景数据成本高、难度大的痛点。 依托自研FlashAR 推理加速方案,�

  • 马斯克:Grok 4.5内测已比肩Opus 今年每月都一个大模型

    马斯克在其社交平台X上发文宣布,旗下最新一代大语言模型Grok 4.5已在SpaceX和特斯拉内部启动Beta测试,后续将逐步向更广泛用户开放。 据马斯克透露,早期评测结果显示,Grok 4.5的性能已接近乃至超越Anthropic的旗舰模型Claude Opus。当前,强化学习(RL)仍在持续显著提升模型表现,与此同时,配套的Grok Build”测试基准也在不断优化完善。 这位亿万富翁企业家进一步表示,Space

今日大家都在搜的词: