首页 > 业界 > 关键词  > 阿里最新资讯  > 正文

新SOTA来了:国产9B模型多项得分超4o-mini,中国出海电商已经用上了

2024-09-19 17:42 · 稿源: 量子位公众号

声明:本文来自于微信公众号 量子位,作者:茕茕,授权站长之家转载发布。

阿里开源,又拿第一了。

这次是在多模态领域:

就在刚刚,阿里国际AI团队开源多模态大模型Ovis1.6。在多模态权威综合评测基准OpenCompass上,Ovis1.6-Gemma2-9B版本综合得分超越Qwen2VL-7B、InternVL2-26B和MiniCPM-V-2.6等主流开源模型,在300亿以下参数开源模型中位居第一

在数学推理和视觉理解等多项任务中,得分甚至超过了闭源的GPT-4o-mini。

图片

具体来说,Ovis1.6能胜任视觉感知推理、数学和科学、生活场景等多种多模态任务。

拿大家伙儿都很关注的数理能力举个例子,Ovis1.6的表现是酱婶的:

图片

妈妈再也不用担心我学不明白大学数学。

用来辅助读读论文:

图片

分析财报,效果也相当不错。

图片

还能当场看图教你做一道经典的炸鱼薯条(手动狗头)。

图片

值得一提的是,阿里国际的Ovis系列多模态大模型,遵循的是Apache2.0开源协议。也就是说,协议很宽松,商用很友好

从结构上对齐视觉和文本嵌入

话不多说,我们照例来拆解一下Ovis这个新科第一背后的技术细节。

根据OpenCompass评测基准,Ovis1.6-Gemma2-9B超过了Qwen2-VL-7B、MiniCPM-V-2.6等一众相同参数量级的知名多模态模型。

在数学等推理任务中,甚至有媲美70B参数模型的表现。

Ovis1.6的幻觉现象和错误率也低于同级别模型,展现了更高的文本质量和准确率。

图片

如何做到?阿里国际AI团队的核心思路是:从结构上对齐视觉和文本嵌入。

当前,多数开源多模态大语言模型(MLLM)并非从头训练整个模型,而是通过像多层感知机(MLP)这样的连接器,将预训练的大语言模型(LLM)和视觉Transformer集成起来,给LLM装上“眼睛”。

这样一来,就导致了一个问题:MLLM的文本和视觉模块采用不同的嵌入策略,使得视觉和文本信息没办法无缝融合,限制了模型性能的进一步提升。

针对这个问题,Ovis采用了视觉tokenizer+视觉嵌入表+大语言模型的架构

图片

Ovis借鉴了大语言模型中的文本嵌入策略,引入了可学习的视觉嵌入表,将连续的视觉特征先转换为概率化的视觉token,再经由视觉嵌入表多次索引加权得到结构化的视觉嵌入。

文本方面,Ovis沿用当前大语言模型的处理方式,文本tokenizer将输入文本转化为one-hot token,并根据文本嵌入表查找到每个文本token对应的嵌入向量。

最后,Ovis将所有视觉嵌入向量与文本嵌入向量拼接起来,经由Transformer处理,完成多模态任务。

此次开源的Ovis1.6,相较于前代Ovis1.5,还在架构、数据、训练策略等方面做出了进一步优化。

架构方面,采用动态子图方案,能灵活应对不同分辨率图像特征,提升了模型处理复杂视觉任务的能力。

数据方面,Ovis1.6在训练中涵盖了多种类型的数据集,包括Caption、OCR、Table、Chart、Math等,确保模型在广泛的应用场景中都有出色表现。

训练策略方面,采用DPO等方案持续优化模型性能,增强了模型在生成文本和理解复杂指令方面的能力,使得模型在复杂任务上的表现进一步提升。

消融实验的结果还显示,在训练数据、模型参数、LLM和视觉底座都保持相同的情况下,与基于MLP连接器的多模态大模型架构相比,Ovis性能整体提升了8.8%。

量子位还了解到,作为一项基础研究,Ovis目前已经被广泛应用到了阿里国际的实际业务中。

AI能力变革出海电商

正如大家所知,阿里国际是一家AI驱动的、拥有多个全球知名电商的公司。

而事实上,出海电商这个场景,早已第一批被AIGC“渗透”。

原因很直接:做出海生意,往往面临海外市场复杂、成本和竞争压力大、跨境人才短缺等等共性问题,而多模态大模型这样的AIGC技术,恰恰能在这些问题上,提供适配的降本增效方案。

举个例子,在跨境电商领域,退货退款一直是影响用户体验的重要因素。

传统方案是人工进行退款退货的审核和判责。这不仅需要大量审核人力和较久的审核时间,还会因为人工主观的评判标准不一,导致判罚的不稳定性较高。多数平台为了保证用户体验,倾向于给消费者更多的倾斜,但这也伤害了部分商家和平台的权益。

现在,基于Ovis,阿里国际融合过去积累的大量电商知识,上线了智能退款系统。

相比于人工,Ovis针对用户提供的退货退款图文和视频详情,可以提供秒级的审核服务,且具有高度稳定的一致性。这就在保证消费者和商家公平权益的同时,实现了快速低成本的退货退款方案。

图片

另外,在商品属性提取、生成卖点等场景中,Ovis也已落地应用。

阿里国际AI团队,正是在如此预判下成立试跑的。而就在成立这一年多时间里,阿里国际已经实现AI能力在跨境电商领域的规模化应用:

AI发布商品达到百万规模,并且通过AI优化,这些产品在海外的搜索量提升了37%。

AI能力覆盖营销、客户服务、商品发布、设计、合规等40+应用场景,服务全球50万商家。

阿里国际AI能力日均超5千万次调用,规模每两月翻番。

……

Ovis之外,阿里国际还构建了多语言增强大模型Marco,电商版多模态大模型MarcoVL,提供的MaaS服务包括:

  • 多语言文本生成技术:为商品详情描述适配当地语言,让AI为商品介绍改写优化多语言标题,突破语言和文化壁垒。

  • AI图片处理,比如一键生成多张虚拟试衣效果。

图片

以及智能消除、智能抠图等图像设计类能力。

可以说,从创立店铺到市场营销,再到售前售后,在出海电商的各个环节,阿里国际都已提供相应的AI技术予以辅助——

潜移默化中,AI已经完全改变商家的工作方式和生产效率。

图片

店铺设计来自AI

大模型之所以能在各行各业掀起惊涛骇浪,核心原因就是对生产力的解放和降本增效。

在这一波变革之中,对于阿里国际这样的平台而言,AI技术能力再次成为最受关注的核心竞争力。

而借助平台之力,出海电商商家已经开始第一批享受拥抱AI的红利。

对于广大开发者而言,来自于实干家们的开源贡献,亦是福音。

Ovis1.6开源地址和Demo:

arXiv:https://arxiv.org/abs/2405.20797

Github:https://github.com/AIDC-AI/Ovis

Huggingface:https://huggingface.co/AIDC-AI/Ovis1.6-Gemma2-9B

Demo:https://huggingface.co/spaces/AIDC-AI/Ovis1.6-Gemma2-9B

举报

  • 相关推荐
  • 大家在看
  • Canvas:与ChatGPT协作的新方式

    Canvas是OpenAI推出的一个新界面,旨在通过与ChatGPT的协作来改进写作和编码项目。它允许用户在一个单独的窗口中与ChatGPT一起工作,超越了简单的聊天界面。Canvas利用GPT-4o模型,能够更好地理解用户的上下文,并提供内联反馈和建议。它支持直接编辑文本或代码,并提供快捷操作菜单,帮助用户调整写作长度、调试代码等。Canvas还支持版本回溯,帮助用户管理项目的不同版本。

  • Text Behind Image:轻松创建文字背景图片设计。

    Text Behind Image 是一个开源的设计工具,允许用户轻松创建文字背景图片设计。它提供了一个简洁的界面,让用户可以自由地在图片上添加文字,创造出独特的视觉效果。这个工具对于设计师、社交媒体运营者和内容创作者来说非常有用,因为它可以快速生成具有吸引力的视觉内容。

  • torchao:PyTorch原生量化和稀疏性训练与推理库

    torchao是PyTorch的一个库,专注于自定义数据类型和优化,支持量化和稀疏化权重、梯度、优化器和激活函数,用于推理和训练。它与torch.compile()和FSDP2兼容,能够为大多数PyTorch模型提供加速。torchao旨在通过量化感知训练(QAT)和后训练量化(PTQ)等技术,提高模型的推理速度和内存效率,同时尽量减小精度损失。

  • LFMs:新一代生成式AI模型

    Liquid Foundation Models (LFMs) 是一系列新型的生成式AI模型,它们在各种规模上都达到了最先进的性能,同时保持了更小的内存占用和更高效的推理效率。LFMs 利用动态系统理论、信号处理和数值线性代数的计算单元,可以处理包括视频、音频、文本、时间序列和信号在内的任何类型的序列数据。这些模型是通用的AI模型,旨在处理大规模的序列多模态数据,实现高级推理,并做出可靠的决策。

  • NVLM-D-72B:前沿的多模态大型语言模型

    NVLM-D-72B是NVIDIA推出的一款多模态大型语言模型,专注于视觉-语言任务,并且通过多模态训练提升了文本性能。该模型在视觉-语言基准测试中取得了与业界领先模型相媲美的成绩。

  • gradio-bot:将Hugging Face Space或Gradio应用转化为Discord机器人

    gradio-bot是一个可以将Hugging Face Space或Gradio应用转化为Discord机器人的工具。它允许开发者通过简单的命令行操作,将现有的机器学习模型或应用快速部署到Discord平台上,实现自动化交互。这不仅提高了应用的可达性,还为开发者提供了一个与用户直接交互的新渠道。

  • AI-Powered Meeting Summarizer:会议语音转文本并自动生成摘要的AI工具

    AI-Powered Meeting Summarizer是一个基于Gradio的网站应用,能够将会议录音转换为文本,并使用whisper.cpp进行音频到文本的转换,以及Ollama服务器进行文本摘要。该工具非常适合快速提取会议中的关键点、决策和行动项目。

  • VARAG:视觉增强的检索与生成系统

    VARAG是一个支持多种检索技术的系统,优化了文本、图像和多模态文档检索的不同用例。它通过将文档页面作为图像嵌入,简化了传统的检索流程,并使用先进的视觉语言模型进行编码,提高了检索的准确性和效率。VARAG的主要优点在于它能够处理复杂的视觉和文本内容,为文档检索提供强大的支持。

  • JoyHallo:数字人模型,支持生成普通话视频

    JoyHallo是一个数字人模型,专为普通话视频生成而设计。它通过收集来自京东健康国际有限公司员工的29小时普通话视频,创建了jdh-Hallo数据集。该数据集覆盖了不同年龄和说话风格,包括对话和专业医疗话题。JoyHallo模型采用中国wav2vec2模型进行音频特征嵌入,并提出了一种半解耦结构来捕捉唇部、表情和姿态特征之间的相互关系,提高了信息利用效率,并加快了推理速度14.3%。此外,JoyHallo在生成英语视频方面也表现出色,展现了卓越的跨语言生成能力。

  • PhysGen:基于物理的图像到视频生成技术

    PhysGen是一个创新的图像到视频生成方法,它能够将单张图片和输入条件(例如,对图片中物体施加的力和扭矩)转换成现实、物理上合理且时间上连贯的视频。该技术通过将基于模型的物理模拟与数据驱动的视频生成过程相结合,实现了在图像空间中的动态模拟。PhysGen的主要优点包括生成的视频在物理和外观上都显得逼真,并且可以精确控制,通过定量比较和全面的用户研究,展示了其在现有数据驱动的图像到视频生成工作中的优越性。

  • Whisper large-v3-turbo:高效自动语音识别模型

    Whisper large-v3-turbo是OpenAI提出的一种先进的自动语音识别(ASR)和语音翻译模型。它在超过500万小时的标记数据上进行训练,能够在零样本设置中泛化到许多数据集和领域。该模型是Whisper large-v3的微调版本,解码层从32减少到4,以提高速度,但可能会略微降低质量。

  • Realtime API:低延迟的实时语音交互API

    Realtime API 是 OpenAI 推出的一款低延迟语音交互API,它允许开发者在应用程序中构建快速的语音到语音体验。该API支持自然语音到语音对话,并可处理中断,类似于ChatGPT的高级语音模式。它通过WebSocket连接,支持功能调用,使得语音助手能够响应用户请求,触发动作或引入新上下文。该API的推出,意味着开发者不再需要组合多个模型来构建语音体验,而是可以通过单一API调用实现自然对话体验。

  • Saylo AI:探索无限的AI角色扮演游戏。

    Saylo AI是一个AI角色扮演游戏,让你与AI角色互动,探索多样化的戏剧性故事。它利用人工智能技术,提供沉浸式的互动体验,让玩家在虚拟世界中与AI朋友交流,体验不同的故事情节。Saylo AI的背景信息展示了其创新性和娱乐性,旨在为玩家提供一种全新的娱乐方式。目前产品处于推广阶段,价格未明确标注。

  • twinny:Visual Studio Code的免费且私密的AI扩展

    twinny是一个为Visual Studio Code用户设计的AI扩展,旨在提供个性化的编程辅助,提高开发效率。它通过集成先进的AI技术,帮助开发者在编码过程中快速解决问题,优化代码,并提供智能提示。twinny的背景是响应开发者对于更加智能和自动化编程工具的需求,它通过简化开发流程,减少重复劳动,从而让开发者能够专注于更有创造性的工作。

  • Buildpad:构建人们真正想要的产品

    Buildpad 是一个旨在帮助创始人从概念到成功最小可行产品(MVP)的在线平台。它通过提供智能验证工具、AI引导的开发流程、进度跟踪以及个性化的项目见解,帮助用户构建能够获得市场认可的产品。Buildpad 的主要优点包括简化产品开发流程、提高产品成功率、以及提供个性化的指导和支持。

  • Novela:AI时代的技能学习平台

    Novela是一个专注于AI时代技能学习的在线平台,提供早期访问服务,用户可以免费试用。它旨在帮助用户掌握AI相关的技能,以适应未来职场的需求。

  • interview.co:视频面试软件,简化招聘流程

    interview.co是一个专注于简化招聘流程的视频面试软件。它通过提供在线视频面试、AI问题生成器和面试管理工具,帮助企业高效地筛选和评估候选人。产品背景信息显示,interview.co旨在解决传统面试中的时间消耗、日程安排困难和成本高昂等问题。价格方面,interview.co提供试用版,具体定价信息需进一步探索。

  • Open NotebookLM:将任何PDF转换为播客集!

    Open NotebookLM是一个利用开源语言模型和文本到语音模型的工具,它可以处理PDF内容,生成适合音频播客的自然对话,并将其输出为MP3文件。该项目的灵感来自于NotebookLM工具,通过使用开源的大型语言模型(LLMs)和文本到语音模型来实现。它不仅提高了信息的可访问性,还为内容创作者提供了一种新的媒体形式,使他们能够将书面内容转换为音频格式,扩大其受众范围。

  • Chital:macOS平台的Ollama模型聊天应用

    Chital是一个为macOS平台设计的应用程序,它允许用户与Ollama模型进行聊天。这个应用具有低内存占用和快速启动的特点,支持多聊天线程,能够在不同的模型间切换,并支持Markdown格式。此外,它还能自动为聊天线程生成标题摘要。Chital的开发主要是为了满足开发者个人的使用需求,但也鼓励社区成员通过fork代码库来添加新功能。

  • SafeEar:保护隐私的音频深度检测

    SafeEar是一个创新的音频深度检测框架,它能够在不依赖于语音内容的情况下检测深度音频。这个框架通过设计一个神经音频编解码器,将语义和声学信息从音频样本中分离出来,仅使用声学信息(如韵律和音色)进行深度检测,从而保护了语音内容的隐私。SafeEar通过在真实世界中增强编解码器来提高检测器的能力,使其能够识别各种深度音频。该框架在四个基准数据集上的广泛实验表明,SafeEar在检测各种深度技术方面非常有效,其等错误率(EER)低至2.02%。同时,它还能保护五种语言的语音内容不被机器和人类听觉分析破译,通过我们的用户研究和单词错误率(WER)均高于93.93%来证明。此外,SafeEar还构建了一个用于反深度和反内容恢复评估的基准,为未来在音频隐私保护和深度检测领域的研究提供了基础。

今日大家都在搜的词: