首页 > 业界 > 关键词  > GLEE最新资讯  > 正文

通用物体级基础模型GLEE:增强图像和视频分析

2023-12-18 10:19 · 稿源:站长之家

**划重点:**

1. 🧠 GLEE是一种通用物体级别基础模型,由华中科技大学、字节跳动和约翰斯·霍普金斯大学的研究人员共同推出,突破了当前视觉基础模型的限制,提供准确而全面的物体级信息。

2. 🎓 GLEE以其在各种任务中表现卓越的通用性而闻名,无需特定任务适应即可在不同对象感知任务中定位和识别物体,同时集成大型语言模型以提供多模态研究的通用物体级信息。

3. 🚀 该模型展现出出色的灵活性和卓越的泛化能力,特别在零样本传输场景中表现突出。通过整合各种数据源,包括自动标记的大量数据,GLEE不仅实现了可扩展的数据集扩展,还提高了零样本能力,成为未来图像和视频任务的基础模型。

站长之家(ChinaZ.com)12月18日 消息:近日,来自华中科技大学、字节跳动和约翰斯·霍普金斯大学的研究人员推出了一款名为GLEE的全新通用物体级别基础模型,为图像和视频分析带来了全新的可能性。这一技术突破依赖深度学习的神奇,使计算机视觉系统能够像虚拟侦探一样,在数字体验的画布上识别、跟踪和理解各种物体。

image.png

GLEE的独特之处在于其卓越的通用性,无需特定任务的适应即可在各种任务中定位和识别物体。该模型集成了图像编码器、文本编码器和视觉提示器,用于多模态输入处理和广义物体表示预测。通过在Objects365、COCO和Visual Genome等多样化的数据集上进行训练,GLEE采用统一框架,涵盖检测、分割、跟踪、定位和识别开放场景中的对象。

GLEE通过使用动态类头的MaskDINO以及相似性计算进行预测的对象解码器,经过目标检测和实例分割的预训练,联合训练实现了在各种图像和视频任务中的最先进性能。不仅如此,GLEE还展现了卓越的灵活性和强大的泛化能力,有效应对各种下游任务,无需特定任务的适应。

该模型在对象检测、实例分割、定位、多目标跟踪、视频实例分割、视频对象分割以及交互式分割和跟踪等各种图像和视频任务中均表现卓越。甚至在与其他模型集成时,GLEE仍保持着最先进性能,展示了其表示的多样性和有效性。

image.png

除了在技术上的突破,GLEE在零样本泛化方面也取得了显著进展,通过整合大量自动标记的数据进一步提升了模型的性能。作为一种基础模型,GLEE为当前视觉基础模型的局限性提供了创新性的解决方案,提供准确而通用的物体级信息。

研究的未来方向聚焦在扩展GLEE在处理复杂场景和具有长尾分布的挑战性数据集方面的能力上,以提高其适应性。此外,研究人员还探索了在训练过程中使用广泛的图像-标题对,类似于DALL-E模型,从而提高GLEE生成详细图像内容的潜力。

项目体验网址点击这里:https://top.aibase.com/tool/glee

论文网址:https://arxiv.org/abs/2312.09158

举报

  • 相关推荐
  • 质量统计分析工具推荐:算法自主与场景适配成关键分水岭

    国产质量分析软件正实现突破,三维天地S-tab确立了“自主可控、本土适配、全流程覆盖”理念。其三大核心创新包括:完全自主研发的核心算法确保数据安全与精度;通过“无编程”封装降低六西格玛分析门槛;完整支持DMAIC模型且内置中国车企标准,可一键生成中文报告。它能帮助企业节省40%-60%软件授权费并降低不良品率。对比Minitab、JMP等国际主流软件,在信创适配与本土化方面优势明显。这标志着核心竞争力正向“算法自主性”与“场景适配深度”转移。

  • 豆包图像创作模型Seedream 5.0 Pro API上线:像素级编辑、专业级可控

    今天,火山引擎正式开放豆包图像创作模型Seedream 5.0 Pro的API服务,企业开发者可以直接接入这套专业绘图能力,适配广告、电商、教育、跨境等各类批量出图场景。 这款模型最大变化是告别单纯出图,深度贴合真实设计流程,四大核心能力解决企业批量制图痛点。 首先是交互式精准编辑,不用反复改写提示词,直接圈选、点选画面局部,支持草图转成品、单独换材质、拆分

  • 华为耳机联动豆包功能全量上线:支持FreeClip 2、FreeBuds Pro 5

    快科技7月13日消息,据博主Adak封狼居胥”透露,华为耳机联动豆包功能正式全量上线,适配FreeClip 2标准版、典藏版以及FreeBuds Pro 5悦彰两款旗舰耳机。用户升级对应固件与配套App后,即可在耳机端直接调用豆包完整AI能力,耳边交互体验大幅拓展。鸿蒙手机可以小艺/豆包双智能体在线(搭配HarmonyOS 6.1.0.125及以上版本的手机,包含鸿蒙7.X),苹果/安卓也能通过豆包进行消息播�

  • 豆包图像创作模型Seedream 5.0 Pro发布:随手画出精美设计图

    今天,在火山引擎FORCE原动力大会上,豆包大模型2.1 Pro、豆包视频生成模型Seedance 2.5、Seedance 2.0 4K版、豆包图像创作模型Seedream 5.0Pro、豆包音频生成模型1.0五大模型集中亮相。 其中,豆包图像创作模型Seedream 5.0 Pro在交互式精准编辑、多图层分离、高密度信息表达、原生多语种文字生成四个方面实现升级,并即将在近期正式上线。 Seedream 5.0 Pro支持交互式精准编辑,用户只需�

  • 苹果iOS 27上线RAW 9图像处理引擎:AI协同降噪、解马赛克

    苹果在iOS27最新测试版中上线了全新RAW9系统级图像处理引擎,官方将其定义为RAW算法迭代以来规模最大的一次升级。 这套工具依托CoreML机器学习模型重构处理流程,能同步完成去马赛克与降噪运算,依靠设备端神经网络引擎本地运行,兼顾画质与处理速度。 就算是早年拍摄的旧RAW照片重新解析,画质也能得到明显优化。 苹果Core Image工程师在WWDC26分享中放出多组新旧引擎实�

  • 可灵AI估值千亿,快手“母凭子贵”:国产视频模型三强争霸

    ​AI正在重写每个行业、每家公司的估值逻辑。 7月2日晚间,快手发布公告,旗下独立运营主体北京可灵智能科技有限公司(以下简称“可灵AI”)敲定总额上限30亿美元的外部增资,目前已签约近28亿美元,创下全球视频大模型公司单轮最高融资纪录。可灵AI投后估值达180亿美元,约为当天母公司快手估值的80%。

  • 多人同传串音、算力、网络三重难题被攻克,时空壶X1 Meeting重构国际会议沟通逻辑

    企业出海和跨国会议激增,使多人多语种实时同传设备成为刚需,但传统方案长期受困于串音、算力不足和网络拥堵。时空壶推出的X1Meeting AI同声传译器,整合骨声纹拾音、弱网传输、专属算力硬件及AI大模型四大核心技术,实现了10台设备组网、20人同步、5语10向实时同传,0.2秒超低延迟,彻底解决了圆桌论坛的串音顽疾。它填补了行业从几人到千人全场景需求的空白,确立了时空壶在企业级多语会议市场的领先地位。

  • 豆包视频生成模型Seedance 2.5发布:原生直出翻倍至30秒

    今天举办的2026火山引擎FORCE 原动力大会上,字节跳动发布全新AI视频生成工具Seedance 2.5,这款模型目前处于企业内测阶段,预计7月初正式上线。 上一代Seedance 2.0最长只能生成15秒视频,新版本直接把单次成片时长翻倍,原生就能输出完整30秒视频,做连贯长镜头、完整小故事不用分段拼接,画面叙事流畅度提升很多。 参考素材上限也大幅放宽,2.0版本一次最多只能导入12份图

  • 四款APS-C画幅视频微单同台:轻便、画质、对焦、散热,谁更全面?

    2026年视频创作已入精细化时代,需兼顾便携、画质、对焦等六维能力。本文对比佳能R50V、索尼ZV-E10 II、尼康Z30和富士X-S20四款APS-C热门微单:佳能R50V极致轻便,视频规格全面,竖拍与色彩直出讨喜;索尼对焦及镜头群占优;尼康最亲民但缺Log与4K 60P;富士胶片模拟风格鲜明且防抖好。选择无绝对答案,应根据最常拍场景和核心需求理性取舍。

  • 《狂热运输3》最新视频展示全新载具与玩家期待功能

    《狂热运输3》发布深度解析视频,展示动态环境、产业与系统全面进化。本作将于2026年登陆PC及主机,收录超300款载具,加入准点送达、动态昼夜等新机制,并提供强化的线路管理器与首发跨平台模组支持,打造系列迄今最灵活、沉浸的运输大亨体验。

今日大家都在搜的词: