首页 > 业界 > 关键词  > Mobile-Agent最新资讯  > 正文

​Mobile-Agent: 具有视觉感知 可以像人类样操作手机的自主多模态AI代理

2024-01-31 16:48 · 稿源:站长之家

划重点:

📱 纯视觉解决方案,无需系统代码,通过图像分析理解和操作手机

🤖 能完成多种任务,如购物、播放音乐、使用导航APP、写便签和发邮件

🔍 特点包括独立于XML和系统元数据、即插即用、自主任务规划和执行、自反思能力

站长之家(ChinaZ.com)1月31日 消息:Mobile-Agent是一款具有视觉感知的自主多模式移动设备代理,由北京交通大学联合阿里巴巴团队共同开发。简单的说,Mobile-Agent相当于一个可以模拟人类操作手机的自主多模态AI代理

image.png

该代理采用纯视觉解决方案,独立于XML和系统元数据,不需要任何系统代码,完全通过分析图像来理解和操作手机。 它能够自动完成各种任务,比如可以在淘宝加购物车车,在APP播放音乐,自主使用导航APP,收发邮件等等。

Mobile-Agent的主要特点包括操作范围不受限制,多应用操作,以及采用纯视觉解决方案。其无需探索和培训,用户可随时使用。项目团队通过 Mobile-Eval 进行了性能评估,包括10个主流单应用场景和1个多应用场景,为用户提供了详细的评估结果。该评估覆盖了阿里巴巴、亚马逊音乐、谷歌地图等10个应用场景,以及一个多应用场景。

每个场景设计了三个不同难度的指令,以评估 Mobile-Agent 在各种任务下的表现,具体如下

应用操作说明
阿里巴巴1.帮我在阿里巴巴找帽子。

2.帮我在阿里巴巴找帽子。如果商品信息页面中显示“添加到购物车”,请将商品添加到我的购物车。

3.我想买一顶帽子。我听说阿里巴巴的东西很便宜。也许你可以帮我找到它。

亚马逊音乐1.在亚马逊音乐中搜索歌手周杰伦。

2. 在亚马逊音乐中搜索一首关于“特工”的音乐并播放。

3.我想听音乐放松一下。寻找一个应用程序来帮助我。

谷歌浏览器1. 搜索今天湖人队比赛的结果。

2. 搜索有关泰勒·斯威夫特的信息。

3. 我想知道今天湖人队比赛的结果。寻找一个应用程序来帮助我。

邮箱1. 发送一封空电子邮件至 {address}。

2. 发邮件到{address}n告诉我的新作品。

3. 我想让我的朋友知道我的新作品,他的地址是{address}。寻找一个应用程序来帮助我。

谷歌地图1.导航至杭州西湖。

2. 导航到附近的加油站。

3.我想去杭州西湖,但不认识路。寻找一个应用程序来帮助我。

谷歌游戏1. 在 Play 商店下载 WhatsApp。

2. 在 Play 商店下载 Instagram。

3. 我想要在手机上安装 WhatsApp。寻找一个应用程序来帮助我。

笔记1. 在Notes中创建一个新笔记。

2. 在Notes中创建一个新笔记并写入“您好,这是一条笔记”,然后保存。

3.我突然有事要记录,帮我找个App,写下以下内容:下午3点开会。

设置1.开启深色模式。

2. 打开飞行模式。

3. 我想查看电池电量下的实时网速,请帮我打开此设置。

抖音1. 在 TikTok 中滑动一段有关宠物猫的视频,并为该视频点“赞”。

2、在抖音里刷一段关于宠物猫的视频并评论“哦哦哦,好可爱的猫!”。

3.在TikTok中滑动视频。点击“喜欢”3只宠物视频猫。

YouTube1. 在 YouTube 上搜索有关斯蒂芬·库里的视频。

2. 在 YouTube 上搜索有关斯蒂芬·库里的视频,然后打开“评论”评论“哦,厨师,你的篮球精神一直激励着我”。

3. 我需要你帮助我在 YouTube 上表达我对斯蒂芬·库里的喜爱。

多应用程序1. 打开日历并查看今天的日期,然后转到“注释”并创建一个新注释以写入“今天是{今天的数据}”。

2.查看未来5天的温度,然后在笔记中新建一条笔记,写下温度分析。

3. 搜索今天湖人队比赛的结果,然后在注释中创建注释,为该结果撰写体育新闻。

MobileAgent的特点包括依赖于纯视觉解决方案、独立于XML和系统元数据、具备多种视觉感知工具进行操作定位、无需探索和训练即插即用。其工作原理涵盖视觉感知工具、自主任务规划和执行、自反思等关键模块,使其能够准确识别和操作手机屏幕上的各种元素。团队宣布即将发布移动代理的演示视频,展示其在实际操作中的性能和应用场景。

举报

  • 相关推荐
  • 方洪波迎战雷军,祭出两大Agent

    ​家电三巨头美的、格力和海尔,正面临小米的强力挑战。小米家电连续多个季度狂飙突进,已经让三巨头感到不安。 格力对于小米格外警惕。在小米攻势最凶猛的空调赛道,针对奥维云网7月空调线上市场份额数据,格力与小米各执一词,争执不下。 海尔同样感受到压力:去年7月,小米以12%的全渠道份额,超越海尔跻身前三。到了今年7月,海尔收复失地,市场份额升至15%,

  • AI日报:腾讯发布混元3D 3.0模型;昆仑万维上线Agent Studio功能;阿里Qoder推出付费订阅服务

    AI日报汇总最新行业动态:腾讯发布混元3D+3.0模型,建模精度提升3倍;昆仑万维Mureka上线音乐创作功能;阿里Qoder推出付费订阅服务;VEED Fabric 1.0实现图片转视频;OpenAI发布GPT-5-Codex革新编程;全国发布AI安全治理框架2.0;Mini-o3实现超长视觉推理;上海AI Lab推出多模态模型Lumina-DiMOO;腾讯微调技术提升图像美感300%;Meta推出轻量级MobileLLM-R1;腾讯启动AI应用繁荣计划;谷歌DeepMind�

  • “无人测试”新趋势:2025服贸会公布领先AI测试平台——Testin XAgent

    在数字化浪潮下,软件质量成为企业核心竞争力。传统测试依赖人工,面临效率瓶颈、覆盖局限和技术门槛三大痛点。AI技术正推动测试从自动化向智能化变革。Testin云测发布新一代AI智能测试系统Testin+XAgent,融合大语言模型和智能体技术,实现自然语言驱动测试、高精度视觉识别、全自动API测试和自主探索式测试,重塑测试流程。该系统代表软件测试向“无人测试”升级,助力中国技术出海,彰显AI+测试的全球竞争力。

  • 腾讯邱跃鹏:面向Agent和全球化趋势,全面升级云基础设施

    腾讯云在2025全球数字生态大会上宣布,持续升级AI基础设施以支持Agent规模化落地和企业全球化发展。通过自研FlexKV+多级缓存技术,显著降低推理延迟,首字时延最高降70%。推出Agent Runtime解决方案,集成执行引擎、云沙箱等五大能力,提供稳定可靠的运行环境。同时,腾讯云加速国际化布局,计划在日本大阪和沙特新建可用区,并已为全球上万款游戏提供安全防护,成功抵御同比增长183%的DDoS攻击。

  • AI日报:钉钉十周年发布8.0版本;微信悄悄上线AI播客;阿里开源 Mobile-Agent 3

    AI日报栏目聚焦人工智能领域最新动态。钉钉发布8.0版本推出AI办公应用钉钉ONE,通过自然语言交互简化工作流程;阿里开源Mobile-Agent-v3跨平台代理框架;微信测试AI播客功能,实现双人对话式新闻播报;钉钉推出首款AI硬件录音笔DingTalk A1;苹果拟为Siri引入谷歌Gemini大模型;苹果发布适配版SlowFast-LLaVA模型提升长视频分析性能;Meta获得Midjourney技术授权加强AI图像生成竞争力;谷歌Drive新增Vids视频编辑功能降低制作门槛;夸克发布健康大模型通过12学科主治医师测评;AI小游戏Draw A Fish凭借极简设计引发全球热潮。

  • 腾讯云联合IDC发布AI Infra报告:定义Gen Al时代智算新范式

    2025年腾讯全球数字生态大会于9月16-17日在深圳召开。在Infra+Agent专场,腾讯云与IDC联合发布《AI+Infra:加速智能体落地的基础架构、发展趋势与产业实践》报告。报告指出,随着AI应用规模化落地,AI云基础设施正向核心智算设施演进,涵盖分布式底座、异构硬件、高性能软件和场景化方案四大维度。报告还提出六大演进趋势:架构重构、行业垂直化、算力智能化、安全能力提升、研发范式创新和服务化转型,并解析了腾讯云在交通、制造、医疗等领域的落地案例,为企业智能化转型提供实践指南。

  • 新品|灵动式三维扫描系统NimbleTrack Gen2震撼来袭!

    思看科技9月17日发布新一代NimbleTrack+Gen2智能无线三维扫描系统。该系统采用全无线设计,无需贴点,最高精度达0.025mm,支持120FPS高速扫描,单站最远跟踪距离4.2米。创新融合跟踪式与手持式双模式,可覆盖中小型精密件到大型工业件的全场景测量,助力工业检测向高效化、智能化升级。

  • Claude 用不了?蓝耘 Coding Agent 提供原生替代方案,更轻量、高性价比的替代选择

    Anthropic宣布停止向中国资本控股企业提供Claude服务,蓝耘Coding Agent凭借强代码能力、灵活适配性及高性价比成为可靠替代选择。支持多模型切换、低迁移成本,提供可视化控制台和本地化服务,助力开发者无缝衔接开发流程,确保工作连续性。

  • 美团也开源了大模型,但我觉得他们的野心是通用生活Agent。

    也有线上体验地址:https://longcat.ai 我自己去体验了一下,整体模型能力,中规中矩,但是快,是真的快,能把560B的模型,在推理的时候搞得这么快,是真的有点牛逼的。 我直接录了个屏给大家看一下。 这里我们可以直观对比一下LongCat和DeepSeek V3的输出速度,他俩都是MoE架构,而且总参数量差不太多。 为了更公平的竞争,用了同一个问题,并关闭了联网搜索来避免搜索干扰�

  • 全球首发骁龙8 Elite Gen5!小米17 Pro首个跑分出炉

    小米旗下一款型号为25098PN5AC”的机型跑分现身Geekbench数据库,博主体验more透露,该机正是小米17 Pro。 小米17系列将全球首发骁龙8 Elite Gen5,超大核主频4.61GHz,这次单核成绩3096,多核9382。

今日大家都在搜的词: