首页 > 原创 > 关键词  > OCR模型最新资讯  > 正文

AI日报:混元发布HyOCR-1.5;PixVerse完成4.39亿美元融资;商汤开源 SenseNova-Vision-7B-MoT

2026-07-14 16:33 · 稿源:站长之家

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解https://app.aibase.com/zh

1、腾讯混元发布 HyOCR-1.5:仅 1B 参数 推理提速 6.37 倍

HyOCR-1.5作为轻量化端到端 OCR 模型,通过技术创新实现了性能与效率的飞跃,同时开放全栈源代码,降低了开发门槛,推动了 OCR 技术的普及和应用。

image.png

【AiBase提要:】

🚀 引入“DFlash”投机解码框架,显著提升推理速度。

🧠 采用“智能体驱动数据流”策略,增强模型能力。

📈 HyOCR-1.5在多项任务中展现卓越性能,超越同类模型。

2、谷歌发布移动端AI应用更新:首次支持历史聊天记录搜索与文件上传

谷歌发布移动端AI应用更新,首次支持历史聊天记录搜索与文件上传,显著提升信息检索效率和移动办公体验。

image.png

【AiBase提要:】

📲 首次在移动端引入历史聊天记录搜索功能,提升信息检索效率。

📁 iOS客户端新增文件上传功能,优化移动办公场景下的文档流转体验。

🔄 谷歌将高频深度交互功能向移动端平权,推动AI助手向长效生产力管理平台演进。

3、PixVerse 完成 4.39 亿美元 C 轮扩展融资 估值飙升至 20 亿美元

PixVerse在AI视频生成赛道中取得显著进展,通过技术驱动和精准的数据标注策略,成功获得大量用户并实现估值飙升。公司计划进一步拓展全球市场,推动企业级服务的发展。

【AiBase提要:】

🚀 PixVerse完成4.39亿美元C轮扩展融资,估值突破20亿美元。

🎥 公司构建了多元化的产品矩阵,覆盖视频生成、影视创作和游戏开发领域。

💡 面对数据同质化质疑,PixVerse强调数据标注的重要性,并实现了高性价比的图生视频功能。

4、Siri 迎来全面 AI 进化!苹果正式发布 iOS27首个公开测试版

苹果公司正式发布了 iOS27 的首个公开测试版,带来了 Siri 的全面 AI 进化、系统性能与视觉定制的提升,以及应用生态和原生功能的优化。

【AiBase提要:】

🍎 Siri 迎来全面 AI 进化!

🚀 iOS27性能与视觉定制全面升级

📱 应用生态与原生功能进化

5、手机新物种诞生:阶跃星辰发布原生智能体系统与首款手机STEPX Neo

阶跃星辰在「阶跃终端品牌暨新一代智能体战略发布会」上展示了其最新布局,包括智能体原生系统Step AOS、大模型原生AI终端品牌STEPX以及首款手机产品STEPX Neo。这些创新成果旨在提供更强的稳定性、高性能支持和更安全的用户体验。

image.png

【AiBase提要:】

🧠 Step AOS系统引入双域三步记忆结构,实现智能体的个性化体验。

🧠 通过端云多脑体系提升决策与执行能力,动态分配模型以应对复杂任务。

🔒 构建四维安全闭环,确保用户数据安全与操作透明可溯。

6、小米具身智能机器人“实习”新工站:双侧螺母上件成功率达98%

小米具身智能机器人在汽车制造领域的最新进展展示了其在工业自动化中的强大潜力。通过技术攻坚,机器人在双侧螺母上件工站的作业成功率已达到98%,接近人工水平。同时,它在总装车间物流区的两个新工站也实现了90%的作业成功率,攻克了行业难题。小米机器人通过深度接入现代化工厂的自动化与数字化系统,验证了具身智能在复杂工业环境中的可行性,并持续拓宽AI与物理世界的交互边界。

【AiBase提要:】

✅ 小米机器人在汽车制造领域双侧螺母上件工站的作业成功率已达98%

✅ 在总装车间物流区实现中控台侧盖板排序和料箱折叠回收的90%作业成功率

✅ 突破工业场景中长时柔性作业难题,实现全身运动控制与大范围稳定作业的平衡

7、视觉模型新突破:商汤开源 SenseNova-Vision-7B-MoT

商汤科技开源多任务视觉模型 SenseNova-Vision-7B-MoT,为视觉理解及 GUI 智能体开发提供基座支撑,具备出色的任务整合能力,并支持通过自然语言定义全新视觉任务变体。

image.png

【AiBase提要:】

🧠 多任务视觉模型 SenseNova-Vision-7B-MoT 集成多种核心视觉任务,提升通用性。

📦 开源策略支持社区研究与应用,提供模型权重和语料库子集。

🚀 提供统一框架,加速技术创新与落地应用。

详情链接:https://github.com/OpenSenseNova/SenseNova-Vision

8、QuestMobile六月AI原生App月活榜:豆包3. 8 亿断层第一,千问增速暴涨近 58 倍

QuestMobile发布的2026年AI应用市场发展洞察报告指出,AI原生App月活达到4.99亿,同比增长85.4%,显示出强劲的增长势头。豆包、千问和DeepSeek构成的第一梯队月活分别为3.82亿、1.67亿和1.30亿,其中千问增长率高达5792.9%。此外,AI原生App的用户黏性显著提升,表明其正在快速改写竞争格局。

image.png

【AiBase提要:】

📱 AI原生App月活达4.99亿,同比增长85.4%

📈 豆包、千问、DeepSeek构成第一梯队,月活分别达3.82亿、1.67亿、1.30亿

🔥 豆包用户基本盘韧性凸显,App端新增1378万用户

举报

  • 相关推荐
  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

  • AI CRM的下一个十年:从“人用的系统”到“Agent调用的底座”

    2026年被视为AI Agent规模化落地元年,国内企业级市场预计达135.3亿元,年增速超70%。AI正从辅助工具走向自主执行业务,CRM进入2.0阶段,核心评价标准从“界面友好”转为“调用效率”。销售易NeoAgent2.0以业务语义模型重构数据底座,实现AI原生、结果交付与开放生态,助米其林、伊顿等企业降本增效,标志着CRM从管理系统向能力输出平台的结构性迁移,Agent不是终结而是重生。

  • 从Engage2025到2026:Agent爆发这一年,AI CRM 走到哪了

    一年前企业还在探讨AI辅助销售的可能,2026年智能体已迎来市场爆发,数量年增近两倍。一年间,AI与CRM完成真正跨代:从底层重构业务语义、统一入口到主动执行,CRM已从事后记录进化为事前预警。以销售易NeoAgent 2.0为例,其整合多步复杂工作、封装实战经验,将AI从被动“对话式”工具,转变为主动“执行式”数字员工,标志着行业正从追求“能用”迈向“好用”的质变。

  • AI日报:Kimi K3登顶全球最大开源模型;小度AI手表Fit开售;我国启动大模型 IPv6 专项行动

    Kimi K3开源2.8万亿参数模型成全球最大;小度AI手表搭载文心大模型,定价亲民;我国启动大模型IPv6行动,推进网络升级;Firefox新标签页推出AI新闻字谜;艺术家起诉AI表情包侵犯版权;比亚迪人形机器人拟8月落地郑州;宇树G1机器人远程完成动物手术实验;Claude共享对话功能曝隐私风险,大量记录被谷歌收录。

  • ​开源技术赋能社交生态,Soul App亮相WAIC展会

    在2026 WAIC上,Soul展示了C端实时数字人与随伴AI硬件B Soul,并完整呈现自研SoulX模型开源成果及B端产业赋能布局。品牌依托App真实社交数据,打造语音与数字人两大技术模块,建立“自有应用+产业生态”双层架构,成立伦理委员会护航安全。其中B Soul集成情感交互能力,预计2026年8月量产;CTO表示此举补足线下陪伴空白,推动AI从工具升级为伙伴。

  • 四相科技推动工业UWB物资定位成本大幅下降,加速高精度定位技术规模化应用

    UWB定位凭借厘米级精度与强抗干扰能力,正从高投入技术转向可规模部署。随产业链成熟、硬件成本下降,四相科技通过自研产品、长续航设计和灵活方案,以蓝牙级成本实现UWB级精度,帮助企业实时追踪物资、优化流程、防错调度,推动工业数字化升级,打造智能工厂位置数据底座。

  • AI日报:腾讯混元发布科研智能体Hyra-1.0;阿里发布Qwen-Image-3.0;马斯克把Grok塞进Excel

    腾讯发布科研智能体Hyra-1.0,打通AI研发与科学发现。阿里推出Qwen-Image-3.0,支持4.5K超长文本与复杂图文生成。马斯克将Grok嵌入Excel,实现智能数据分析。Adobe推出AI相机工具Project Indigo。小鹏发布TuringViT高效视觉编码器。YouTube严打低质AI内容。《第九区》导演推出首部AI微电影。阿里拟推“千问办公”,整合三种智能体布局企业市场。

  • 京东开源JoyAI-Video-Edit模型!实现视频边播边改:综合性能全球领先

    京东正式开源自研实时流式视频编辑模型JoyAI-Video-Edit,打破传统视频先成片再剪辑的固有模式,实现播放画面同步实时修改,在流式实时视频编辑方向的各项指标全面领先,达到世界一流水平。 依托JoyAI基础大模型底座,设备在720P分辨率下可稳定实现30帧实时运算,画面处理无明显延迟卡顿,适配常规视频播放同步修改需求。模型摒弃行业只能剪辑短视频片段的短板,支持超

  • 全球参数最大开源模型 马斯克也点赞!月之暗面Kimi K3开源 2.8万亿参数

    日前,月之暗面正式发布Kimi K3模型权重及技术报告,并同步开源支撑该模型训练的三项关键基础设施技术:MoonEP、FlashKDA和AgentEnv。 据介绍,三项技术在Kimi K3的训练过程中发挥了重要作用,为大规模模型训练的效率、稳定性以及智能体任务执行提供基础支撑。 据了解,Kimi K3是月之暗面目前能力最强的模型,该模型采用混合专家(MoE)架构,总参数规模达到2.8万亿,具备原生

  • 腾讯元宝上线Hy ASR 3.0 preview语音识别模型:各种方言、复杂环境都能听清

    腾讯混元日前正式推出Hy ASR 3.0 preview语音识别模型,已率先落地腾讯元宝App面向全部用户免费使用。 依托Hy3基座大模型打通声学识别与语义理解,彻底摆脱传统语音识别生硬转写短板,在多方言口音、嘈杂收音、远距离拾音等复杂场景稳定输出精准文本。 模型完成10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话交互,用户不需

今日大家都在搜的词: