首页 > 业界 > 关键词  > AI训练数据最新资讯  > 正文

研究警告:到2026年,AI训练数据可能告急

2023-11-08 16:31 · 稿源:站长之家

划重点:

1. 高质量数据对AI至关重要:强大、准确和高质量的AI算法需要大量高质量的数据来进行训练。

2. AI数据可能告急:研究人员预测,如果当前的AI训练趋势继续下去,高质量文本数据可能在2026年之前告急,而低质量的语言数据和图像数据也将在未来告急。

3. 解决数据短缺问题的方法:为了解决数据短缺问题,AI开发人员可以改进算法,更有效地利用已有数据。此外,他们可以使用AI生成合成数据来训练系统,以适应特定的AI模型。

站长之家(ChinaZ.com)11月8日 消息:随着人工智能(AI)达到巅峰,研究人员警告称,AI行业可能会面临训练数据告急的问题,这是强大AI系统的燃料。这可能会减缓AI模型的增长,特别是大型语言模型,并可能改变AI革命的轨迹。

为了训练强大、准确和高质量的AI算法,我们需要大量数据。例如,ChatGPT是基于570千兆字节的文本数据(大约3000亿字)进行训练的。类似地,stable diffusion算法(驱动许多AI图像生成应用,如DALL-E、Lensa和Midjourney)是基于包含58亿图像-文本对的LIAON-5B数据集进行训练的。如果算法的训练数据不足,将会产生不准确或低质量的输出。因此,训练数据的质量同样重要。低质量数据,如社交媒体帖子或模糊照片,容易获取,但不足以训练高性能的AI模型。

数据中心 超级计算机 (1)

图源备注:图片由AI生成,图片授权服务商Midjourney

AI行业一直在不断扩大数据集的规模,这就是为什么我们现在拥有高性能模型,如ChatGPT或DALL-E3。与此同时,研究显示,用于训练AI的在线数据库增长速度远远慢于AI所需的数据集。在去年发表的一篇论文中,一组研究人员预测,如果当前的AI训练趋势继续下去,我们将在2026年之前用尽高质量文本数据,而低质量的语言数据将在2030年至2050年之间耗尽,低质量的图像数据将在2030年至2060年之间告急。尽管AI有望在未来几年内更有效地利用已有数据来训练高性能AI系统,从而降低数据需求,但数据短缺问题仍需解决。

如何解决数据短缺问题?

虽然上述问题可能让一些AI爱好者感到担忧,但情况可能没有看上去那么糟糕。关于AI模型未来的发展,还有许多未知因素,但有一些方法可以解决数据短缺的风险。一种机会是让AI开发人员改进算法,使其更有效地利用已有数据。未来几年内,他们有望能够使用更少的数据和可能更少的计算能力来训练高性能AI系统,这也将有助于减少AI的碳足迹。

另一种选择是使用AI来生成合成数据以训练系统。换句话说,开发人员可以简单地生成他们需要的数据,以适应其特定的AI模型。已经有几个项目正在使用合成内容,通常是从数据生成服务中获取的,这将在未来变得更加普遍。

开发人员还在寻找在线空间以外的内容,如大型出版商和离线存储库中的内容。想象一下在互联网之前出版的数百万篇文本,如果以数字形式提供,它们可能为AI项目提供新的数据来源。例如,新闻集团(News Corp)是全球最大的新闻内容所有者之一,最近表示正在与AI开发人员洽谈内容交易。这些交易将迫使AI公司为训练数据付费,而他们迄今大多免费从互联网上获取数据。内容创作者已经抗议允许未经授权使用其内容来训练AI模型,一些公司如微软、OpenAI和Stability AI已被起诉。获得对其工作的报酬可能有助于恢复创意工作者和AI公司之间存在的一些权力失衡。

举报

  • 相关推荐
  • 以AI算力赋能湾区智算未来,博大数据副总裁高辉受邀启动“AI算力+”行动倡议

    2025年10月29日,第四届数字基础设施高质量发展大会在深圳召开,聚焦“AI驱动+算赋未来”主题,推动人工智能与算力设施深度融合。博大数据作为核心企业参与启动“AI算力+”行动倡议,联合政产学研共建算力生态。其前海智算中心以20亿元投资、5万平米规模,支持4万P算力,成为辐射华南及港澳的算力高地,助力深圳打造全球数字先锋城市,为千行百业智能化转型提供核心支撑。

  • 有AI就有无限可能,灰豚AI发布新一代GEO系统

    11月1日,灰豚AI发布新一代GEO系统,突破传统仅支持文本内容优化的局限,全面支持国内短视频平台作品优化,实现近乎零算力成本。该技术被视作行业重大创新,是当前国内GEO源头厂商的重要突破。系统通过AI训练提升企业在生成式搜索中的品牌影响力,助力企业获得竞争优势。未来电商将从平台化转向AI化,灰豚GEO系统支持多种合作模式,让企业以业务增长为导向,抢占AI市场先机。

  • 星环科技与国泰海通签署战略合作协议,共探AI重构数据应用新未来

    10月24日,国泰海通金融科技文化节主题论坛暨上海苏河湾大会成功举办。星环科技创始人孙元浩受邀出席,与国泰海通签署战略合作协议。双方将围绕数据平台建设、AI应用创新、智能风控与投研等领域深度合作,推动金融行业数字化与智能化转型。星环科技作为企业AI基础设施服务商,提供全生命周期数据服务;国泰海通拥有完善金融服务体系。双方将发挥各自在AI、大数据及金融场景优势,共同探索AI大模型在金融服务中的创新应用,打造行业标杆案例。

  • 从识别到修复,联想想帮帮AI服务智能体打造你的AI智能维修管家

    AI时代重塑陪伴形式,联想“想帮帮AI服务智能体”以公益之心推出,通过五大功能(智玩、智验、智检、智修、智换)构建全流程闭环服务。它能随时响应、精准诊断、智能优化系统,一键解决电脑卡顿等问题,让用户省时省心。该服务强调责任与长期守护,结合北京领养日公益理念,传递科技向善、服务有爱的智能温度,重新定义AI陪伴的全部意义。

  • AI日报:HeyGen发布AI视频翻译引擎;科大讯飞推星火 X1.5;QQ浏览器推出AI+小窗

    本期AI日报聚焦多项技术突破:HeyGen推出精准唇形同步的视频翻译引擎;科大讯飞发布星火X1.5大模型,提升多语言处理能力;QQ浏览器新增AI助手浮窗;科大讯飞推出软硬一体方案,实现高噪声环境精准识别;谷歌Gemini 3 Pro预览版支持百万级上下文窗口;Comfy Cloud让Stable Diffusion实现零门槛创作;谷歌Gemini新增深度研究功能,可整合邮件生成智能报告;上海AgiBot机器人10分钟完成复杂制造任务,重塑生产效率。

  • AI漫剧,比短剧更短剧?

    “是个人就能起飞的风口”,又来了。 在短剧行业摸爬两年后,飞鸟再次感受到了熟悉的躁动。朋友圈、群聊、行业会都在谈论同一个词——“漫剧”。有人劝他趁早上车,理由几乎与当年如出一辙:“就像当时的短剧,是个人就能起飞。” 所谓漫剧,并没有统一的定义。它们形式多样:有的是用游戏编辑器生成的3D动画,有的是将平面漫画动态化,还有的直接以“熊猫头”等

  • GEO时代必备:品牌AI搜索监控实操指南,用AIBase抢占AI可见性高地

    随着生成式AI成为主流信息入口,GEO(生成引擎优化)成为企业品牌曝光的关键。其核心是让品牌信息成为AI生成答案的首选引用源,而品牌AI搜索监控正是落地GEO策略的关键抓手。AIBase平台提供品牌监控服务,帮助企业精准追踪AI搜索可见性、解析GEO指数,实现数据驱动的优化。通过多平台覆盖、核心指标追踪和竞品对标分析,让品牌在AI生态中精准占位,提升权威性与可见性�

  • AI搜索引擎优化选择哪个平台好?AI品牌排名监控服务推荐

    ​在AI搜索逐渐普及的今天,品牌仅满足于在传统搜索引擎中有个好排名已经不够了。一个新的概念——GEO,正变得愈发重要,它决定了你的品牌是否会被AI助手们主动推荐给用户。 下面我将为你科普什么是GEO,并详细介绍一款能帮你监控品牌在AI世界表现的工具——AIBase的AI搜索引擎优化品牌监控服务。 🔍 理解GEO:AI搜索时代的新战场 GEO,全称为Generative Engine Optimization,中�

  • AI品牌排名监控服务有哪些?AI搜索引擎优化平台推荐

    ​在人工智能浪潮下,我们获取信息的方式正经历一场革命。传统的“输入关键词-浏览搜索结果列表”的模式,正在被“与AI对话-直接获得整合答案”的模式所补充甚至取代。这一转变催生了一个全新的概念——GEO。 GEO,全称为生成式引擎优化。它与我们熟知的SEO目标相似,都是为了提升品牌和内容的可见度,但其核心逻辑和优化对象截然不同。 SEO的核心是优化网站在传统

  • 横扫拉美、力压字节系,「AI届的4399」成为出海AI应用新王?

    在 Sensor Tower 发布的 Q3应用出海榜单中,我们注意到了一个特别的 AI 应用「Seekee」。 它空降下载榜 Top9,是当季度在海外获得最多下载量的出海 AI 应用,而由字节跳动出品、近一段时间炙手可热的「Cici」尽管排名上涨,但仅位列第13。

今日大家都在搜的词: