首页 > 业界 > 关键词  > 正文

​ 谷歌研究:通过对抗性数据生成和多元评估应对GenAI的道德和安全风险

2023-11-17 10:29 · 稿源:站长之家

**划重点:**

1. 🌐 生成式AI(GenAI)在创新应用中取得了前所未有的成就,但也伴随着虚假信息、偏见和安全风险。谷歌研究通过对抗性测试和红队行动,努力应对GenAI建设中的责任难题。

2. 🛠️ BRAIDS团队致力于通过可扩展的工具、高质量数据和创新研究简化RAI实践的采用。他们通过对抗性数据生成、自动化测试集评估以及社区参与,识别和减轻GenAI产品的道德和安全风险。

3. 👥 了解和缓解GenAI的安全风险不仅是技术挑战,还涉及社会层面。通过多元的评估方法,包括对不同背景的评估者的研究,谷歌研究不断努力确保GenAI的安全性和包容性,并通过社区参与发现潜在的未知风险。

站长之家(ChinaZ.com) 11月17日 消息:谷歌研究团队在人工智能领域持续推动着对生成式AI(GenAI)安全的研究,以应对其在虚假信息、偏见和安全性方面带来的挑战。作为谷歌研究的一部分,负责构建负责任的AI和数据系统的Responsible AI and Human-Centered Technology(RAI-HCT)团队旨在通过文化感知研究的视角推进负责任的人本AI的理论和实践,以满足今天数十亿用户的需求,并为更好的AI未来铺平道路。

在RAI-HCT团队中,Building Responsible AI Data and Solutions(BRAIDS)团队专注于通过可扩展的工具、高质量数据、简化的流程以及创新研究简化RAI实践的采用,特别关注处理GenAI(生成式AI)带来的独特挑战。GenAI模型带来了前所未有的能力,推动了创新应用的迅速发展,然而,它同时也存在虚假信息、偏见和安全性的风险。

为了解决这些风险,谷歌在2018年制定了AI原则,强调有益使用和防范伤害。自那以后,谷歌通过全面的风险评估框架、内部治理结构、教育以及在AI产品生命周期内识别、衡量和分析伦理风险的工具和流程的开发,致力于有效实施这些原则。BRAIDS团队专注于最后一个方面,通过创建工具和技术,帮助谷歌团队识别GenAI产品中的伦理和安全风险,并采取适当的缓解措施。

GenAI的挑战在于其前所未有的能力伴随着一系列潜在的失败,迫切需要在模型广泛推出之前采取全面而系统的RAI方法来理解和减轻潜在的安全问题。对抗性测试是一种关键技术,通过系统地评估模型在提供恶意或无意中有害输入的情况下的行为,以了解潜在风险。

谷歌的研究侧重于三个方向:扩展的对抗性数据生成、自动化测试集评估和社区参与。为了创建测试集,BRAIDS团队采用了“人在回路中”的方法,以在不同情境下包含多样化且潜在不安全的模型输入。自动化测试集评估帮助快速评估模型在各种潜在有害情境下的响应,而社区参与则有助于发现“未知的未知”,并启动数据生成过程。

在安全性评估中,人类判断起着关键作用,但受到社区和文化的影响,难以自动化。为了解决这一问题,团队注重研究评估者的多样性。他们还通过引入基于大型语言模型(LLMs)的自动评估者,提高了评估的效率和规模,同时将复杂或模糊的案例交给专业评估者。

在社区参与方面,团队积极与Equitable AI Research Round Table(EARR)等组织合作,确保他们代表使用他们模型的多元社区。Adversarial Nibbler Challenge则邀请外部用户参与,了解不安全、偏见或暴力输出对最终用户的潜在危害。他们还通过参与研究社区的活动,如在亚太计算语言学协会会议(IJCNLP-AACL2023)的The ART of Safety研讨会中,与研究界合作解决GenAI的对抗性测试挑战。

在评估GenAI安全风险时,团队认识到这既是技术上的挑战,也是社会上的挑战。安全感知是固有主观的,受到多种交叉因素的影响。他们进行了关于评估者人口统计信息对安全感知的影响的深入研究,探讨了评估者的人口统计信息(如种族/种族、性别、年龄)和内容特征(如危害程度)对GenAI输出的安全评估的交叉影响。他们的研究框架揭示了不同背景的评估者之间的一系列分歧模式,为评估人类注释和模型评估的质量提供了新途径。

GenAI带来了技术变革,即使不需要编码也可以实现快速开发和定制。然而,这也伴随着产生有害输出的风险。谷歌的主动对抗性测试计划旨在识别和减轻GenAI风险,确保其模型行为包容。对抗性测试和红队行动是安全策略的重要组成部分,全面进行它们对应对快速创新的要求,不断挑战自己,与内部伙伴、多元用户社区以及其他行业专家合作,发现“未知的未知”。

举报

  • 相关推荐
  • 从潜客挖掘到一线经营,AI Agent 正在重塑金融增长工作流

    Sensors AI金融专场提出,AI Agent正进入真实经营流程,企业真正缺的是能理解目标、调用数据、协调资源并持续推进的“AI Growth Team”。神策以潜客挖掘、策略迭代、一线经营助手、自动化分析四条Agent工作流,串起总部策略到一线执行的金融增长闭环,让AI从提供工具走向持续承接增长任务。

  • 红熊AI原生Agent,让AI带着记忆走进千行百业

    红熊AI推出基于MemoryBear记忆引擎的四大原生Agent,解决大模型在真实业务中因“无记忆”导致的碎片化问题。智能客服跨渠道共享记忆,能办结完整任务而非仅问答;智能营销五Agent围绕统一客户记忆协同,避免割裂;ChatBI以自然语言问数,记指标、越用越准;智能教育记录学生三层成长轨迹。MemoryBear在两项全球基准登顶,推动AI从瞬间反应走向持续成长,让有记忆的AI更懂你。

  • 生成式引擎优化怎么做?翰智GEO给出体系化方案

    AI问答正取代搜索框,生成式引擎优化(GEO)成品牌获取AI引用的关键。GEO面向大模型,需遵循经验、专业、权威、可信四维评估标准。选服务商应看基因资质、技术体系、效果溯源和量化承诺,如案例企业背靠22年数字化积累,自研七步闭环系统与溯源引擎,并坚守白帽合规路径,实现效果可交付、可追溯。

  • 飞书深诺携Marvy 2.0亮相ChinaJoy 2026:以 Agent OS重构游戏出海增长新范式

    第23届ChinaJoy以“与AI同游”主题在上海开幕,飞书游戏Meetgames亮相并展示新一代出海营销操作系统Marvy2.0。面对全球手游收入增长放缓、获客成本攀高及创意产能不足的困境,Marvy2.0以多智能体架构重构营销全链路,提供从市场洞察、创意生成到智能投放及用户全生命周期运营的AI解决方案,将营销从经验试错升级为数据驱动的精准增长。

  • 店匠科技李俊峰:独立站进入 AI Agent 时代,经营规模不再与团队规模线性绑定

    店匠科技于深圳峰会发布AI智能体Athena的全新经营逻辑,并首次提出《独立站AI运营成熟度分级》。Athena能理解目标、拆解任务并调用专业Agent执行全链路运营,显著降低人工协作依赖。该分级从任务覆盖度、自主完成率、人工介入率等四维度,将AI能力分为L1到L5五阶段:从单点生成工具到全自主商业体,当前Athena人工介入率已降至18%。其价值在于将复杂经营决策转为日常能力,通过连接全球生态实现7×24小时精准调度,推动独立站从工具驱动迈向意图驱动的智能运营模式。

  • 忆联Gen5 QLC AE631即将面市:性能看齐TLC,唤醒本地AI算力

    本地AI算力加速,模型推理向端侧下沉。忆联发布首款消费级PCIe 5.0 QLC SSD AE631,以TCO优势实现TLC级性能,锚定高并发、高带宽、高安全三大挑战。该盘兼具高性能、低功耗、高可靠与大容量,推动SSD从存储仓库跃升为关键算力节点,精准卡位AI PC落地窗口。忆联将持续引领Gen5 QLC突破,拓展本地AI体验边界。

  • 易宝支付推出YEEAP智能数字钱包,补齐Agent经济支付基础设施短板

    AI智能体升级为“数字员工”,高频自动交易冲击传统支付:AI无专属可信身份、支付网关仅限自然人、授权与扣款易脱节。易宝支付推出YEEAP,承认Agent为独立交易主体,提供身份授权、资金隔离风控与轻量API商业化三层能力,构建新AI支付底座。

  • AI CRM的下一个十年:从“人用的系统”到“Agent调用的底座”

    2026年被视为AI Agent规模化落地元年,国内企业级市场预计达135.3亿元,年增速超70%。AI正从辅助工具走向自主执行业务,CRM进入2.0阶段,核心评价标准从“界面友好”转为“调用效率”。销售易NeoAgent2.0以业务语义模型重构数据底座,实现AI原生、结果交付与开放生态,助米其林、伊顿等企业降本增效,标志着CRM从管理系统向能力输出平台的结构性迁移,Agent不是终结而是重生。

  • 谷歌首款2nm折叠屏!谷歌Pixel 11 Pro Fold发布:12800元起

    谷歌全新折叠屏Pixel 11 Pro Fold正式发布,起售价为1899美元(16GB 256GB),折合人民币约12800元。 首先来看屏幕配置。谷歌Pixel 11 Pro Fold配备一块6.5英寸Super Actua外屏,分辨率为1080 x 2342,像素密度达到399PPI,支持1至120Hz刷新率自适应调节,峰值亮度高达3600尼特。 内屏尺寸为8英寸,分辨率为20762152,像素密度为372PPI,同样支持1至120Hz自适应刷新率,显示效果细腻流畅。 工业设计�

  • 百度智能云发布OPC扶持计划,三个月计划投入2亿元加码Agent生态

    8月12日,百度智能云在成都发布OPC专项扶持计划,三个月内投入2亿元,从产品、算力、市场、培训等维度支持生态。计划提供Agent产品权益与资源,降低创新创业门槛。百度Agent全家桶以搭子为入口串联秒哒、网盘等,覆盖内容创作全链路,已在短剧、动漫、AI音乐等场景落地,联合生态伙伴推动内容产业规模化发展。

今日大家都在搜的词: