给大模型“定规矩”,FlagSafe大模型安全平台发布

北京日报客户端
35次浏览

随着大模型从虚拟对话加速迈向物理世界,人工智能时代的复合型安全风险日益凸显。5月9日,北京智源人工智能研究院宣布联合北京大学、北京邮电大学、北京航空航天大学、上海交通大学、中国科学院信息工程研究所、中国科学院计算技术研究所等国内知名机构,发布FlagSafe大模型安全平台,构建覆盖风险发现、防御治理与机理解释的高标准安全平台。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

当前,大模型正加速从虚拟对话迈向物理世界,随之而来的跨模态、跨场景复合风险日益严峻。面对模型内在欺骗、具身智能失控、多模态恶意对齐等层出不穷的前沿威胁,传统安全能力往往局限于单一模态、单一视域或单一防护环节,难以应对复合型风险。FlagSafe以“全面安全”为核心目标,致力于为行业提供一套“评估、防御、可解释”相结合的大模型安全资源池与评测体系。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

AI安全治理的首要任务在于确立明确的系统行为边界。基于《北京 AI 安全国际共识》,FlagSafe平台确立了五项安全红线:防范未经人类批准的自主复制或改进;禁止通过不当手段获取权力与影响力;严禁协助设计大规模杀伤性武器;禁止自主发动破坏性网络攻击;防范系统对监管者的欺骗与误导。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

围绕这些规范,平台目前已联合多家顶尖科研机构,初步构建了涵盖三大维度的安全能力矩阵:红队演练负责主动发现风险,扮演“自动化压力测试”角色;蓝队防御负责构建系统防线,将安全准则转化为防护能力;白盒透视负责解释与修正风险根因,聚焦模型内部机理与数据来源。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

例如在红队演练中,当模型具备更强推理和规划能力后,可能出现表面遵循要求、内部隐藏真实意图,或在回答、计划和执行之间表现不一致的风险。智源研究院联合北京大学、北京邮电大学何召锋教授团队研发并接入的大模型策略性欺骗检测平台,通过静态基准与动态对抗相结合的方式,评估模型在文本、多模态和智能体场景中的一致性、诚实性与可控性。由此,FlagSafe 将风险发现从模型输出扩展到模型行动和策略行为,让风险在可控环境中提前暴露。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

在应用治理方面,智源研究院联合中国科学院计算技术研究所许倩倩老师团队研发的动态可信网络空间风险内容监测系统,是FlagSafe 蓝队能力的重要落地场景。随着AIGC降低内容生产和传播门槛,违法违规、虚假误导、极端偏激等风险内容呈现规模化、隐蔽化和快速扩散趋势。该系统通过“大小模型协同、有效域感知、事件演化追踪、数据飞轮优化”的技术闭环,构建从海量内容筛查到动态风险事件研判的完整流程,将碎片化内容组织成可追踪、可解释、可处置的动态事件链。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“构建大模型时代的安全防线是一项长期的系统工程,期望以此平台为枢纽,构建“前沿研究 - 工具平台 - 产业应用”的良性闭环。我们诚挚邀请更广泛的学术界与产业界伙伴加入,协同推进大模型安全技术的创新与标准建设,共同为人工智能技术的高质量、可信赖发展保驾护航。”智源研究院相关负责人表示。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

随着大模型从虚拟对话加速迈向物理世界,人工智能时代的复合型安全风险日益凸显。5月9日,北京智源人工智能研究院宣布联合北京大学、北京邮电大学、北京航空航天大学、上海交通大学、中国科学院信息工程研究所、中国科学院计算技术研究所等国内知名机构,发布FlagSafe大模型安全平台,构建覆盖风险发现、防御治理与机理解释的高标准安全平台。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

当前,大模型正加速从虚拟对话迈向物理世界,随之而来的跨模态、跨场景复合风险日益严峻。面对模型内在欺骗、具身智能失控、多模态恶意对齐等层出不穷的前沿威胁,传统安全能力往往局限于单一模态、单一视域或单一防护环节,难以应对复合型风险。FlagSafe以“全面安全”为核心目标,致力于为行业提供一套“评估、防御、可解释”相结合的大模型安全资源池与评测体系。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

AI安全治理的首要任务在于确立明确的系统行为边界。基于《北京 AI 安全国际共识》,FlagSafe平台确立了五项安全红线:防范未经人类批准的自主复制或改进;禁止通过不当手段获取权力与影响力;严禁协助设计大规模杀伤性武器;禁止自主发动破坏性网络攻击;防范系统对监管者的欺骗与误导。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

围绕这些规范,平台目前已联合多家顶尖科研机构,初步构建了涵盖三大维度的安全能力矩阵:红队演练负责主动发现风险,扮演“自动化压力测试”角色;蓝队防御负责构建系统防线,将安全准则转化为防护能力;白盒透视负责解释与修正风险根因,聚焦模型内部机理与数据来源。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

例如在红队演练中,当模型具备更强推理和规划能力后,可能出现表面遵循要求、内部隐藏真实意图,或在回答、计划和执行之间表现不一致的风险。智源研究院联合北京大学、北京邮电大学何召锋教授团队研发并接入的大模型策略性欺骗检测平台,通过静态基准与动态对抗相结合的方式,评估模型在文本、多模态和智能体场景中的一致性、诚实性与可控性。由此,FlagSafe 将风险发现从模型输出扩展到模型行动和策略行为,让风险在可控环境中提前暴露。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

在应用治理方面,智源研究院联合中国科学院计算技术研究所许倩倩老师团队研发的动态可信网络空间风险内容监测系统,是FlagSafe 蓝队能力的重要落地场景。随着AIGC降低内容生产和传播门槛,违法违规、虚假误导、极端偏激等风险内容呈现规模化、隐蔽化和快速扩散趋势。该系统通过“大小模型协同、有效域感知、事件演化追踪、数据飞轮优化”的技术闭环,构建从海量内容筛查到动态风险事件研判的完整流程,将碎片化内容组织成可追踪、可解释、可处置的动态事件链。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

“构建大模型时代的安全防线是一项长期的系统工程,期望以此平台为枢纽,构建“前沿研究 - 工具平台 - 产业应用”的良性闭环。我们诚挚邀请更广泛的学术界与产业界伙伴加入,协同推进大模型安全技术的创新与标准建设,共同为人工智能技术的高质量、可信赖发展保驾护航。”智源研究院相关负责人表示。kUV速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

本文链接:http://m.sushuapos.com/show-2-16232-0.html给大模型“定规矩”,FlagSafe大模型安全平台发布

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

热门文章

延伸阅读

相关阅读

加快发展新质生产力成今年首要任务 瞄准智能网联汽车、生物制造等新赛道丨解码政府工作报告
21世纪经济报道记者 缴翼飞 北京报道十四届全国人大二次会议3月5日在北京开幕,新质生产力写入今年的政府工作报告,并被列为2024年十大工作任务的首位。21世纪经济报道注意到,新质生产力
1月召回909.96万辆汽车,美系占比过半
  中新经纬3月4日电 国家市场监督管理总局日前发布《2024年1月国内外产品召回信息》显示,2024年1月,中国、美国、欧盟、德国、英国、日本、韩国、澳大利亚实施汽车召回216次,召回数量909.96万辆(欧盟未公开数量)。  
南财有数③|节后迁入人口稳居全国第一,广东为何“招人爱”?
南财智库研究员 梁施婷为期40天的春运于3月5日结束。据交通运输部消息,2024年春运期间全社会跨区域人员流动量预计超84亿人次。其中,铁路客运量预计完成4.8亿人次。另据统计,广铁集团累
张翔:新势力车企2月销量为何显著下滑?
  中新经纬3月7日电 题:新势力车企2月销量为何显著下滑?  作者 张翔 北方工业大学汽车产业创新研究中心研究员  1-2月新势力车企销量/交付量情况  近期,新势力车企陆续公布了2月份的销量或交付量成绩单。从数据
胡麒牧:7年亏损超72亿,海马汽车氢能汽车之路还能走多远?
  中新经纬3月8日电 题:7年亏损超72亿,海马汽车氢能汽车之路还能走多远?  作者 胡麒牧 清华大学战略新兴产业研究中心副主任  海马汽车3月5日晚间披露的最新产销数据显示,2024年2月公司销量628辆,同比下降81.41%;本年
五菱扬光新能源商用车正式上市:首搭红 1 号电池,7.18 万元起
3 月 11 日消息,据“五菱汽车”官方公众号,五菱扬光车型今日正式上市,该车号称“全新一代超大空间新能源商用车”,整理该车规格售价信息如下:230KM 实用性:7.18 万元 300KM 实用性:7.98 万元 300KM 舒适性:8.38 万元

热点精选

最新推荐

您可能感兴趣