打造AI网安“红队”:OpenAI先容内部误差检测模子GPT-Red
2026-07-22 07:48:54 宣布
泉源:绿色先锋
作者:刘文钰
浏览:7183次
IT之家 7 月 16 日新闻,,,,,,OpenAI 外地时间 15 日先容了其内部使用的网络清静“红队”模子 GPT-Red。。。。。该模子可自动化地举行种种网络攻击模拟,,,,,,资助 OpenAI 提升对外模子产品的鲁棒性。。。。。
OpenAI 体现,,,,,,其已往半年自 GPT-5.3 后的每个生产模子均将“红队”模子用于训练。。。。。伪造头脑链型攻击的乐成率已从 GPT-5.1 上的 95% 降低至最新模子上的缺乏 10%;;;;最新的 GPT-5.6 Sol 在 GPT-Red 的直接提醒符注入攻击中失败率仅有 0.05%。。。。。
GPT-Red 使用自博弈强化学习举行训练:其自己和一组差别的防御型 LLM 在普遍的红队场景上同时举行训练。。。。。GPT-Red 因乐成诱发有用失败而获得奖励,,,,,,而防御型模子则因反抗攻击并完成其原始使命而获得奖励。。。。。随着防御型模子变得越来越强盛,,,,,,GPT-Red 被迫发明更强盛、更多样化的攻击。。。。。
“红队”模子与产品模子相隔离。。。。。OpenAI 相信其已开启了良性的人工智能网络清静循环,,,,,,可使用现有模子来增强未来模子的鲁棒性、一致性、可信度。。。。。
桥梁、边坡、矿山、地灾隐患点……这些平时并不起眼的地方,,,,,,一旦出问题,,,,,,往往就是大事,,,,,,关系的是群众生命清静和都会运行清静。。。。。
责任编辑:钱幸钰 校对:田火劭