埋在 Opus 5 系统卡里,而不是标题评估分数里:这是 Anthropic 迄今为止最弱的可提示注入模型。


凭据:
> 在提示注入评估中进行了测试,而不只是一个场景
> 经受住了主动红队的尝试
> 被 Anthropic 自己的负责人点名为他最兴奋的结果,且超越了基准
提示注入是把你的代理反过来对付你的攻击。对不可信数据进行的每一次工具调用都是暴露。挪动那个数字的价值,胜过在代码测试台上多得 1 分。
查看原文
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 评论
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
暂无评论