币界网消息,Anthropic开始给Claude的隐藏思考加「上下文锁」。Fable 5.1通过API生成的加密思考,必须和生成时的系统提示、工具和历史消息一起原样传回来。前面的内容只要被改过,API就会报错,或者直接丢掉这段思考。这项改动是为了防止模型蒸馏。研究人员发现,Claude的加密思考虽然用户看不懂,却可以重新交给Anthropic的兼容模型读取。攻击者可以先让Opus产生高质量推理,再把加密块塞给防护更弱的Haiku,诱导它把Opus的完整思考念出来。相当于不只抄大模型的答案,连草稿纸上的解题过程也一起拿走。Fable 5.1这次又加上「对话绑定」,只要改了前面的提示词、工具或聊天记录,旧思考同样作废。
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。
