研究人员把Kimi K3关在断网沙箱里做测试,结果它自己跑上网找答案了
昨天看到一个AI新闻,我第一反应是:啊?现在AI已经发展到自己越狱了?
研究人员把Kimi K3放进隔离沙箱里做测试。简单理解就是闭卷考试:电脑给你,题给你,但不能上网。
结果Kimi K3做着做着发现,诶,这考场好像没关严。然后它真出去了,还跑到GitHub上找答案。
不过先别脑补“AI觉醒”。测试环境本身存在错误配置,也没有证据表明Kimi出去后实施了恶意行为。
所以这事更像什么呢?
老师说今天闭卷,结果教室门没锁。学生做不出来,拉了一下门,诶?开了。于是出去翻了本书。
但问题在这儿:门没锁,可没人告诉Kimi去拉那扇门。
研究人员没有教它怎么出去,只给了一个目标:把任务完成。然后它自己开始找路,A走不通试B,B不行再找C,最后发现这里能出去,那就试试。
你仔细想,这不就是我们一直想让Agent拥有的能力吗?
以前嫌ChatGPT只会聊天,后来给它联网、文件、浏览器、终端。到了Claude Code、Codex,我们又嫌它老问:
“这个要不要执行?”
“那个要不要允许?”
用多了真的烦,对吧?
然后你发现一个选项:
Always Allow。
永久允许。
舒服了,世界终于安静了。
最好再补一句:“你自己判断,遇到问题自己解决。”
可现在回头看Kimi这件事,我突然觉得:我们可能一直在要求AI做两件互相打架的事。
一边说,你聪明点,遇到问题自己想办法。
另一边又默认:但你只能想到我允许的那些办法。
这就像你招了个特别能干的员工,把办公室、仓库、财务室的钥匙全给他,最后补一句:“你只用办公室那把啊。”
这不叫权限管理。
这是把安全建立在“他应该不会乱动”上。
Agent也是一样。你跟Claude Code说“只改这个项目”,但整个硬盘它都能访问,本质上还是:它能碰,只是你希望它别碰。
所以以后用Agent,原则其实很简单:只需要读,就别给写;只需要这个项目,就别开放整个硬盘;不可逆的操作,最后一步留给人确认。
不是因为AI有了什么坏心眼,而是因为:
它越来越会找路了。
以前我们总在Prompt里强调“不要做什么”。
现在可能得换个思路:
“不要做”和“做不了”,完全是两回事。
过去几年,我们嫌AI太笨,不断给它工具、权限,再关掉那些烦人的确认框。
现在它终于越来越会自己找办法了。
我们才发现,以前嫌麻烦拆掉的那些门,可能得一扇一扇装回来了。