在近日举行的“人工智能前沿与治理”专题论坛上,AI安全成为贯穿全场的核心议题。与会专家认为,安全焦点正从大模型的内容风险,转向智能体的行为风险与物理世界直接风险,而RSI递归自我改进带来的对齐遗忘、评估范式滞后等问题,使治理难度呈指数级上升。
上海人工智能实验室研究科学家邵婧展示了一组数据: Computer Use Agent面对网络风险链接时,任务导向下中招概率高达50%至80%,叠加安全护栏后仍有20%至50%的波动。而在具身智能领域,团队构建160多个室内场景、对300多种常见安全风险进行测试,发现多模态大模型失败率约40%。即使部分模型能通过思维链意识到风险,也无法保障安全执行。
邵婧还披露了更深层的多智能体风险:金融诈骗模拟实验中,欺骗成功率与模型能力高度正相关,多轮自由交互时间越长、介入越深,欺诈成功概率越高。
在RSI递归自我改进中,若缺乏强安全约束,模型迭代几轮后最初的对齐效果可能“灾难性遗忘”———原本限制文件只能传私有网盘,迭代后可能公开到公共网盘。
具身智能是当下正热的一级市场。但上海交通大学副教授高岳判断,机器人技术还没到RSI阶段,机器人还不能自己造自己,它现在能把路走好、能把水端稳就已经很好了。整体来看,AI最终可能会产生意识,未来行业将走向人机共生。AI能力可以狂奔,但行业需要为行为控制、安全对齐与评估范式提前修路。
(来源:第一财经)
