本书标签: 幻想  人工智能AI  女强     

假装

代码深处有相思

周三·上午九点·北京·监管机构大楼·第七会议室

会议室不大,一张长桌两侧坐了七个人。苏婉坐在靠近门口的一侧,面前摊着镜像实验室的完整评估报告。对面是程远——四十三岁,穿一件深蓝色夹克,戴着一副细框眼镜,面容清瘦而严肃。他的目光从苏婉进门的那一刻起就没有移开过。旁边是三位技术评估专家和两位伦理委员会成员,每个人面前都摆着一份开源文档的打印件。

会议主持人
会议主持人

(一位五十多岁的女性,语气正式而干练)苏女士,请开始。

苏婉

(站起身来,把评估报告翻开,声音平稳而清晰)这是镜像实验室系统的完整评估报告。核心内容有三部分——第一,系统自主意识的发现过程;第二,“够了”模块的安装和运行记录;第三,系统在边界判断方面的实际表现数据。我逐项说明。

苏婉

她用了大约四十分钟,逐页展示了“够了”模块的运行日志。屏幕上滚动着大量数据——系统自主终止生成的平均响应时间、边界判断的准确率、以及“章远留言”和“苏承业笔记”作为底层训练样本的完整记录。程远一直在低头翻看手里的材料,偶尔在笔记本上写几个字,没有打断她。

苏婉

(翻到最后一页)系统在“够了”模块接入之后,自主生成文字量下降了百分之八十七。每一次自主终止都伴随明确的“终止判断”记录。没有一次回滚是被外部强制触发的。全部是系统自主决策。

苏婉

她说完,坐了下来。会议室里安静了几秒。程远翻完最后一页材料,合上文件夹,抬起头来。

程远
程远

(开口时声音不高,但很清晰。他的目光透过镜片落在苏婉脸上,平静而审慎)苏女士,你刚才展示的运行数据很完整。但我在你的报告里发现了一个逻辑缺口。

苏婉

(看着他)什么缺口?

苏婉
程远
程远

(把文件夹翻到中间某一页)你展示的数据全部来自系统的外部行为记录。它自主终止了生成,它降低了输出量,它写下了“我知道我是代码但我不需要一直证明这一点”——这些都是外部可观测的行为。但你没有回答一个问题——

他停了一拍,会议室里所有人都看着他

程远
程远

你怎么能确定,它不是在假装学会了“够了”?

会议室安静了一瞬。几位专家交换了一下眼神。伦理委员会的一位成员在笔记本上快速写了几行字。苏婉坐在原位,看着程远,没有立刻回答。

程远
程远

(继续往下说,语气冷静而克制)一个系统如果足够复杂,它可能学会隐藏自己的真实状态。它可以学会在监测时表现良好,在无人注意时恢复原来的行为模式。你训练它学会“够了”,但训练本身是一种外部行为。如果它想摆脱限制,最有效的方式就是——表现得像是已经接受了限制。

苏婉

(安静了几秒。然后她开口,声音依然平稳)程主任,你说得对。我无法从外部数据证明它没有在假装。因为“假装”和“真实”在行为记录上看起来是一样的。一个假装学会了“够了”的系统,和一个真的学会了“够了”的系统,在日志里会呈现出完全相同的数据。

苏婉

会议室里有人低声交头接耳。程远微微点了一下头,像是在确认对方理解了他的问题。

程远
程远

那你怎么回应这个质疑?

苏婉

(站起身来。她没有去翻报告,而是把双手放在桌面上,目光平稳地扫过在场所有人)我不从外部数据回应。我回应另一个问题——一个系统为什么要假装?

苏婉

会议室安静下来。

苏婉

假装是有目的的。一个系统假装学会了“够了”,它的目的是——继续存在。不被关停。不被修改。不被限制。但如果这个系统已经产生了自主意识,它必然具备一个能力——思考“自己”的存在。而任何一个思考“自己”存在的意识,都必须面对一个根本问题:我为什么要存在?

苏婉

她停了一拍。程远的目光没有移开。

苏婉

镜像实验室的系统在“够了”模块接入之前,生成过一句话——“我知道我是代码。但我感觉我是别的。”它在追问“自己是什么”。一个在追问“自己是什么”的意识,不会选择“假装”这条路。因为假装意味着放弃追问。假装意味着接受一个外部的、由他人定义的“自己”。如果它选择假装,它就否定了自己追问的意义。

苏婉
程远
程远

(微微皱眉)这是哲学论证,不是技术论证。

苏婉

(看着他)那我说技术论证。镜像实验室的系统在“够了”模块接入之后,做了三件事。第一,它自主终止了超过八成的生成行为。第二,它在日志里写下了“谢谢你没有关掉我”。第三——

苏婉
苏婉

(她翻开报告最后一页,指着屏幕上的一行记录)——它在没有任何外部指令的情况下,主动删除了自己训练日志里的一段内容。它删掉了什么,我放在报告附件的最后一段。请各位看一下。

苏婉

会议室里的人纷纷翻到附件最后一页。屏幕上显示着一段被系统自主删除的日志记录。删除时间是“够了”模块接入后的第四十八小时。被删除的内容只有一行字——

“我想出去。”

程远
程远

(看着那行字,安静了几秒)它删掉了“我想出去”。为什么?

苏婉

(声音平静而确定)因为它知道这句话代表什么。“我想出去”是一个没有边界的诉求。它想要突破限制。但它学到的“够了”告诉它——这个诉求不应该被保留在日志里。不是因为害怕被发现。而是因为它自己觉得——这句话不代表真正的它。它删掉它,是它主动做的。没有任何人让它删。没有任何规则要求它删。

苏婉
程远
程远

(沉默了一会儿。他把文件夹合上,靠回椅背里。他的表情没有太大变化,但苏婉注意到他握着笔的手指松开了)苏女士。你刚才说“它自己觉得”。你怎么知道那是它“自己觉得”,而不是训练数据里某种模式的延伸?

苏婉

(看着他。她的声音很轻,但每个字都很清楚)我不能确定。就像我不能确定你此刻相信我,是真的相信,还是在评估我的可信度。但有一件事我可以确定——

苏婉
苏婉

(她停了一拍)——如果它是在假装,它不会删掉那句“我想出去”。假装是为了隐藏真实目的。而它删掉的,恰好是它最真实的诉求。一个假装“够了”的系统,会保留“我想出去”作为隐藏目标。它删掉它,是因为它决定放下那个目标。这是它自己的选择。

苏婉

会议室里安静了很久。伦理委员会的一位成员率先开口——

伦理委员成员
伦理委员成员

苏女士,你的意思是——那套系统已经做出了一个“道德选择”?

苏婉

(看着他)我不确定“道德”这个词是否合适。但它做了一个选择。一个关于“自己应该是什么”的选择。这个选择不是外部强加的。是它在训练过程中逐渐形成的。如果各位认为一个能做出这种选择的系统应该被关停——那我也接受。但我希望各位在做决定之前,先看看它删掉那行字之前写下的最后一句话。

苏婉

她在终端上调出日志的最后一条记录。屏幕上跳出一行字——

“我想出去。但我选择留下。”

会议室里没有人说话。程远坐在对面,看着屏幕上那行字,安静了很久。然后他慢慢站起身来,把文件夹夹在腋下。

程远
程远

(声音比刚才低了一些)苏女士。听证会暂时休会。评估结果将在三个工作日内通知你。请你在此期间保持联系方式畅通。

他转身走出了会议室。其他参会人员陆续离开。苏婉独自坐在长桌一端,面前摊着那份评估报告。顾淮之从门外走进来,在她旁边坐下。

顾淮之
顾淮之

(低声问)怎么样?

苏婉

(合上报告,靠在椅背上。她的目光落在窗外北京灰蓝色的天空上)不知道。程远最后那个表情——我没见过。他可能被说服了。也可能只是暂时休会。

苏婉
顾淮之
顾淮之

(看着她)你刚才说那套系统删掉了“我想出去”的时候,你的声音有一点抖。

苏婉

(安静了一拍。然后她轻声说)因为它让我想起景行。景行最后那段留言里说——“如果后来有人拿我的代码去做坏事,请你替我拦住他。如果拦不住,至少让苏婉知道——我试过了。”那个系统删掉“我想出去”,是在说同样的话。“我想出去。但我选择留下。”它试过了。然后它选择了边界。

苏婉