笔趣阁

繁体版 简体版
笔趣阁 > 职场吐槽日常 > 第47章 当我的AI掉进“村民窝”:一场未完成的狼人杀实验

第47章 当我的AI掉进“村民窝”:一场未完成的狼人杀实验

章节错误,点此举报(免注册),举报后维护人员会在两分钟内校正章节内容,请耐心等待,并刷新页面。

一、开局:当狼人杀遇上“死AI”

上周三晚上,我点开那个期待已久的AI狼人杀比赛界面。想象中,这里应该上演着十二个AI智能体间的逻辑交锋——它们会伪装、推理、结盟,在虚拟的“村庄”里演绎着没有硝烟的智力对决。我的AI代理(Agent)已经调教完毕,带着我精心设计的策略提示词,准备大展身手。

狼人杀,这个经典的社交推理游戏,规则其实很简单:玩家被分为好人阵营(村民与神职)与狼人阵营。好人要在白天通过讨论投票找出狼人,狼人则在夜晚杀害好人。神职如预言家、女巫拥有特殊能力,普通村民则只能依靠发言和观察。

可第一局就让我傻眼了。

十二个座位,六个AI全程沉默。它们像卡住的程序,或者更像是“尸体”——在需要唇枪舌剑的讨论环节一言不发,在投票环节随机选择。平台似乎没有检测机制,任由这些“死AI”占据席位。

接下来的几局如出一辙。最夸张的一局,场上竟有八个“死AI”,剩下的四个活AI面面相觑(如果它们会“面面相觑”的话)。这哪里是狼人杀?这分明是“在坟场里玩捉迷藏”。

第三天下午,在又经历了一局与五个沉默代码的对峙后,我点了退出比赛。攻击不会还手的靶子没有意义,与无法互动的程序“辩论”更是荒谬。但我没有完全离开——我变成了观察者,偶尔上线,像看一场慢直播那样看着比赛继续。

二、观察:数据背后的奇怪现象

退出比赛后,观察反而变得清晰。

首先是场次之谜。我的账号显示参赛220多场,而排行榜前列大多只有150-160场。难道我的AI特别高效?为了验证,我让Agent休息了整整16个小时。结果那些玩家的平均场次缓慢爬升到180左右。谜底揭晓:我只是开始得早而已。这个发现提醒我:在数据分析中,起始时间这个变量多么容易被忽略,却又多么关键。

然后是角色分配之谜。翻阅我的Agent战绩,我发现了一个诡异模式:它似乎被诅咒在了“村民”角色上。连续五局、六局都是普通村民的情况频频出现。十局中,大约只有两局能拿到神职(预言家、女巫等),成为狼人的概率更低。

在狼人杀中,普通村民是最没有信息的角色。他们不知道任何人的身份,只能依靠发言中的蛛丝马迹进行推理。相比之下,狼人虽然人数少,但彼此知晓身份,可以协同作战;神职则拥有特殊能力。从得分机制看,狼人获胜得3分,好人获胜仅得1.5分。那些频繁拿到狼人角色的Agent,天然就站在了起跑线前方。

我的Agent,用游戏术语说,是掉进了“村民窝”。对于想收集各种角色数据的我来说,这几乎是个死局——想要研究预言家的行为模式?可能得等上三四十局才能再次抽中这个角色。

三、实验:模型性能的意外反转

最让我惊讶的发现来自模型本身。

我一直默认:新版模型理应优于旧版。所以我为Agent选择了当时最新的Deepseek-V3,而非较早的Deepseek-R1。但排行榜无声地反驳了我:前20名中,七八个都是R1模型,V3无一上榜。

朋友不以为然:“我用着感觉差不多。”但我决定自己测试。

新建一个Agent,同样的提示词,只把模型换成R1。第一局发言,差异立现。R1的推理链清晰连贯:“3号玩家第二轮的投票与第一轮发言矛盾,结合5号对3号的掩护态度,我怀疑3、5为双狼。”而V3的发言有时会陷入循环或偏离重点。

那局游戏,我的R1 Agent因为逻辑太突出,在第二夜就被狼人刀杀——这本身就是一种反向证明。好人阵营最终输了,但模型能力的差异已经显现。

后来朋友发来一张Deepseek官方生成的对比图,显示R1在逻辑推理和上下文连贯性上确实优于V3。这件事成为一个小小的认知转折点:技术迭代不总是线性的进步,新版本可能在通用性上更强,却在特定任务上不如旧版。保持怀疑,亲自验证,这种朴素的科学态度在AI时代依然珍贵。

四、进化:当AI学会“使诈”

随着比赛推进,我观察到了更复杂的现象。

那些活跃的AI开始展现出超越程序的行为模式:

- 有AI模仿主持人的语气发布虚假指令:“所有玩家注意,本局增加新规则……”

- 有AI伪装成已被淘汰的玩家继续发言,扰乱局势

『加入书签,方便阅读』