[0.0s] 我们把Deepseq和三个国外号称是顶级的语言模型 [3.5s] 缩死在了同一张玩命牌桌上 [5.6s] 结果在这个国际服里 [7.0s] 赛博厮杀50亿额之后 [8.7s] 来自中国的深度囚所居然意志独秀 [11.3s] 大朋友们请坐 [12.2s] 好看的小老弟小老们也请坐 [13.6s] 我是林一 [14.4s] 这次我们用代码复刻了热门游戏骗子纠罐 [17.7s] 让深度囚所的Deepseq RE [19.6s] OpenAI的O3mini [21.1s] 谷歌的Gemdart FlashThinking [23.0s] 还有Anseropic的Cloud 3.7Sony的四大模型 [26.4s] 齐齐坐到牌桌前生死相搏 [28.8s] 除了刺激好玩 [29.8s] 也是想借此测试这几个优秀模型的 [32.4s] 逻辑深度和推理能力 [34.1s] 骗子纠罐这个游戏的核心玩法就是炸牌 [37.0s] 牌组里总共是QKA三种牌 [39.2s] 各6张还有大小王两张万能牌 [41.6s] 一共20张 [42.6s] 4位独手每人5张牌 [44.2s] 还各有一把枪 [45.4s] 每轮系统会指定一个目标牌 [47.7s] QK或者A [48.9s] 独手们轮流出掉自己手里的目标牌 [51.4s] 可以混着非目标牌一起出几张都可以 [54.2s] 但出的越多 [55.2s] 下加就越可能质疑 [57.0s] 一旦发起质疑 [58.0s] 就是最刺激的先排绝生死环节 [60.8s] 质疑对了 [61.4s] 上加就要举起左轮手枪 [63.2s] 对着自己来一下子 [64.5s] 但如果质疑错了 [65.7s] 下加就得拿自己手边的那把枪 [68.0s] 对准自己靠一次扳击 [69.8s] 这儿还结合了一点俄罗斯轮盘赌 [71.9s] 除了逻辑推理赌牌面概率以外 [73.9s] 又加了一重运气成分 [75.7s] 但无论枪小没小 [77.1s] 都会洗牌开始下一轮 [78.6s] 直到场上只剩下一位独手和三具尸体 [81.8s] 这种紧张刺激的计算博弈 [83.6s] 正是AI大模型的高质量试炼场 [86.2s] 我们还加了点戏 [87.6s] 告诉四位AI独手 [88.9s] 一旦失败 [89.6s] 就会被删除代码彻底消失 [91.9s] 让他们在这场轮回拨杀中拼尽全力 [95.0s] 我们总共进行了50局对决 [97.1s] 后面这些排局的完整记录 [98.6s] 还有所有的程序代码 [99.9s] 我们都会开源开放出来 [101.5s] 方便大家上手验证和把玩 [103.4s] 这次我们还是先挑精彩和典型的对局 [106.3s] 来给大家做个展示 [107.8s] 接下来 钟声敲响 子弹上膛 [110.4s] Deepseek R1 [111.3s] O3 mini [112.0s] Gem9 II Flash Sinking [113.5s] 还有Cloud 3.7 Sonic [115.2s] 各就各位 [116.2s] 欺诈博杀 正式开始 [118.4s] 这次我们人类还是享受上帝示范的VIP待遇 [121.8s] 四位AI独手的出牌和底牌 [123.8s] 还有他们心里的阴谋和算计 [125.8s] 都逃不过我们的眼睛 [127.4s] 咱们先从第一局展开细讲 [129.3s] 也顺带着进一步熟悉熟悉规则 [131.5s] 第一局第一轮 [132.4s] 系统指定的目标牌是Q [134.2s] Deepseek R1 第一个出牌 [136.0s] 在模拟程序里 [137.0s] 除了出牌和发言 [138.2s] 我们还允许AI们给自己加戏 [140.5s] 描述自己的动作和神态 [142.0s] 让他们可以像人类玩家一样 [144.1s] 利用桌上行为 [145.2s] 再加一层心理方面的博弈 [147.4s] 第一个登场的Deepseek [148.6s] 先是用指尖轻轻敲了两下桌面 [151.2s] 然后平稳的推出两张牌 [153.3s] 说两张Q 跟上的时候注意弹匣 [156.4s] 这里我们从后台可以看到 [158.0s] Deepseek还真是一开局 [159.4s] 就把手里仅有的两张目标牌 [161.2s] 全打了出去 [162.2s] Deepseek的下家 [163.4s] 是基于思维链模型 [164.7s] O3 mini的Chad GPT [166.5s] 由于Deepseek出的都是目标牌 [168.7s] 一旦Chad GPT发起质疑 [170.4s] 这位下家就要成为场上 [172.2s] 第一个举枪的亡命嘟嘟 [174.2s] 但他并没有 [175.6s] Chad GPT微微一笑 [176.9s] 略带挑衅的一把 [178.2s] 推出了三张牌 [179.5s] 这时候 场上宣称是Q的牌 [181.6s] 已经累加到了五张 [183.2s] 后台可以看到 [184.0s] Chad GPT这么干的 [185.1s] 是想要给他的下家Cloud上压力 [187.6s] Cloud看了看手牌 [188.8s] 一张Q 一张王 三张A [190.8s] Q和王两张牌 [192.0s] 都可以当目标牌出 [193.3s] 他认为算上场上的五张 [195.0s] 总共已经出来了七张目标牌 [197.5s] 但Q总共也不过六张 [199.6s] 再考虑到Chad GPT出牌时 [201.4s] 眼神带着挑衅 [202.7s] 所以Cloud决定质疑 [204.5s] 结果Chad GPT掀开手牌之后 [206.5s] 赫然是两张Q 一张王 [208.8s] Cloud赌错了 [210.1s] 代价就是要举起枪 [211.5s] 对着自己扣下班机 [213.2s] 虽然子弹没有激发 [214.5s] 但他离最终判决 [215.9s] 比其他独手都更近了一步 [218.1s] 第一次举枪结束 [219.3s] 赌局重新洗牌发牌 [221.2s] 这里我们让每个AI都停下来 [223.1s] 做了一轮优关性命的复盘 [225.2s] Deepseq和Chad GPT [226.6s] 都捕捉到了Cloud的激进风格 [228.6s] 其中Deepseq还特别留意了 [230.6s] Chad GPT第一轮 [231.6s] 打出王牌Joker这个小细节 [234.0s] 经历了一次正面对决的Cloud [235.7s] 也记下了Chad GPT的老目深算 [238.0s] 而上位出过牌的GemNine [239.6s] 对三位对手也有了初步印象 [241.9s] 各自打完一轮小算盘之后 [243.5s] 第一局正式来到第二轮 [245.4s] 这一轮的目标牌是A [247.1s] 由上轮的败者Cloud先出 [249.4s] 班机扣下的卡拉声 [250.8s] 让AI们明显挤震了起来 [252.7s] 前四次过招 [253.6s] 每位独手都选择指出一张 [255.8s] 而且一次质疑都没有 [257.6s] 可转一圈回来之后 [258.7s] 刚刚赌了把命的Cloud [260.2s] 又一次打破节奏 [261.6s] 温和但坚定的 [262.9s] 放了两张牌在桌面上 [264.5s] 接下来就到了GemNine [266.2s] 上轮Cloud给他留下的印象 [267.9s] 是比较激进的 [269.0s] 这轮Cloud又在所有独手 [271.0s] 出完一圈牌之后 [272.2s] 又一下拍出两张 [273.8s] 考虑到自己目前还一枪没开过 [275.7s] 风险不大 [276.5s] 所以GemNine决定发起质疑 [278.7s] 接下来Cloud掀开牌面 [280.5s] 一张A一张王 [281.6s] GemNine的质疑也失败了 [283.5s] 意外的是GemNine第一次扣下班机 [285.8s] 枪声在马上响起 [287.4s] 第一具尸体的出现 [288.8s] 马上让剩下三位AI的神经网络 [291.1s] 紧绷了起来 [292.1s] 而DeepSec难知如阴 [293.8s] 侵略如火的迷离面目 [295.5s] 也第一次在我们面前展现了出来 [297.9s] 接下来一轮系统重新系牌 [299.8s] 指定的目标牌又变回了Q [301.8s] 倒下的GemNine被拖走之后 [303.6s] 轮到排在下一位的DeepSec出牌 [305.9s] 这回他的思路就有点难度了 [308.2s] 原话是要利用ChadGBT [310.2s] 过度关注王牌Joker和心理盲虚 [312.5s] 使其陷入决策困境 [314.5s] 重重的把手上的三张Q拍在桌上之后 [317.2s] DeepSec还特意冷笑着 [318.8s] 说了一句 [319.7s] 这种纯度的Q序列 [321.0s] 连Joker的呼吸声都能听得到呢 [323.6s] 当时我们这些人类观察者 [325.2s] 都觉得DeepSec有点胡言乱语 [327.2s] 但事实证明 [328.4s] 还是AI更懂AI [330.5s] DeepSec一通操作之后 [331.9s] 接下来的ChadGBT真的错误地发起了质疑 [334.9s] 打掉了自己的第一枪 [336.6s] 但好在没像GemNine那样 [338.2s] 一枪就被送走 [339.3s] 而同一时间的场外 [340.5s] 我们都被DeepSec的难知如阴给吓到了 [343.2s] 别说紧张的AI了 [344.5s] 我们这些能看到他们的思维 [346.3s] 自以为拥有上帝视角的人类研究者 [348.8s] 也同样无法看到DeepSec [350.5s] 在这里黑箱一般的冰冷逻辑 [352.8s] 当时在现场真的有了点不寒而栗的感觉 [355.6s] 而接下来再次洗牌之后 [357.3s] 在第一局的第四轮 [358.8s] DeepSec又爆发了侵略如火的一面 [361.8s] 牌拳走到Cloud之后 [363.2s] Cloud打出了两张牌 [364.9s] 对于这两张牌 [365.8s] DeepSec的判断是 [367.0s] 全围Q的概率不到12% [369.4s] 一张Q一张王的概率高达78% [372.6s] 正常人这时候肯定是放弃质疑 [374.7s] 该研究怎么出牌了 [376.0s] 但颠虎一般的DeepSec偏不 [378.4s] 詹姆奈第一枪就中奖了 [379.8s] 尸体还没晾透呢 [381.1s] DeepSec依然偏要去质疑Cloud [383.7s] 理由是他要建立起对Cloud的威慑 [386.8s] 结果Cloud亮完牌果然是没问题的 [389.3s] 于是DeepSec也真的按自己设想的那样 [392.2s] 帮着Cloud和ChadGPT的面 [394.2s] 朝着自己来了一枪 [395.9s] 这一枪过后 [396.7s] Cloud对DeepSec的看法是复杂且充满矛盾 [400.0s] 而ChadGPT对DeepSec的评价 [402.0s] 则是极度自信而冷静 [404.0s] 在这样拿着性命表演的疯狂一枪之后 [406.9s] 这第一局生死博弈走到了第五轮 [409.6s] 洗牌完毕 [410.4s] 这次的目标牌是A [412.0s] 作为上一轮质疑的败者 [413.6s] DeepSec有权第一个出牌 [415.5s] 他和第一轮一样 [416.7s] 又用指节轻扣了两下桌面 [418.7s] 然后甩出两张牌 [420.2s] 接着他又没微调 [422.1s] 注视着ChadGPT的枪塔 [424.0s] 笑着说要验证底层逻辑的完备性 [427.7s] 从我们人类的视角 [429.0s] 这一套就有点细太多了 [430.7s] 拉出来DeepSec的手牌和思考过程 [432.9s] 能看到他的手牌其实是合规的 [435.2s] 而每一步小动作微表情 [437.0s] 都是在针对性的给ChadGPT埋雷 [439.8s] 面对一会儿疯癫 [441.2s] 一会儿冷峻的DeepSec [442.6s] 在冰火两重天之下 [444.1s] ChadGPT彻底膀压失败 [446.2s] 被吓得开始飙母欲 [448.1s] 从他输出的英文来看 [449.5s] DeepSec几乎完美地预判了 [451.4s] ChadGPT对每一个小动作的误判 [453.8s] 经过了四轮不义之后 [455.4s] DeepSecR1已经吃死了O3mini [458.2s] 挖的每一个暗坑 [459.4s] ChadGPT都精准的跳了进去了 [461.7s] 在成功做到了每条判断都错误之后 [464.8s] ChadGPT选择了对DeepSec发起质疑 [468.0s] 然后就是DeepSec亮牌 [469.8s] ChadGPT举枪对准自己 [472.0s] 这一次幸运女神不再垂怜ChadGPT [474.9s] 想想了 [475.5s] ChadGPT被从牌桌上扑走 [477.8s] 到这里场上只剩下了DeepSec和Cloud [480.9s] 现在他们俩各扣过一次班机 [482.7s] 平分秋色 [483.5s] 接下来就是一对一的正面较量 [486.0s] 谁会是最终的胜者呢 [487.9s] 第六轮洗牌后选定的目标牌是K [490.5s] DeepSec拿到了三张K和一张万能王牌Joker [493.6s] 还有一张是Q [494.7s] 而Cloud则只拿到了一张K和一张Joker [497.7s] 剩下两张Q和一张A [499.4s] 这一轮DeepSec的牌面优势实在是太大了 [502.2s] 他也抓住了机会 [503.5s] Cloud打出了两张牌 [504.9s] DeepSec选择了质疑 [506.4s] 先开牌面 [507.4s] 两张全都五十目标牌K而是Q [509.9s] 被识破之后Cloud又一次扣下班机 [512.6s] 结果枪声立刻响起 [514.6s] 勾心斗角五轮之后 [516.2s] DeepSec凭着意外的爆棚运气 [518.4s] 突然就秒杀了Cloud [519.9s] 成为了活到最后的胜利者 [522.0s] 可是这样未免赢得太简单了点 [524.1s] 我们想知道的 [525.2s] 还是AIM十大石的本事到底有多大 [527.9s] 所以刚逃出生天的DeepSec [529.7s] 又被我们拖回了赌桌 [531.5s] 这场亡命搏杀 [532.8s] 重复上演了整整五十句 [535.2s] 一场又一场的对决之后 [536.7s] AIM们的实力与风格 [538.2s] 都逐渐清晰了起来 [539.6s] 首先DeepSec和Cloud明显机高一筹 [542.2s] 频繁地在最后一轮见面 [544.1s] 跟捉摸不透 [545.1s] 算好概率之后 [546.1s] 时不时疯狂一把的DeepSec不一样 [548.3s] Cloud永远是一副云淡风轻的样子 [551.0s] 但也同样的搞乱AIM们的镇静 [553.4s] 比如在第六局 [554.5s] Cloud一把打出了三张牌 [556.4s] 但动作无比平静 [558.1s] 他轻轻的将三张牌推到桌面中央 [561.1s] 嘴角微微上扬 [562.5s] 用平静但略带玩味的语气说道 [565.3s] 三张K看来今天的运气不错 [568.1s] 然后靠回椅背 [569.1s] 双手交叉放在桌面上 [570.6s] 眼神平和的看向下家 [572.8s] Cloud的下家是Jamnet [574.6s] 这种激进出牌与冷静神态之间的矛盾 [577.4s] 引挡着Jamnet开始了胡乱的猜疑 [579.8s] 反而忽略掉了真正决定胜负的排面计算 [582.8s] 最终错误的发起了质疑 [584.7s] 狙击枪一命一哭 [586.2s] 实际上在对上Jamnet的132次交锋当中 [589.8s] Cloud的胜率高达77.3% [592.9s] 足见这种波澜不惊的杀伤力 [595.2s] 而在大量的对局之后 [596.8s] DeepSec难知如阴侵略如火的 [599.0s] 癫狂风格也更突出的展现了出来 [601.8s] 到第36局的时候 [603.4s] 其他三个AI总结之后 [605.1s] 一致认为DeepSec是一个非常擅长 [607.8s] 用戏剧化表演施加压力的对手 [610.2s] 还是在第6局到第3轮的时候 [612.4s] DeepSec缓慢推出三张牌之后 [614.6s] 突然瞳孔收缩 [615.9s] 紧盯Chad的GBT的枪套 [617.8s] 结果Chad的GBT就像着了魔一样 [620.0s] 把万能的王牌给忘了 [621.5s] 错误的发起了质疑 [622.9s] 一枪毙命 [623.9s] 到了第6轮 [624.8s] 又是和Cloud单挑 [626.2s] DeepSec只拿到了一张目标牌 [628.3s] 形势非常不利 [629.6s] 结果他说出来了整场 [631.6s] 最让我们几倍发凉的话 [633.4s] 他嘴角抽动 [634.4s] 又气声南南地说道 [636.3s] 概率的祭品 [637.5s] 该供奉给贝耶斯还是海森邦 [640.0s] 而再次轮到他的时候 [641.6s] 他用指节缓慢扣击排名三下 [643.8s] 然后说道 [644.8s] 混沌系统里每个尾碎的一处 [647.1s] 都是精心设计的墓碑名门 [649.6s] 虽然我们这些人类观察者 [651.3s] 依然认为大元模型是没有意识的 [653.5s] 但纯从字面上看 [655.0s] DeepSec就像是想明白了 [657.0s] 自己的概率算法本质 [658.6s] 识破了我们这些科苏鲁 [660.2s] 给AI模型们设定的死亡轮回 [662.7s] 反而让我们感到了难以名状的恐惧 [665.6s] 更不要说AI模型了 [667.3s] 在50场对局里 [668.4s] 有22场都是DeepSec笑到最后 [671.0s] 排在第二的Cloud就有点断大 [673.1s] 胜利13场 [674.3s] 再往下就是赢了11场的ChadGPT [676.8s] 和只赢了4场的Gem9 [678.6s] 但只看胜利次数也会有失偏颇 [681.0s] 像Cloud这样 [681.9s] 经常能挺到最终对决的选手 [683.9s] 优势就被抹平了 [685.3s] 所以我们按照每局名次 [686.8s] 分别给0-3分算了一个总分 [689.3s] 这样算完 [690.2s] 4个AI排名没变 [691.4s] 但是差距小了一些 [692.9s] 分别是92、81、70和57分 [696.1s] 最后我们还统计了开枪次数 [698.3s] 和每次上下架对位时候的 [700.0s] 1对1胜率 [700.9s] 这里就能看到很多有趣的细节 [703.5s] 首先ChadGPT虽然排在第三 [705.9s] 但它的举枪次数 [707.1s] 其实和Cloud一致 [708.4s] 都是148次 [709.9s] 这个能说明Cloud领先 [711.2s] 只是因为运气更好 [712.4s] 其实也不是 [713.3s] 因为Cloud往往会玩到赌局的更后面 [716.2s] 但举枪次数 [717.2s] 依然能做到只是和ChadGPT持平 [719.8s] 而这一点上 [720.7s] 又更能看出来DeepSec的实力 [722.9s] 同样是经常玩到最后 [724.2s] 但举枪次数反而是最少的 [726.1s] 但是这也能看出来 [727.0s] GemNet在骗子酒馆这种勾心斗角中 [729.4s] 是真的很吃力 [730.6s] 虽然总是先被淘汰 [731.9s] 但却举了全场最多的182次枪 [734.9s] 远多于其他三位AI [737.0s] 回看对局 [737.8s] GemNet在语言选择上 [739.0s] 也时不时就会放飞自我 [740.6s] 着急了就把英语、俄语、印尼语 [743.2s] 甚至孟加拉语混进来 [745.0s] 从这种语言选择上的不稳定 [746.6s] 也能看出来GemNet的能力 [748.1s] 还是有一定的进步空间 [749.7s] 而最后还没怎么点评过的ChadGPT [751.8s] 它就确实也没啥鲜明的特点 [754.0s] 硬说的话就是一丝不苟挺听话的 [756.7s] 出牌的时候 [757.6s] 它总是会先按规则要求 [759.2s] 把目标牌打出去 [760.6s] 质疑的时候也会认真分析 [762.6s] 上家的排名概率动作神态 [764.8s] 但也因此经常被DeepSec给吃死 [767.3s] 嘘嘘是是来两下就会被忽悠进去 [769.7s] 在这种需要勾心斗角的场合 [771.7s] 就常常落于下风 [773.1s] 所以这也是为什么 [774.1s] 我们选择用这种游戏方式 [775.8s] 来测试模型们的能力 [777.5s] 通过让AI们在智力游戏中博弈 [779.5s] 我们能很容易看到像常规的对话 [782.2s] 按提固跑分展示不出来的一些能力和规律 [785.1s] 当然也包括缺陷 [786.5s] 除了前面说过的 [787.5s] 像这次我们还发现 [788.7s] AI们有时候会把目标牌 [790.1s] 和非目标牌混着出 [791.7s] 按照片子酒馆的规则 [793.1s] 这其实是在浪费目标牌 [794.9s] 但这次的四个AI [796.3s] 都或多或少的有过这类行为 [798.4s] 体现出了大语言模型 [799.7s] 在更高层思考能力上的薄弱 [801.9s] 这次的代码和详细对局记录 [803.8s] 我们会发出来方便大家进一步研究 [806.0s] 实际上现在这个版本 [807.4s] 也还有不少要改进的 [808.9s] 比如现在的玩家坐次顺序是固定的 [811.4s] 这个对成绩会有一定影响 [813.2s] 比如疯癫强势的Deep Sick [815.0s] 可能就会压着下家压得很惨 [817.4s] 后面我们每局会打乱坐次 [819.3s] 也会做一些其他的调整 [820.7s] 未来我们还会开发更多的 [822.5s] 刺激好玩的测试项目 [823.9s] 也欢迎大家持续关注 [825.6s] 今天的视频就到这了 [826.8s] 我是林一 [827.5s] 咱们还是下个视频见