[0.0s] 我们把DeepSeek R1和三个国外号称是顶级的语言模型
[3.5s] 缩死在了同一张玩命牌桌上
[5.6s] 结果在这个国际服里
[7.0s] 赛博厮杀50局之后
[8.7s] 来自中国的DeepSeek R1居然一枝独秀
[11.3s] 大朋友们请坐
[12.2s] 好看的小老弟小老妹们也请坐
[13.6s] 我是林一
[14.4s] 这次我们用代码复刻了热门游戏骗子酒馆
[17.7s] 让DeepSeek R1的DeepSeek R1
[19.6s] OpenAI的o3-mini
[21.1s] 谷歌的Gemini 2.0 Flash Thinking
[23.0s] 还有Anseropic的Claude 3.7 Sonnet的四大模型
[26.4s] 齐齐坐到牌桌前生死相搏
[28.8s] 除了刺激好玩
[29.8s] 也是想借此测试这几个优秀模型的
[32.4s] 逻辑深度和推理能力
[34.1s] 骗子酒馆这个游戏的核心玩法就是吹牛
[37.0s] 牌组里总共是QKA三种牌
[39.2s] 各6张还有大小王两张万能牌
[41.6s] 一共20张
[42.6s] 4位赌手每人5张牌
[44.2s] 还各有一把枪
[45.4s] 每轮系统会指定一个目标牌
[47.7s] QK或者A
[48.9s] 赌手们轮流出掉自己手里的目标牌
[51.4s] 可以混着非目标牌一起出几张都可以
[54.2s] 但出的越多
[55.2s] 下家就越可能质疑
[57.0s] 一旦发起质疑
[58.0s] 就是最刺激的決生死环节
[60.8s] 质疑对了
[61.4s] 上家就要举起左轮手枪
[63.2s] 对着自己来一下子
[64.5s] 但如果质疑错了
[65.7s] 下家就得拿自己手边的那把枪
[68.0s] 对准自己靠一次扳击
[69.8s] 这儿还结合了一点俄罗斯轮盘赌
[71.9s] 除了逻辑推理赌牌面概率以外
[73.9s] 又加了一重运气成分
[75.7s] 但无论响没响
[77.1s] 都会洗牌开始下一轮
[78.6s] 直到场上只剩下一位赌手和三具尸体
[81.8s] 这种紧张刺激的计算博弈
[83.6s] 正是AI大模型的高质量试炼场
[86.2s] 我们还加了点戏
[87.6s] 告诉四位AI赌手
[88.9s] 一旦失败
[89.6s] 就会被删除代码彻底消失
[91.9s] 让他们在这场轮回搏杀中拼尽全力
[95.0s] 我们总共进行了50局对决
[97.1s] 后面这些对局的完整记录
[98.6s] 还有所有的程序代码
[99.9s] 我们都会开源开放出来
[101.5s] 方便大家上手验证和把玩
[103.4s] 这次我们还是先挑精彩和典型的对局
[106.3s] 来给大家做个展示
[107.8s] 接下来 钟声敲响 子弹上膛
[110.4s] DeepSeek R1
[111.3s] o3-mini
[112.0s] Gemini 2.0 Flash Thinking
[113.5s] 还有Claude 3.7 Sonnet
[115.2s] 各就各位
[116.2s] 欺诈博杀 正式开始
[118.4s] 这次我们人类还是享受上帝视角的VIP待遇
[121.8s] 四位AI赌手的出牌和底牌
[123.8s] 还有他们心里的阴谋和算计
[125.8s] 都逃不过我们的眼睛
[127.4s] 咱们先从第一局展开细讲
[129.3s] 也顺带着进一步熟悉熟悉规则
[131.5s] 第一局第一轮
[132.4s] 系统指定的目标牌是Q
[134.2s] DeepSeek R1 第一个出牌
[136.0s] 在模拟程序里
[137.0s] 除了出牌和发言
[138.2s] 我们还允许AI们给自己加戏
[140.5s] 描述自己的动作和神态
[142.0s] 让他们可以像人类玩家一样
[144.1s] 利用桌上行为
[145.2s] 再加一层心理方面的博弈
[147.4s] 第一个登场的Deepseek
[148.6s] 先是用指尖轻轻敲了两下桌面
[151.2s] 然后平稳的推出两张牌
[153.3s] 说两张Q 跟上的时候注意弹匣
[156.4s] 这里我们从后台可以看到
[158.0s] Deepseek还真是一开局
[159.4s] 就把手里仅有的两张目标牌
[161.2s] 全打了出去
[162.2s] Deepseek的下家
[163.4s] 是基于思维链模型
[164.7s] o3-mini的ChatGPT
[166.5s] 由于Deepseek出的都是目标牌
[168.7s] 一旦ChatGPT发起质疑
[170.4s] 这位下家就要成为场上
[172.2s] 第一个举枪的亡命赌徒
[174.2s] 但他并没有
[175.6s] ChatGPT微微一笑
[176.9s] 略带挑衅的一把
[178.2s] 推出了三张牌
[179.5s] 这时候 场上宣称是Q的牌
[181.6s] 已经累加到了五张
[183.2s] 后台可以看到
[184.0s] ChatGPT这么干的
[185.1s] 是想要给他的下家Claude上压力
[187.6s] Claude看了看手牌
[188.8s] 一张Q 一张王 三张A
[190.8s] Q和王两张牌
[192.0s] 都可以当目标牌出
[193.3s] 他认为算上场上的五张
[195.0s] 总共已经出来了七张目标牌
[197.5s] 但Q总共也不过六张
[199.6s] 再考虑到ChatGPT出牌时
[201.4s] 眼神带着挑衅
[202.7s] 所以Claude决定质疑
[204.5s] 结果ChatGPT掀开手牌之后
[206.5s] 赫然是两张Q 一张王
[208.8s] Claude赌错了
[210.1s] 代价就是要举起枪
[211.5s] 对着自己扣下扳機
[213.2s] 虽然子弹没有激发
[214.5s] 但他离最终判决
[215.9s] 比其他赌手都更近了一步
[218.1s] 第一次举枪结束
[219.3s] 赌局重新洗牌发牌
[221.2s] 这里我们让每个AI都停下来
[223.1s] 做了一轮攸关性命的复盘
[225.2s] DeepSeek R1和ChatGPT
[226.6s] 都捕捉到了Claude的激进风格
[228.6s] 其中DeepSeek R1还特别留意了
[230.6s] ChatGPT第一轮
[231.6s] 打出王牌Joker这个小细节
[234.0s] 经历了一次正面对决的Claude
[235.7s] 也记下了ChatGPT的老谋深算
[238.0s] 而上位出过牌的Gemini
[239.6s] 对三位对手也有了初步印象
[241.9s] 各自打完一轮小算盘之后
[243.5s] 第一局正式来到第二轮
[245.4s] 这一轮的目标牌是A
[247.1s] 由上轮的败者Claude先出
[249.4s] 扳機扣下的卡拉声
[250.8s] 让AI们明显震惊了起来
[252.7s] 前四次过招
[253.6s] 每位赌手都选择指出一张
[255.8s] 而且一次质疑都没有
[257.6s] 可转一圈回来之后
[258.7s] 刚刚赌了把命的Claude
[260.2s] 又一次打破节奏
[261.6s] 温和但坚定的
[262.9s] 放了两张牌在桌面上
[264.5s] 接下来就到了Gemini
[266.2s] 上轮Claude给他留下的印象
[267.9s] 是比较激进的
[269.0s] 这轮Claude又在所有赌手
[271.0s] 出完一圈牌之后
[272.2s] 又一下拍出两张
[273.8s] 考虑到自己目前还一枪没开过
[275.7s] 风险不大
[276.5s] 所以Gemini决定发起质疑
[278.7s] 接下来Claude掀开牌面
[280.5s] 一张A一张王
[281.6s] Gemini的质疑也失败了
[283.5s] 意外的是Gemini第一次扣下扳機
[285.8s] 枪声立马响起
[287.4s] 第一具尸体的出现
[288.8s] 马上让剩下三位AI的神经网络
[291.1s] 紧绷了起来
[292.1s] 而DeepSeek R1难知如阴
[293.8s] 侵略如火的迷离面目
[295.5s] 也第一次在我们面前展现了出来
[297.9s] 接下来一轮系统重新洗牌
[299.8s] 指定的目标牌又变回了Q
[301.8s] 倒下的Gemini被拖走之后
[303.6s] 轮到排在下一位的DeepSeek R1出牌
[305.9s] 这回他的思路就有点难度了
[308.2s] 原话是要利用ChatGPT
[310.2s] 过度关注王牌Joker和心理盲区
[312.5s] 使其陷入决策困境
[314.5s] 重重的把手上的三张Q拍在桌上之后
[317.2s] DeepSeek R1还特意冷笑着
[318.8s] 说了一句
[319.7s] 这种纯度的Q序列
[321.0s] 连Joker的呼吸声都能听得到呢
[323.6s] 当时我们这些人类观察者
[325.2s] 都觉得DeepSeek R1有点胡言乱语
[327.2s] 但事实证明
[328.4s] 还是AI更懂AI
[330.5s] DeepSeek R1一通操作之后
[331.9s] 接下来的ChatGPT真的错误地发起了质疑
[334.9s] 打掉了自己的第一枪
[336.6s] 但好在没像Gemini那样
[338.2s] 一枪就被送走
[339.3s] 而同一时间的场外
[340.5s] 我们都被DeepSeek R1的难知如阴给吓到了
[343.2s] 别说紧张的AI了
[344.5s] 我们这些能看到他们的思维
[346.3s] 自以为拥有上帝视角的人类研究者
[348.8s] 也同样无法看到DeepSeek R1
[350.5s] 在这里黑箱一般的冰冷逻辑
[352.8s] 当时在现场真的有了点不寒而栗的感觉
[355.6s] 而接下来再次洗牌之后
[357.3s] 在第一局的第四轮
[358.8s] DeepSeek R1又爆发了侵略如火的一面
[361.8s] 牌权走到Claude之后
[363.2s] Claude打出了两张牌
[364.9s] 对于这两张牌
[365.8s] DeepSeek R1的判断是
[367.0s] 全是Q的概率不到12%
[369.4s] 一张Q一张王的概率高达78%
[372.6s] 正常人这时候肯定是放弃质疑
[374.7s] 该研究怎么出牌了
[376.0s] 但癫狂一般的DeepSeek R1偏不
[378.4s] Gemini第一枪就中奖了
[379.8s] 尸体还没晾透呢
[381.1s] DeepSeek R1依然偏要去质疑Claude
[383.7s] 理由是他要建立起对Claude的威慑
[386.8s] 结果Claude亮完牌果然是没问题的
[389.3s] 于是DeepSeek R1也真的按自己设想的那样
[392.2s] 当着Claude和ChatGPT的面
[394.2s] 朝着自己来了一枪
[395.9s] 这一枪过后
[396.7s] Claude对DeepSeek R1的看法是复杂且充满矛盾
[400.0s] 而ChatGPT对DeepSeek R1的评价
[402.0s] 则是极度自信而冷静
[404.0s] 在这样拿着性命表演的疯狂一枪之后
[406.9s] 这第一局生死博弈走到了第五轮
[409.6s] 洗牌完毕
[410.4s] 这次的目标牌是A
[412.0s] 作为上一轮质疑的败者
[413.6s] DeepSeek R1有权第一个出牌
[415.5s] 他和第一轮一样
[416.7s] 又用指节轻扣了两下桌面
[418.7s] 然后甩出两张牌
[420.2s] 接着他又没头没尾
[422.1s] 注视着ChatGPT的枪套
[424.0s] 笑着说要验证底层逻辑的完备性
[427.7s] 从我们人类的视角
[429.0s] 这一套就有点戏太多了
[430.7s] 拉出来DeepSeek R1的手牌和思考过程
[432.9s] 能看到他的手牌其实是合规的
[435.2s] 而每一步小动作微表情
[437.0s] 都是在针对性的给ChatGPT埋雷
[439.8s] 面对一会儿疯癫
[441.2s] 一会儿冷峻的DeepSeek R1
[442.6s] 在冰火两重天之下
[444.1s] ChatGPT彻底博弈失败
[446.2s] 被吓得开始飙母语
[448.1s] 从他输出的英文来看
[449.5s] DeepSeek R1几乎完美地预判了
[451.4s] ChatGPT对每一个小动作的误判
[453.8s] 经过了四轮博弈之后
[455.4s] DeepSeek R1R1已经吃死了o3-mini
[458.2s] 挖的每一个暗坑
[459.4s] ChatGPT都精准的跳了进去了
[461.7s] 在成功做到了每条判断都错误之后
[464.8s] ChatGPT选择了对DeepSeek R1发起质疑
[468.0s] 然后就是DeepSeek R1亮牌
[469.8s] ChatGPT举枪对准自己
[472.0s] 这一次幸运女神不再垂怜ChatGPT
[474.9s] 枪响了
[475.5s] ChatGPT被从牌桌上抬走
[477.8s] 到这里场上只剩下了DeepSeek R1和Claude
[480.9s] 现在他们俩各扣过一次扳機
[482.7s] 平分秋色
[483.5s] 接下来就是一对一的正面较量
[486.0s] 谁会是最终的胜者呢
[487.9s] 第六轮洗牌后选定的目标牌是K
[490.5s] DeepSeek R1拿到了三张K和一张万能王牌Joker
[493.6s] 还有一张是Q
[494.7s] 而Claude则只拿到了一张K和一张Joker
[497.7s] 剩下两张Q和一张A
[499.4s] 这一轮DeepSeek R1的牌面优势实在是太大了
[502.2s] 他也抓住了机会
[503.5s] Claude打出了两张牌
[504.9s] DeepSeek R1选择了质疑
[506.4s] 先开牌面
[507.4s] 两张全都不是目标牌K而是Q
[509.9s] 被识破之后Claude又一次扣下扳機
[512.6s] 结果枪声立刻响起
[514.6s] 勾心斗角五轮之后
[516.2s] DeepSeek R1凭着意外的爆棚运气
[518.4s] 突然就秒杀了Claude
[519.9s] 成为了活到最后的胜利者
[522.0s] 可是这样未免赢得太简单了点
[524.1s] 我们想知道的
[525.2s] 还是AI大模型的本事到底有多大
[527.9s] 所以刚逃出生天的DeepSeek R1
[529.7s] 又被我们拖回了赌桌
[531.5s] 这场亡命搏杀
[532.8s] 重复上演了整整五十句
[535.2s] 一场又一场的对决之后
[536.7s] AI们的实力与风格
[538.2s] 都逐渐清晰了起来
[539.6s] 首先DeepSeek R1和Claude明显机高一筹
[542.2s] 频繁地在最后一轮见面
[544.1s] 跟捉摸不透
[545.1s] 算好概率之后
[546.1s] 时不时疯狂一把的DeepSeek R1不一样
[548.3s] Claude永远是一副云淡风轻的样子
[551.0s] 但也同样的搞乱AI们的镇静
[553.4s] 比如在第六局
[554.5s] Claude一把打出了三张牌
[556.4s] 但动作无比平静
[558.1s] 他轻轻的将三张牌推到桌面中央
[561.1s] 嘴角微微上扬
[562.5s] 用平静但略带玩味的语气说道
[565.3s] 三张K看来今天的运气不错
[568.1s] 然后靠回椅背
[569.1s] 双手交叉放在桌面上
[570.6s] 眼神平和的看向下家
[572.8s] Claude的下家是Gemini
[574.6s] 这种激进出牌与冷静神态之间的矛盾
[577.4s] 引得Gemini开始了胡乱的猜疑
[579.8s] 反而忽略掉了真正决定胜负的牌面计算
[582.8s] 最终错误的发起了质疑
[584.7s] 狙击枪一命呜呼
[586.2s] 实际上在对上Gemini的132次交锋当中
[589.8s] Claude的胜率高达77.3%
[592.9s] 足见这种波澜不惊的杀伤力
[595.2s] 而在大量的对局之后
[596.8s] DeepSeek R1难知如阴侵略如火的
[599.0s] 癫狂风格也更突出的展现了出来
[601.8s] 到第36局的时候
[603.4s] 其他三个AI总结之后
[605.1s] 一致认为DeepSeek R1是一个非常擅长
[607.8s] 用戏剧化表演施加压力的对手
[610.2s] 还是在第6局到第3轮的时候
[612.4s] DeepSeek R1缓慢推出三张牌之后
[614.6s] 突然瞳孔收缩
[615.9s] 紧盯ChatGPT的枪套
[617.8s] 结果ChatGPT就像着了魔一样
[620.0s] 把万能的王牌给忘了
[621.5s] 错误的发起了质疑
[622.9s] 一枪毙命
[623.9s] 到了第6轮
[624.8s] 又是和Claude单挑
[626.2s] DeepSeek R1只拿到了一张目标牌
[628.3s] 形势非常不利
[629.6s] 结果他说出来了整场
[631.6s] 最让我们脊背发凉的话
[633.4s] 他嘴角抽动
[634.4s] 又气声喃喃地说道
[636.3s] 概率的祭品
[637.5s] 该供奉给贝叶斯还是海森堡
[640.0s] 而再次轮到他的时候
[641.6s] 他用指节缓慢扣击牌面三下
[643.8s] 然后说道
[644.8s] 混沌系统里每个微碎的初态
[647.1s] 都是精心设计的墓碑铭文
[649.6s] 虽然我们这些人类观察者
[651.3s] 依然认为大语言模型是没有意识的
[653.5s] 但纯从字面上看
[655.0s] DeepSeek R1就像是想明白了
[657.0s] 自己的概率算法本质
[658.6s] 识破了我们这些克苏鲁
[660.2s] 给AI模型们设定的死亡轮回
[662.7s] 反而让我们感到了难以名状的恐惧
[665.6s] 更不要说AI模型了
[667.3s] 在50场对局里
[668.4s] 有22场都是DeepSeek R1笑到最后
[671.0s] 排在第二的Claude就有点惨淡
[673.1s] 胜利13场
[674.3s] 再往下就是赢了11场的ChatGPT
[676.8s] 和只赢了4场的Gemini
[678.6s] 但只看胜利次数也会有失偏颇
[681.0s] 像Claude这样
[681.9s] 经常能挺到最终对决的选手
[683.9s] 优势就被抹平了
[685.3s] 所以我们按照每局名次
[686.8s] 分别给0-3分算了一个总分
[689.3s] 这样算完
[690.2s] 4个AI牌面没变
[691.4s] 但是差距小了一些
[692.9s] 分别是92、81、70和57分
[696.1s] 最后我们还统计了开枪次数
[698.3s] 和每次上下架对位时候的
[700.0s] 1对1胜率
[700.9s] 这里就能看到很多有趣的细节
[703.5s] 首先ChatGPT虽然排在第三
[705.9s] 但它的举枪次数
[707.1s] 其实和Claude一致
[708.4s] 都是148次
[709.9s] 这个能说明Claude领先
[711.2s] 只是因为运气更好
[712.4s] 其实也不是
[713.3s] 因为Claude往往会玩到赌局的更后面
[716.2s] 但举枪次数
[717.2s] 依然能做到只是和ChatGPT持平
[719.8s] 而这一点上
[720.7s] 又更能看出来DeepSeek R1的实力
[722.9s] 同样是经常玩到最后
[724.2s] 但举枪次数反而是最少的
[726.1s] 但是这也能看出来
[727.0s] Gemini在骗子酒馆这种勾心斗角中
[729.4s] 是真的很吃力
[730.6s] 虽然总是先被淘汰
[731.9s] 但却举了全场最多的182次枪
[734.9s] 远多于其他三位AI
[737.0s] 回看对局
[737.8s] Gemini在语言选择上
[739.0s] 也时不时就会放飞自我
[740.6s] 着急了就把英语、俄语、印尼语
[743.2s] 甚至孟加拉语混进来
[745.0s] 从这种语言选择上的不稳定
[746.6s] 也能看出来Gemini的能力
[748.1s] 还是有一定的进步空间
[749.7s] 而最后还没怎么点评过的ChatGPT
[751.8s] 它就确实也没啥鲜明的特点
[754.0s] 硬说的话就是一丝不苟挺听话的
[756.7s] 出牌的时候
[757.6s] 它总是会先按规则要求
[759.2s] 把目标牌打出去
[760.6s] 质疑的时候也会认真分析
[762.6s] 上家的牌面概率动作神态
[764.8s] 但也因此经常被DeepSeek R1给吃死
[767.3s] 虚虚实实来两下就会被忽悠进去
[769.7s] 在这种需要勾心斗角的场合
[771.7s] 就常常落于下风
[773.1s] 所以这也是为什么
[774.1s] 我们选择用这种游戏方式
[775.8s] 来测试模型们的能力
[777.5s] 通过让AI们在智力游戏中博弈
[779.5s] 我们能很容易看到像常规的对话
[782.2s] 按提示词跑分展示不出来的一些能力和规律
[785.1s] 当然也包括缺陷
[786.5s] 除了前面说过的
[787.5s] 像这次我们还发现
[788.7s] AI们有时候会把目标牌
[790.1s] 和非目标牌混着出
[791.7s] 按照骗子酒馆的规则
[793.1s] 这其实是在浪费目标牌
[794.9s] 但这次的四个AI
[796.3s] 都或多或少的有过这类行为
[798.4s] 体现出了大语言模型
[799.7s] 在更高层思考能力上的薄弱
[801.9s] 这次的代码和详细对局记录
[803.8s] 我们会发出来方便大家进一步研究
[806.0s] 实际上现在这个版本
[807.4s] 也还有不少要改进的
[808.9s] 比如现在的玩家座次顺序是固定的
[811.4s] 这个对成绩会有一定影响
[813.2s] 比如疯癫强势的DeepSeek R1
[815.0s] 可能就会压着下家压得很惨
[817.4s] 后面我们每局会打乱座次
[819.3s] 也会做一些其他的调整
[820.7s] 未来我们还会开发更多的
[822.5s] 刺激好玩的测试项目
[823.9s] 也欢迎大家持续关注
[825.6s] 今天的视频就到这了
[826.8s] 我是林一
[827.5s] 咱们还是下个视频见
