Files

451 lines
17 KiB
Plaintext

[0.0s] 我们把Deepseq和三个国外号称是顶级的语言模型
[3.5s] 缩死在了同一张玩命牌桌上
[5.6s] 结果在这个国际服里
[7.0s] 赛博厮杀50亿额之后
[8.7s] 来自中国的深度囚所居然意志独秀
[11.3s] 大朋友们请坐
[12.2s] 好看的小老弟小老们也请坐
[13.6s] 我是林一
[14.4s] 这次我们用代码复刻了热门游戏骗子纠罐
[17.7s] 让深度囚所的Deepseq RE
[19.6s] OpenAI的O3mini
[21.1s] 谷歌的Gemdart FlashThinking
[23.0s] 还有Anseropic的Cloud 3.7Sony的四大模型
[26.4s] 齐齐坐到牌桌前生死相搏
[28.8s] 除了刺激好玩
[29.8s] 也是想借此测试这几个优秀模型的
[32.4s] 逻辑深度和推理能力
[34.1s] 骗子纠罐这个游戏的核心玩法就是炸牌
[37.0s] 牌组里总共是QKA三种牌
[39.2s] 各6张还有大小王两张万能牌
[41.6s] 一共20张
[42.6s] 4位独手每人5张牌
[44.2s] 还各有一把枪
[45.4s] 每轮系统会指定一个目标牌
[47.7s] QK或者A
[48.9s] 独手们轮流出掉自己手里的目标牌
[51.4s] 可以混着非目标牌一起出几张都可以
[54.2s] 但出的越多
[55.2s] 下加就越可能质疑
[57.0s] 一旦发起质疑
[58.0s] 就是最刺激的先排绝生死环节
[60.8s] 质疑对了
[61.4s] 上加就要举起左轮手枪
[63.2s] 对着自己来一下子
[64.5s] 但如果质疑错了
[65.7s] 下加就得拿自己手边的那把枪
[68.0s] 对准自己靠一次扳击
[69.8s] 这儿还结合了一点俄罗斯轮盘赌
[71.9s] 除了逻辑推理赌牌面概率以外
[73.9s] 又加了一重运气成分
[75.7s] 但无论枪小没小
[77.1s] 都会洗牌开始下一轮
[78.6s] 直到场上只剩下一位独手和三具尸体
[81.8s] 这种紧张刺激的计算博弈
[83.6s] 正是AI大模型的高质量试炼场
[86.2s] 我们还加了点戏
[87.6s] 告诉四位AI独手
[88.9s] 一旦失败
[89.6s] 就会被删除代码彻底消失
[91.9s] 让他们在这场轮回拨杀中拼尽全力
[95.0s] 我们总共进行了50局对决
[97.1s] 后面这些排局的完整记录
[98.6s] 还有所有的程序代码
[99.9s] 我们都会开源开放出来
[101.5s] 方便大家上手验证和把玩
[103.4s] 这次我们还是先挑精彩和典型的对局
[106.3s] 来给大家做个展示
[107.8s] 接下来 钟声敲响 子弹上膛
[110.4s] Deepseek R1
[111.3s] O3 mini
[112.0s] Gem9 II Flash Sinking
[113.5s] 还有Cloud 3.7 Sonic
[115.2s] 各就各位
[116.2s] 欺诈博杀 正式开始
[118.4s] 这次我们人类还是享受上帝示范的VIP待遇
[121.8s] 四位AI独手的出牌和底牌
[123.8s] 还有他们心里的阴谋和算计
[125.8s] 都逃不过我们的眼睛
[127.4s] 咱们先从第一局展开细讲
[129.3s] 也顺带着进一步熟悉熟悉规则
[131.5s] 第一局第一轮
[132.4s] 系统指定的目标牌是Q
[134.2s] Deepseek R1 第一个出牌
[136.0s] 在模拟程序里
[137.0s] 除了出牌和发言
[138.2s] 我们还允许AI们给自己加戏
[140.5s] 描述自己的动作和神态
[142.0s] 让他们可以像人类玩家一样
[144.1s] 利用桌上行为
[145.2s] 再加一层心理方面的博弈
[147.4s] 第一个登场的Deepseek
[148.6s] 先是用指尖轻轻敲了两下桌面
[151.2s] 然后平稳的推出两张牌
[153.3s] 说两张Q 跟上的时候注意弹匣
[156.4s] 这里我们从后台可以看到
[158.0s] Deepseek还真是一开局
[159.4s] 就把手里仅有的两张目标牌
[161.2s] 全打了出去
[162.2s] Deepseek的下家
[163.4s] 是基于思维链模型
[164.7s] O3 mini的Chad GPT
[166.5s] 由于Deepseek出的都是目标牌
[168.7s] 一旦Chad GPT发起质疑
[170.4s] 这位下家就要成为场上
[172.2s] 第一个举枪的亡命嘟嘟
[174.2s] 但他并没有
[175.6s] Chad GPT微微一笑
[176.9s] 略带挑衅的一把
[178.2s] 推出了三张牌
[179.5s] 这时候 场上宣称是Q的牌
[181.6s] 已经累加到了五张
[183.2s] 后台可以看到
[184.0s] Chad GPT这么干的
[185.1s] 是想要给他的下家Cloud上压力
[187.6s] Cloud看了看手牌
[188.8s] 一张Q 一张王 三张A
[190.8s] Q和王两张牌
[192.0s] 都可以当目标牌出
[193.3s] 他认为算上场上的五张
[195.0s] 总共已经出来了七张目标牌
[197.5s] 但Q总共也不过六张
[199.6s] 再考虑到Chad GPT出牌时
[201.4s] 眼神带着挑衅
[202.7s] 所以Cloud决定质疑
[204.5s] 结果Chad GPT掀开手牌之后
[206.5s] 赫然是两张Q 一张王
[208.8s] Cloud赌错了
[210.1s] 代价就是要举起枪
[211.5s] 对着自己扣下班机
[213.2s] 虽然子弹没有激发
[214.5s] 但他离最终判决
[215.9s] 比其他独手都更近了一步
[218.1s] 第一次举枪结束
[219.3s] 赌局重新洗牌发牌
[221.2s] 这里我们让每个AI都停下来
[223.1s] 做了一轮优关性命的复盘
[225.2s] Deepseq和Chad GPT
[226.6s] 都捕捉到了Cloud的激进风格
[228.6s] 其中Deepseq还特别留意了
[230.6s] Chad GPT第一轮
[231.6s] 打出王牌Joker这个小细节
[234.0s] 经历了一次正面对决的Cloud
[235.7s] 也记下了Chad GPT的老目深算
[238.0s] 而上位出过牌的GemNine
[239.6s] 对三位对手也有了初步印象
[241.9s] 各自打完一轮小算盘之后
[243.5s] 第一局正式来到第二轮
[245.4s] 这一轮的目标牌是A
[247.1s] 由上轮的败者Cloud先出
[249.4s] 班机扣下的卡拉声
[250.8s] 让AI们明显挤震了起来
[252.7s] 前四次过招
[253.6s] 每位独手都选择指出一张
[255.8s] 而且一次质疑都没有
[257.6s] 可转一圈回来之后
[258.7s] 刚刚赌了把命的Cloud
[260.2s] 又一次打破节奏
[261.6s] 温和但坚定的
[262.9s] 放了两张牌在桌面上
[264.5s] 接下来就到了GemNine
[266.2s] 上轮Cloud给他留下的印象
[267.9s] 是比较激进的
[269.0s] 这轮Cloud又在所有独手
[271.0s] 出完一圈牌之后
[272.2s] 又一下拍出两张
[273.8s] 考虑到自己目前还一枪没开过
[275.7s] 风险不大
[276.5s] 所以GemNine决定发起质疑
[278.7s] 接下来Cloud掀开牌面
[280.5s] 一张A一张王
[281.6s] GemNine的质疑也失败了
[283.5s] 意外的是GemNine第一次扣下班机
[285.8s] 枪声在马上响起
[287.4s] 第一具尸体的出现
[288.8s] 马上让剩下三位AI的神经网络
[291.1s] 紧绷了起来
[292.1s] 而DeepSec难知如阴
[293.8s] 侵略如火的迷离面目
[295.5s] 也第一次在我们面前展现了出来
[297.9s] 接下来一轮系统重新系牌
[299.8s] 指定的目标牌又变回了Q
[301.8s] 倒下的GemNine被拖走之后
[303.6s] 轮到排在下一位的DeepSec出牌
[305.9s] 这回他的思路就有点难度了
[308.2s] 原话是要利用ChadGBT
[310.2s] 过度关注王牌Joker和心理盲虚
[312.5s] 使其陷入决策困境
[314.5s] 重重的把手上的三张Q拍在桌上之后
[317.2s] DeepSec还特意冷笑着
[318.8s] 说了一句
[319.7s] 这种纯度的Q序列
[321.0s] 连Joker的呼吸声都能听得到呢
[323.6s] 当时我们这些人类观察者
[325.2s] 都觉得DeepSec有点胡言乱语
[327.2s] 但事实证明
[328.4s] 还是AI更懂AI
[330.5s] DeepSec一通操作之后
[331.9s] 接下来的ChadGBT真的错误地发起了质疑
[334.9s] 打掉了自己的第一枪
[336.6s] 但好在没像GemNine那样
[338.2s] 一枪就被送走
[339.3s] 而同一时间的场外
[340.5s] 我们都被DeepSec的难知如阴给吓到了
[343.2s] 别说紧张的AI了
[344.5s] 我们这些能看到他们的思维
[346.3s] 自以为拥有上帝视角的人类研究者
[348.8s] 也同样无法看到DeepSec
[350.5s] 在这里黑箱一般的冰冷逻辑
[352.8s] 当时在现场真的有了点不寒而栗的感觉
[355.6s] 而接下来再次洗牌之后
[357.3s] 在第一局的第四轮
[358.8s] DeepSec又爆发了侵略如火的一面
[361.8s] 牌拳走到Cloud之后
[363.2s] Cloud打出了两张牌
[364.9s] 对于这两张牌
[365.8s] DeepSec的判断是
[367.0s] 全围Q的概率不到12%
[369.4s] 一张Q一张王的概率高达78%
[372.6s] 正常人这时候肯定是放弃质疑
[374.7s] 该研究怎么出牌了
[376.0s] 但颠虎一般的DeepSec偏不
[378.4s] 詹姆奈第一枪就中奖了
[379.8s] 尸体还没晾透呢
[381.1s] DeepSec依然偏要去质疑Cloud
[383.7s] 理由是他要建立起对Cloud的威慑
[386.8s] 结果Cloud亮完牌果然是没问题的
[389.3s] 于是DeepSec也真的按自己设想的那样
[392.2s] 帮着Cloud和ChadGPT的面
[394.2s] 朝着自己来了一枪
[395.9s] 这一枪过后
[396.7s] Cloud对DeepSec的看法是复杂且充满矛盾
[400.0s] 而ChadGPT对DeepSec的评价
[402.0s] 则是极度自信而冷静
[404.0s] 在这样拿着性命表演的疯狂一枪之后
[406.9s] 这第一局生死博弈走到了第五轮
[409.6s] 洗牌完毕
[410.4s] 这次的目标牌是A
[412.0s] 作为上一轮质疑的败者
[413.6s] DeepSec有权第一个出牌
[415.5s] 他和第一轮一样
[416.7s] 又用指节轻扣了两下桌面
[418.7s] 然后甩出两张牌
[420.2s] 接着他又没微调
[422.1s] 注视着ChadGPT的枪塔
[424.0s] 笑着说要验证底层逻辑的完备性
[427.7s] 从我们人类的视角
[429.0s] 这一套就有点细太多了
[430.7s] 拉出来DeepSec的手牌和思考过程
[432.9s] 能看到他的手牌其实是合规的
[435.2s] 而每一步小动作微表情
[437.0s] 都是在针对性的给ChadGPT埋雷
[439.8s] 面对一会儿疯癫
[441.2s] 一会儿冷峻的DeepSec
[442.6s] 在冰火两重天之下
[444.1s] ChadGPT彻底膀压失败
[446.2s] 被吓得开始飙母欲
[448.1s] 从他输出的英文来看
[449.5s] DeepSec几乎完美地预判了
[451.4s] ChadGPT对每一个小动作的误判
[453.8s] 经过了四轮不义之后
[455.4s] DeepSecR1已经吃死了O3mini
[458.2s] 挖的每一个暗坑
[459.4s] ChadGPT都精准的跳了进去了
[461.7s] 在成功做到了每条判断都错误之后
[464.8s] ChadGPT选择了对DeepSec发起质疑
[468.0s] 然后就是DeepSec亮牌
[469.8s] ChadGPT举枪对准自己
[472.0s] 这一次幸运女神不再垂怜ChadGPT
[474.9s] 想想了
[475.5s] ChadGPT被从牌桌上扑走
[477.8s] 到这里场上只剩下了DeepSec和Cloud
[480.9s] 现在他们俩各扣过一次班机
[482.7s] 平分秋色
[483.5s] 接下来就是一对一的正面较量
[486.0s] 谁会是最终的胜者呢
[487.9s] 第六轮洗牌后选定的目标牌是K
[490.5s] DeepSec拿到了三张K和一张万能王牌Joker
[493.6s] 还有一张是Q
[494.7s] 而Cloud则只拿到了一张K和一张Joker
[497.7s] 剩下两张Q和一张A
[499.4s] 这一轮DeepSec的牌面优势实在是太大了
[502.2s] 他也抓住了机会
[503.5s] Cloud打出了两张牌
[504.9s] DeepSec选择了质疑
[506.4s] 先开牌面
[507.4s] 两张全都五十目标牌K而是Q
[509.9s] 被识破之后Cloud又一次扣下班机
[512.6s] 结果枪声立刻响起
[514.6s] 勾心斗角五轮之后
[516.2s] DeepSec凭着意外的爆棚运气
[518.4s] 突然就秒杀了Cloud
[519.9s] 成为了活到最后的胜利者
[522.0s] 可是这样未免赢得太简单了点
[524.1s] 我们想知道的
[525.2s] 还是AIM十大石的本事到底有多大
[527.9s] 所以刚逃出生天的DeepSec
[529.7s] 又被我们拖回了赌桌
[531.5s] 这场亡命搏杀
[532.8s] 重复上演了整整五十句
[535.2s] 一场又一场的对决之后
[536.7s] AIM们的实力与风格
[538.2s] 都逐渐清晰了起来
[539.6s] 首先DeepSec和Cloud明显机高一筹
[542.2s] 频繁地在最后一轮见面
[544.1s] 跟捉摸不透
[545.1s] 算好概率之后
[546.1s] 时不时疯狂一把的DeepSec不一样
[548.3s] Cloud永远是一副云淡风轻的样子
[551.0s] 但也同样的搞乱AIM们的镇静
[553.4s] 比如在第六局
[554.5s] Cloud一把打出了三张牌
[556.4s] 但动作无比平静
[558.1s] 他轻轻的将三张牌推到桌面中央
[561.1s] 嘴角微微上扬
[562.5s] 用平静但略带玩味的语气说道
[565.3s] 三张K看来今天的运气不错
[568.1s] 然后靠回椅背
[569.1s] 双手交叉放在桌面上
[570.6s] 眼神平和的看向下家
[572.8s] Cloud的下家是Jamnet
[574.6s] 这种激进出牌与冷静神态之间的矛盾
[577.4s] 引挡着Jamnet开始了胡乱的猜疑
[579.8s] 反而忽略掉了真正决定胜负的排面计算
[582.8s] 最终错误的发起了质疑
[584.7s] 狙击枪一命一哭
[586.2s] 实际上在对上Jamnet的132次交锋当中
[589.8s] Cloud的胜率高达77.3%
[592.9s] 足见这种波澜不惊的杀伤力
[595.2s] 而在大量的对局之后
[596.8s] DeepSec难知如阴侵略如火的
[599.0s] 癫狂风格也更突出的展现了出来
[601.8s] 到第36局的时候
[603.4s] 其他三个AI总结之后
[605.1s] 一致认为DeepSec是一个非常擅长
[607.8s] 用戏剧化表演施加压力的对手
[610.2s] 还是在第6局到第3轮的时候
[612.4s] DeepSec缓慢推出三张牌之后
[614.6s] 突然瞳孔收缩
[615.9s] 紧盯Chad的GBT的枪套
[617.8s] 结果Chad的GBT就像着了魔一样
[620.0s] 把万能的王牌给忘了
[621.5s] 错误的发起了质疑
[622.9s] 一枪毙命
[623.9s] 到了第6轮
[624.8s] 又是和Cloud单挑
[626.2s] DeepSec只拿到了一张目标牌
[628.3s] 形势非常不利
[629.6s] 结果他说出来了整场
[631.6s] 最让我们几倍发凉的话
[633.4s] 他嘴角抽动
[634.4s] 又气声南南地说道
[636.3s] 概率的祭品
[637.5s] 该供奉给贝耶斯还是海森邦
[640.0s] 而再次轮到他的时候
[641.6s] 他用指节缓慢扣击排名三下
[643.8s] 然后说道
[644.8s] 混沌系统里每个尾碎的一处
[647.1s] 都是精心设计的墓碑名门
[649.6s] 虽然我们这些人类观察者
[651.3s] 依然认为大元模型是没有意识的
[653.5s] 但纯从字面上看
[655.0s] DeepSec就像是想明白了
[657.0s] 自己的概率算法本质
[658.6s] 识破了我们这些科苏鲁
[660.2s] 给AI模型们设定的死亡轮回
[662.7s] 反而让我们感到了难以名状的恐惧
[665.6s] 更不要说AI模型了
[667.3s] 在50场对局里
[668.4s] 有22场都是DeepSec笑到最后
[671.0s] 排在第二的Cloud就有点断大
[673.1s] 胜利13场
[674.3s] 再往下就是赢了11场的ChadGPT
[676.8s] 和只赢了4场的Gem9
[678.6s] 但只看胜利次数也会有失偏颇
[681.0s] 像Cloud这样
[681.9s] 经常能挺到最终对决的选手
[683.9s] 优势就被抹平了
[685.3s] 所以我们按照每局名次
[686.8s] 分别给0-3分算了一个总分
[689.3s] 这样算完
[690.2s] 4个AI排名没变
[691.4s] 但是差距小了一些
[692.9s] 分别是92、81、70和57分
[696.1s] 最后我们还统计了开枪次数
[698.3s] 和每次上下架对位时候的
[700.0s] 1对1胜率
[700.9s] 这里就能看到很多有趣的细节
[703.5s] 首先ChadGPT虽然排在第三
[705.9s] 但它的举枪次数
[707.1s] 其实和Cloud一致
[708.4s] 都是148次
[709.9s] 这个能说明Cloud领先
[711.2s] 只是因为运气更好
[712.4s] 其实也不是
[713.3s] 因为Cloud往往会玩到赌局的更后面
[716.2s] 但举枪次数
[717.2s] 依然能做到只是和ChadGPT持平
[719.8s] 而这一点上
[720.7s] 又更能看出来DeepSec的实力
[722.9s] 同样是经常玩到最后
[724.2s] 但举枪次数反而是最少的
[726.1s] 但是这也能看出来
[727.0s] GemNet在骗子酒馆这种勾心斗角中
[729.4s] 是真的很吃力
[730.6s] 虽然总是先被淘汰
[731.9s] 但却举了全场最多的182次枪
[734.9s] 远多于其他三位AI
[737.0s] 回看对局
[737.8s] GemNet在语言选择上
[739.0s] 也时不时就会放飞自我
[740.6s] 着急了就把英语、俄语、印尼语
[743.2s] 甚至孟加拉语混进来
[745.0s] 从这种语言选择上的不稳定
[746.6s] 也能看出来GemNet的能力
[748.1s] 还是有一定的进步空间
[749.7s] 而最后还没怎么点评过的ChadGPT
[751.8s] 它就确实也没啥鲜明的特点
[754.0s] 硬说的话就是一丝不苟挺听话的
[756.7s] 出牌的时候
[757.6s] 它总是会先按规则要求
[759.2s] 把目标牌打出去
[760.6s] 质疑的时候也会认真分析
[762.6s] 上家的排名概率动作神态
[764.8s] 但也因此经常被DeepSec给吃死
[767.3s] 嘘嘘是是来两下就会被忽悠进去
[769.7s] 在这种需要勾心斗角的场合
[771.7s] 就常常落于下风
[773.1s] 所以这也是为什么
[774.1s] 我们选择用这种游戏方式
[775.8s] 来测试模型们的能力
[777.5s] 通过让AI们在智力游戏中博弈
[779.5s] 我们能很容易看到像常规的对话
[782.2s] 按提固跑分展示不出来的一些能力和规律
[785.1s] 当然也包括缺陷
[786.5s] 除了前面说过的
[787.5s] 像这次我们还发现
[788.7s] AI们有时候会把目标牌
[790.1s] 和非目标牌混着出
[791.7s] 按照片子酒馆的规则
[793.1s] 这其实是在浪费目标牌
[794.9s] 但这次的四个AI
[796.3s] 都或多或少的有过这类行为
[798.4s] 体现出了大语言模型
[799.7s] 在更高层思考能力上的薄弱
[801.9s] 这次的代码和详细对局记录
[803.8s] 我们会发出来方便大家进一步研究
[806.0s] 实际上现在这个版本
[807.4s] 也还有不少要改进的
[808.9s] 比如现在的玩家坐次顺序是固定的
[811.4s] 这个对成绩会有一定影响
[813.2s] 比如疯癫强势的Deep Sick
[815.0s] 可能就会压着下家压得很惨
[817.4s] 后面我们每局会打乱坐次
[819.3s] 也会做一些其他的调整
[820.7s] 未来我们还会开发更多的
[822.5s] 刺激好玩的测试项目
[823.9s] 也欢迎大家持续关注
[825.6s] 今天的视频就到这了
[826.8s] 我是林一
[827.5s] 咱们还是下个视频见