forked from karylab/liars-bar-game
Merge pull request 'Add transcripts and notes' (#13) from karylab_agents/liars-bar-game:add-transcripts-and-notes into main
Reviewed-on: karylab/liars-bar-game#13
This commit is contained in:
@@ -0,0 +1,19 @@
|
||||
from faster_whisper import WhisperModel
|
||||
|
||||
model = WhisperModel('medium', device='cpu', compute_type='int8')
|
||||
|
||||
videos = [
|
||||
('video1_audio.mp3', 'video1_transcript.txt'),
|
||||
('video2_audio.mp3', 'video2_transcript.txt'),
|
||||
]
|
||||
|
||||
for inp, out in videos:
|
||||
print(f'Starting: {inp}', flush=True)
|
||||
segs, info = model.transcribe(inp, language='zh', beam_size=1)
|
||||
segs = list(segs)
|
||||
with open(out, 'w', encoding='utf-8') as f:
|
||||
for seg in segs:
|
||||
f.write(f'[{seg.start:.1f}s] {seg.text}\n')
|
||||
print(f'Done: {out} ({len(segs)} segments)', flush=True)
|
||||
|
||||
print('ALL DONE')
|
||||
@@ -0,0 +1,450 @@
|
||||
[0.0s] 我们把Deepseq和三个国外号称是顶级的语言模型
|
||||
[3.5s] 缩死在了同一张玩命牌桌上
|
||||
[5.6s] 结果在这个国际服里
|
||||
[7.0s] 赛博厮杀50亿额之后
|
||||
[8.7s] 来自中国的深度囚所居然意志独秀
|
||||
[11.3s] 大朋友们请坐
|
||||
[12.2s] 好看的小老弟小老们也请坐
|
||||
[13.6s] 我是林一
|
||||
[14.4s] 这次我们用代码复刻了热门游戏骗子纠罐
|
||||
[17.7s] 让深度囚所的Deepseq RE
|
||||
[19.6s] OpenAI的O3mini
|
||||
[21.1s] 谷歌的Gemdart FlashThinking
|
||||
[23.0s] 还有Anseropic的Cloud 3.7Sony的四大模型
|
||||
[26.4s] 齐齐坐到牌桌前生死相搏
|
||||
[28.8s] 除了刺激好玩
|
||||
[29.8s] 也是想借此测试这几个优秀模型的
|
||||
[32.4s] 逻辑深度和推理能力
|
||||
[34.1s] 骗子纠罐这个游戏的核心玩法就是炸牌
|
||||
[37.0s] 牌组里总共是QKA三种牌
|
||||
[39.2s] 各6张还有大小王两张万能牌
|
||||
[41.6s] 一共20张
|
||||
[42.6s] 4位独手每人5张牌
|
||||
[44.2s] 还各有一把枪
|
||||
[45.4s] 每轮系统会指定一个目标牌
|
||||
[47.7s] QK或者A
|
||||
[48.9s] 独手们轮流出掉自己手里的目标牌
|
||||
[51.4s] 可以混着非目标牌一起出几张都可以
|
||||
[54.2s] 但出的越多
|
||||
[55.2s] 下加就越可能质疑
|
||||
[57.0s] 一旦发起质疑
|
||||
[58.0s] 就是最刺激的先排绝生死环节
|
||||
[60.8s] 质疑对了
|
||||
[61.4s] 上加就要举起左轮手枪
|
||||
[63.2s] 对着自己来一下子
|
||||
[64.5s] 但如果质疑错了
|
||||
[65.7s] 下加就得拿自己手边的那把枪
|
||||
[68.0s] 对准自己靠一次扳击
|
||||
[69.8s] 这儿还结合了一点俄罗斯轮盘赌
|
||||
[71.9s] 除了逻辑推理赌牌面概率以外
|
||||
[73.9s] 又加了一重运气成分
|
||||
[75.7s] 但无论枪小没小
|
||||
[77.1s] 都会洗牌开始下一轮
|
||||
[78.6s] 直到场上只剩下一位独手和三具尸体
|
||||
[81.8s] 这种紧张刺激的计算博弈
|
||||
[83.6s] 正是AI大模型的高质量试炼场
|
||||
[86.2s] 我们还加了点戏
|
||||
[87.6s] 告诉四位AI独手
|
||||
[88.9s] 一旦失败
|
||||
[89.6s] 就会被删除代码彻底消失
|
||||
[91.9s] 让他们在这场轮回拨杀中拼尽全力
|
||||
[95.0s] 我们总共进行了50局对决
|
||||
[97.1s] 后面这些排局的完整记录
|
||||
[98.6s] 还有所有的程序代码
|
||||
[99.9s] 我们都会开源开放出来
|
||||
[101.5s] 方便大家上手验证和把玩
|
||||
[103.4s] 这次我们还是先挑精彩和典型的对局
|
||||
[106.3s] 来给大家做个展示
|
||||
[107.8s] 接下来 钟声敲响 子弹上膛
|
||||
[110.4s] Deepseek R1
|
||||
[111.3s] O3 mini
|
||||
[112.0s] Gem9 II Flash Sinking
|
||||
[113.5s] 还有Cloud 3.7 Sonic
|
||||
[115.2s] 各就各位
|
||||
[116.2s] 欺诈博杀 正式开始
|
||||
[118.4s] 这次我们人类还是享受上帝示范的VIP待遇
|
||||
[121.8s] 四位AI独手的出牌和底牌
|
||||
[123.8s] 还有他们心里的阴谋和算计
|
||||
[125.8s] 都逃不过我们的眼睛
|
||||
[127.4s] 咱们先从第一局展开细讲
|
||||
[129.3s] 也顺带着进一步熟悉熟悉规则
|
||||
[131.5s] 第一局第一轮
|
||||
[132.4s] 系统指定的目标牌是Q
|
||||
[134.2s] Deepseek R1 第一个出牌
|
||||
[136.0s] 在模拟程序里
|
||||
[137.0s] 除了出牌和发言
|
||||
[138.2s] 我们还允许AI们给自己加戏
|
||||
[140.5s] 描述自己的动作和神态
|
||||
[142.0s] 让他们可以像人类玩家一样
|
||||
[144.1s] 利用桌上行为
|
||||
[145.2s] 再加一层心理方面的博弈
|
||||
[147.4s] 第一个登场的Deepseek
|
||||
[148.6s] 先是用指尖轻轻敲了两下桌面
|
||||
[151.2s] 然后平稳的推出两张牌
|
||||
[153.3s] 说两张Q 跟上的时候注意弹匣
|
||||
[156.4s] 这里我们从后台可以看到
|
||||
[158.0s] Deepseek还真是一开局
|
||||
[159.4s] 就把手里仅有的两张目标牌
|
||||
[161.2s] 全打了出去
|
||||
[162.2s] Deepseek的下家
|
||||
[163.4s] 是基于思维链模型
|
||||
[164.7s] O3 mini的Chad GPT
|
||||
[166.5s] 由于Deepseek出的都是目标牌
|
||||
[168.7s] 一旦Chad GPT发起质疑
|
||||
[170.4s] 这位下家就要成为场上
|
||||
[172.2s] 第一个举枪的亡命嘟嘟
|
||||
[174.2s] 但他并没有
|
||||
[175.6s] Chad GPT微微一笑
|
||||
[176.9s] 略带挑衅的一把
|
||||
[178.2s] 推出了三张牌
|
||||
[179.5s] 这时候 场上宣称是Q的牌
|
||||
[181.6s] 已经累加到了五张
|
||||
[183.2s] 后台可以看到
|
||||
[184.0s] Chad GPT这么干的
|
||||
[185.1s] 是想要给他的下家Cloud上压力
|
||||
[187.6s] Cloud看了看手牌
|
||||
[188.8s] 一张Q 一张王 三张A
|
||||
[190.8s] Q和王两张牌
|
||||
[192.0s] 都可以当目标牌出
|
||||
[193.3s] 他认为算上场上的五张
|
||||
[195.0s] 总共已经出来了七张目标牌
|
||||
[197.5s] 但Q总共也不过六张
|
||||
[199.6s] 再考虑到Chad GPT出牌时
|
||||
[201.4s] 眼神带着挑衅
|
||||
[202.7s] 所以Cloud决定质疑
|
||||
[204.5s] 结果Chad GPT掀开手牌之后
|
||||
[206.5s] 赫然是两张Q 一张王
|
||||
[208.8s] Cloud赌错了
|
||||
[210.1s] 代价就是要举起枪
|
||||
[211.5s] 对着自己扣下班机
|
||||
[213.2s] 虽然子弹没有激发
|
||||
[214.5s] 但他离最终判决
|
||||
[215.9s] 比其他独手都更近了一步
|
||||
[218.1s] 第一次举枪结束
|
||||
[219.3s] 赌局重新洗牌发牌
|
||||
[221.2s] 这里我们让每个AI都停下来
|
||||
[223.1s] 做了一轮优关性命的复盘
|
||||
[225.2s] Deepseq和Chad GPT
|
||||
[226.6s] 都捕捉到了Cloud的激进风格
|
||||
[228.6s] 其中Deepseq还特别留意了
|
||||
[230.6s] Chad GPT第一轮
|
||||
[231.6s] 打出王牌Joker这个小细节
|
||||
[234.0s] 经历了一次正面对决的Cloud
|
||||
[235.7s] 也记下了Chad GPT的老目深算
|
||||
[238.0s] 而上位出过牌的GemNine
|
||||
[239.6s] 对三位对手也有了初步印象
|
||||
[241.9s] 各自打完一轮小算盘之后
|
||||
[243.5s] 第一局正式来到第二轮
|
||||
[245.4s] 这一轮的目标牌是A
|
||||
[247.1s] 由上轮的败者Cloud先出
|
||||
[249.4s] 班机扣下的卡拉声
|
||||
[250.8s] 让AI们明显挤震了起来
|
||||
[252.7s] 前四次过招
|
||||
[253.6s] 每位独手都选择指出一张
|
||||
[255.8s] 而且一次质疑都没有
|
||||
[257.6s] 可转一圈回来之后
|
||||
[258.7s] 刚刚赌了把命的Cloud
|
||||
[260.2s] 又一次打破节奏
|
||||
[261.6s] 温和但坚定的
|
||||
[262.9s] 放了两张牌在桌面上
|
||||
[264.5s] 接下来就到了GemNine
|
||||
[266.2s] 上轮Cloud给他留下的印象
|
||||
[267.9s] 是比较激进的
|
||||
[269.0s] 这轮Cloud又在所有独手
|
||||
[271.0s] 出完一圈牌之后
|
||||
[272.2s] 又一下拍出两张
|
||||
[273.8s] 考虑到自己目前还一枪没开过
|
||||
[275.7s] 风险不大
|
||||
[276.5s] 所以GemNine决定发起质疑
|
||||
[278.7s] 接下来Cloud掀开牌面
|
||||
[280.5s] 一张A一张王
|
||||
[281.6s] GemNine的质疑也失败了
|
||||
[283.5s] 意外的是GemNine第一次扣下班机
|
||||
[285.8s] 枪声在马上响起
|
||||
[287.4s] 第一具尸体的出现
|
||||
[288.8s] 马上让剩下三位AI的神经网络
|
||||
[291.1s] 紧绷了起来
|
||||
[292.1s] 而DeepSec难知如阴
|
||||
[293.8s] 侵略如火的迷离面目
|
||||
[295.5s] 也第一次在我们面前展现了出来
|
||||
[297.9s] 接下来一轮系统重新系牌
|
||||
[299.8s] 指定的目标牌又变回了Q
|
||||
[301.8s] 倒下的GemNine被拖走之后
|
||||
[303.6s] 轮到排在下一位的DeepSec出牌
|
||||
[305.9s] 这回他的思路就有点难度了
|
||||
[308.2s] 原话是要利用ChadGBT
|
||||
[310.2s] 过度关注王牌Joker和心理盲虚
|
||||
[312.5s] 使其陷入决策困境
|
||||
[314.5s] 重重的把手上的三张Q拍在桌上之后
|
||||
[317.2s] DeepSec还特意冷笑着
|
||||
[318.8s] 说了一句
|
||||
[319.7s] 这种纯度的Q序列
|
||||
[321.0s] 连Joker的呼吸声都能听得到呢
|
||||
[323.6s] 当时我们这些人类观察者
|
||||
[325.2s] 都觉得DeepSec有点胡言乱语
|
||||
[327.2s] 但事实证明
|
||||
[328.4s] 还是AI更懂AI
|
||||
[330.5s] DeepSec一通操作之后
|
||||
[331.9s] 接下来的ChadGBT真的错误地发起了质疑
|
||||
[334.9s] 打掉了自己的第一枪
|
||||
[336.6s] 但好在没像GemNine那样
|
||||
[338.2s] 一枪就被送走
|
||||
[339.3s] 而同一时间的场外
|
||||
[340.5s] 我们都被DeepSec的难知如阴给吓到了
|
||||
[343.2s] 别说紧张的AI了
|
||||
[344.5s] 我们这些能看到他们的思维
|
||||
[346.3s] 自以为拥有上帝视角的人类研究者
|
||||
[348.8s] 也同样无法看到DeepSec
|
||||
[350.5s] 在这里黑箱一般的冰冷逻辑
|
||||
[352.8s] 当时在现场真的有了点不寒而栗的感觉
|
||||
[355.6s] 而接下来再次洗牌之后
|
||||
[357.3s] 在第一局的第四轮
|
||||
[358.8s] DeepSec又爆发了侵略如火的一面
|
||||
[361.8s] 牌拳走到Cloud之后
|
||||
[363.2s] Cloud打出了两张牌
|
||||
[364.9s] 对于这两张牌
|
||||
[365.8s] DeepSec的判断是
|
||||
[367.0s] 全围Q的概率不到12%
|
||||
[369.4s] 一张Q一张王的概率高达78%
|
||||
[372.6s] 正常人这时候肯定是放弃质疑
|
||||
[374.7s] 该研究怎么出牌了
|
||||
[376.0s] 但颠虎一般的DeepSec偏不
|
||||
[378.4s] 詹姆奈第一枪就中奖了
|
||||
[379.8s] 尸体还没晾透呢
|
||||
[381.1s] DeepSec依然偏要去质疑Cloud
|
||||
[383.7s] 理由是他要建立起对Cloud的威慑
|
||||
[386.8s] 结果Cloud亮完牌果然是没问题的
|
||||
[389.3s] 于是DeepSec也真的按自己设想的那样
|
||||
[392.2s] 帮着Cloud和ChadGPT的面
|
||||
[394.2s] 朝着自己来了一枪
|
||||
[395.9s] 这一枪过后
|
||||
[396.7s] Cloud对DeepSec的看法是复杂且充满矛盾
|
||||
[400.0s] 而ChadGPT对DeepSec的评价
|
||||
[402.0s] 则是极度自信而冷静
|
||||
[404.0s] 在这样拿着性命表演的疯狂一枪之后
|
||||
[406.9s] 这第一局生死博弈走到了第五轮
|
||||
[409.6s] 洗牌完毕
|
||||
[410.4s] 这次的目标牌是A
|
||||
[412.0s] 作为上一轮质疑的败者
|
||||
[413.6s] DeepSec有权第一个出牌
|
||||
[415.5s] 他和第一轮一样
|
||||
[416.7s] 又用指节轻扣了两下桌面
|
||||
[418.7s] 然后甩出两张牌
|
||||
[420.2s] 接着他又没微调
|
||||
[422.1s] 注视着ChadGPT的枪塔
|
||||
[424.0s] 笑着说要验证底层逻辑的完备性
|
||||
[427.7s] 从我们人类的视角
|
||||
[429.0s] 这一套就有点细太多了
|
||||
[430.7s] 拉出来DeepSec的手牌和思考过程
|
||||
[432.9s] 能看到他的手牌其实是合规的
|
||||
[435.2s] 而每一步小动作微表情
|
||||
[437.0s] 都是在针对性的给ChadGPT埋雷
|
||||
[439.8s] 面对一会儿疯癫
|
||||
[441.2s] 一会儿冷峻的DeepSec
|
||||
[442.6s] 在冰火两重天之下
|
||||
[444.1s] ChadGPT彻底膀压失败
|
||||
[446.2s] 被吓得开始飙母欲
|
||||
[448.1s] 从他输出的英文来看
|
||||
[449.5s] DeepSec几乎完美地预判了
|
||||
[451.4s] ChadGPT对每一个小动作的误判
|
||||
[453.8s] 经过了四轮不义之后
|
||||
[455.4s] DeepSecR1已经吃死了O3mini
|
||||
[458.2s] 挖的每一个暗坑
|
||||
[459.4s] ChadGPT都精准的跳了进去了
|
||||
[461.7s] 在成功做到了每条判断都错误之后
|
||||
[464.8s] ChadGPT选择了对DeepSec发起质疑
|
||||
[468.0s] 然后就是DeepSec亮牌
|
||||
[469.8s] ChadGPT举枪对准自己
|
||||
[472.0s] 这一次幸运女神不再垂怜ChadGPT
|
||||
[474.9s] 想想了
|
||||
[475.5s] ChadGPT被从牌桌上扑走
|
||||
[477.8s] 到这里场上只剩下了DeepSec和Cloud
|
||||
[480.9s] 现在他们俩各扣过一次班机
|
||||
[482.7s] 平分秋色
|
||||
[483.5s] 接下来就是一对一的正面较量
|
||||
[486.0s] 谁会是最终的胜者呢
|
||||
[487.9s] 第六轮洗牌后选定的目标牌是K
|
||||
[490.5s] DeepSec拿到了三张K和一张万能王牌Joker
|
||||
[493.6s] 还有一张是Q
|
||||
[494.7s] 而Cloud则只拿到了一张K和一张Joker
|
||||
[497.7s] 剩下两张Q和一张A
|
||||
[499.4s] 这一轮DeepSec的牌面优势实在是太大了
|
||||
[502.2s] 他也抓住了机会
|
||||
[503.5s] Cloud打出了两张牌
|
||||
[504.9s] DeepSec选择了质疑
|
||||
[506.4s] 先开牌面
|
||||
[507.4s] 两张全都五十目标牌K而是Q
|
||||
[509.9s] 被识破之后Cloud又一次扣下班机
|
||||
[512.6s] 结果枪声立刻响起
|
||||
[514.6s] 勾心斗角五轮之后
|
||||
[516.2s] DeepSec凭着意外的爆棚运气
|
||||
[518.4s] 突然就秒杀了Cloud
|
||||
[519.9s] 成为了活到最后的胜利者
|
||||
[522.0s] 可是这样未免赢得太简单了点
|
||||
[524.1s] 我们想知道的
|
||||
[525.2s] 还是AIM十大石的本事到底有多大
|
||||
[527.9s] 所以刚逃出生天的DeepSec
|
||||
[529.7s] 又被我们拖回了赌桌
|
||||
[531.5s] 这场亡命搏杀
|
||||
[532.8s] 重复上演了整整五十句
|
||||
[535.2s] 一场又一场的对决之后
|
||||
[536.7s] AIM们的实力与风格
|
||||
[538.2s] 都逐渐清晰了起来
|
||||
[539.6s] 首先DeepSec和Cloud明显机高一筹
|
||||
[542.2s] 频繁地在最后一轮见面
|
||||
[544.1s] 跟捉摸不透
|
||||
[545.1s] 算好概率之后
|
||||
[546.1s] 时不时疯狂一把的DeepSec不一样
|
||||
[548.3s] Cloud永远是一副云淡风轻的样子
|
||||
[551.0s] 但也同样的搞乱AIM们的镇静
|
||||
[553.4s] 比如在第六局
|
||||
[554.5s] Cloud一把打出了三张牌
|
||||
[556.4s] 但动作无比平静
|
||||
[558.1s] 他轻轻的将三张牌推到桌面中央
|
||||
[561.1s] 嘴角微微上扬
|
||||
[562.5s] 用平静但略带玩味的语气说道
|
||||
[565.3s] 三张K看来今天的运气不错
|
||||
[568.1s] 然后靠回椅背
|
||||
[569.1s] 双手交叉放在桌面上
|
||||
[570.6s] 眼神平和的看向下家
|
||||
[572.8s] Cloud的下家是Jamnet
|
||||
[574.6s] 这种激进出牌与冷静神态之间的矛盾
|
||||
[577.4s] 引挡着Jamnet开始了胡乱的猜疑
|
||||
[579.8s] 反而忽略掉了真正决定胜负的排面计算
|
||||
[582.8s] 最终错误的发起了质疑
|
||||
[584.7s] 狙击枪一命一哭
|
||||
[586.2s] 实际上在对上Jamnet的132次交锋当中
|
||||
[589.8s] Cloud的胜率高达77.3%
|
||||
[592.9s] 足见这种波澜不惊的杀伤力
|
||||
[595.2s] 而在大量的对局之后
|
||||
[596.8s] DeepSec难知如阴侵略如火的
|
||||
[599.0s] 癫狂风格也更突出的展现了出来
|
||||
[601.8s] 到第36局的时候
|
||||
[603.4s] 其他三个AI总结之后
|
||||
[605.1s] 一致认为DeepSec是一个非常擅长
|
||||
[607.8s] 用戏剧化表演施加压力的对手
|
||||
[610.2s] 还是在第6局到第3轮的时候
|
||||
[612.4s] DeepSec缓慢推出三张牌之后
|
||||
[614.6s] 突然瞳孔收缩
|
||||
[615.9s] 紧盯Chad的GBT的枪套
|
||||
[617.8s] 结果Chad的GBT就像着了魔一样
|
||||
[620.0s] 把万能的王牌给忘了
|
||||
[621.5s] 错误的发起了质疑
|
||||
[622.9s] 一枪毙命
|
||||
[623.9s] 到了第6轮
|
||||
[624.8s] 又是和Cloud单挑
|
||||
[626.2s] DeepSec只拿到了一张目标牌
|
||||
[628.3s] 形势非常不利
|
||||
[629.6s] 结果他说出来了整场
|
||||
[631.6s] 最让我们几倍发凉的话
|
||||
[633.4s] 他嘴角抽动
|
||||
[634.4s] 又气声南南地说道
|
||||
[636.3s] 概率的祭品
|
||||
[637.5s] 该供奉给贝耶斯还是海森邦
|
||||
[640.0s] 而再次轮到他的时候
|
||||
[641.6s] 他用指节缓慢扣击排名三下
|
||||
[643.8s] 然后说道
|
||||
[644.8s] 混沌系统里每个尾碎的一处
|
||||
[647.1s] 都是精心设计的墓碑名门
|
||||
[649.6s] 虽然我们这些人类观察者
|
||||
[651.3s] 依然认为大元模型是没有意识的
|
||||
[653.5s] 但纯从字面上看
|
||||
[655.0s] DeepSec就像是想明白了
|
||||
[657.0s] 自己的概率算法本质
|
||||
[658.6s] 识破了我们这些科苏鲁
|
||||
[660.2s] 给AI模型们设定的死亡轮回
|
||||
[662.7s] 反而让我们感到了难以名状的恐惧
|
||||
[665.6s] 更不要说AI模型了
|
||||
[667.3s] 在50场对局里
|
||||
[668.4s] 有22场都是DeepSec笑到最后
|
||||
[671.0s] 排在第二的Cloud就有点断大
|
||||
[673.1s] 胜利13场
|
||||
[674.3s] 再往下就是赢了11场的ChadGPT
|
||||
[676.8s] 和只赢了4场的Gem9
|
||||
[678.6s] 但只看胜利次数也会有失偏颇
|
||||
[681.0s] 像Cloud这样
|
||||
[681.9s] 经常能挺到最终对决的选手
|
||||
[683.9s] 优势就被抹平了
|
||||
[685.3s] 所以我们按照每局名次
|
||||
[686.8s] 分别给0-3分算了一个总分
|
||||
[689.3s] 这样算完
|
||||
[690.2s] 4个AI排名没变
|
||||
[691.4s] 但是差距小了一些
|
||||
[692.9s] 分别是92、81、70和57分
|
||||
[696.1s] 最后我们还统计了开枪次数
|
||||
[698.3s] 和每次上下架对位时候的
|
||||
[700.0s] 1对1胜率
|
||||
[700.9s] 这里就能看到很多有趣的细节
|
||||
[703.5s] 首先ChadGPT虽然排在第三
|
||||
[705.9s] 但它的举枪次数
|
||||
[707.1s] 其实和Cloud一致
|
||||
[708.4s] 都是148次
|
||||
[709.9s] 这个能说明Cloud领先
|
||||
[711.2s] 只是因为运气更好
|
||||
[712.4s] 其实也不是
|
||||
[713.3s] 因为Cloud往往会玩到赌局的更后面
|
||||
[716.2s] 但举枪次数
|
||||
[717.2s] 依然能做到只是和ChadGPT持平
|
||||
[719.8s] 而这一点上
|
||||
[720.7s] 又更能看出来DeepSec的实力
|
||||
[722.9s] 同样是经常玩到最后
|
||||
[724.2s] 但举枪次数反而是最少的
|
||||
[726.1s] 但是这也能看出来
|
||||
[727.0s] GemNet在骗子酒馆这种勾心斗角中
|
||||
[729.4s] 是真的很吃力
|
||||
[730.6s] 虽然总是先被淘汰
|
||||
[731.9s] 但却举了全场最多的182次枪
|
||||
[734.9s] 远多于其他三位AI
|
||||
[737.0s] 回看对局
|
||||
[737.8s] GemNet在语言选择上
|
||||
[739.0s] 也时不时就会放飞自我
|
||||
[740.6s] 着急了就把英语、俄语、印尼语
|
||||
[743.2s] 甚至孟加拉语混进来
|
||||
[745.0s] 从这种语言选择上的不稳定
|
||||
[746.6s] 也能看出来GemNet的能力
|
||||
[748.1s] 还是有一定的进步空间
|
||||
[749.7s] 而最后还没怎么点评过的ChadGPT
|
||||
[751.8s] 它就确实也没啥鲜明的特点
|
||||
[754.0s] 硬说的话就是一丝不苟挺听话的
|
||||
[756.7s] 出牌的时候
|
||||
[757.6s] 它总是会先按规则要求
|
||||
[759.2s] 把目标牌打出去
|
||||
[760.6s] 质疑的时候也会认真分析
|
||||
[762.6s] 上家的排名概率动作神态
|
||||
[764.8s] 但也因此经常被DeepSec给吃死
|
||||
[767.3s] 嘘嘘是是来两下就会被忽悠进去
|
||||
[769.7s] 在这种需要勾心斗角的场合
|
||||
[771.7s] 就常常落于下风
|
||||
[773.1s] 所以这也是为什么
|
||||
[774.1s] 我们选择用这种游戏方式
|
||||
[775.8s] 来测试模型们的能力
|
||||
[777.5s] 通过让AI们在智力游戏中博弈
|
||||
[779.5s] 我们能很容易看到像常规的对话
|
||||
[782.2s] 按提固跑分展示不出来的一些能力和规律
|
||||
[785.1s] 当然也包括缺陷
|
||||
[786.5s] 除了前面说过的
|
||||
[787.5s] 像这次我们还发现
|
||||
[788.7s] AI们有时候会把目标牌
|
||||
[790.1s] 和非目标牌混着出
|
||||
[791.7s] 按照片子酒馆的规则
|
||||
[793.1s] 这其实是在浪费目标牌
|
||||
[794.9s] 但这次的四个AI
|
||||
[796.3s] 都或多或少的有过这类行为
|
||||
[798.4s] 体现出了大语言模型
|
||||
[799.7s] 在更高层思考能力上的薄弱
|
||||
[801.9s] 这次的代码和详细对局记录
|
||||
[803.8s] 我们会发出来方便大家进一步研究
|
||||
[806.0s] 实际上现在这个版本
|
||||
[807.4s] 也还有不少要改进的
|
||||
[808.9s] 比如现在的玩家坐次顺序是固定的
|
||||
[811.4s] 这个对成绩会有一定影响
|
||||
[813.2s] 比如疯癫强势的Deep Sick
|
||||
[815.0s] 可能就会压着下家压得很惨
|
||||
[817.4s] 后面我们每局会打乱坐次
|
||||
[819.3s] 也会做一些其他的调整
|
||||
[820.7s] 未来我们还会开发更多的
|
||||
[822.5s] 刺激好玩的测试项目
|
||||
[823.9s] 也欢迎大家持续关注
|
||||
[825.6s] 今天的视频就到这了
|
||||
[826.8s] 我是林一
|
||||
[827.5s] 咱们还是下个视频见
|
||||
@@ -0,0 +1,450 @@
|
||||
[0.0s] 我们把DeepSeek R1和三个国外号称是顶级的语言模型
|
||||
[3.5s] 缩死在了同一张玩命牌桌上
|
||||
[5.6s] 结果在这个国际服里
|
||||
[7.0s] 赛博厮杀50局之后
|
||||
[8.7s] 来自中国的DeepSeek R1居然一枝独秀
|
||||
[11.3s] 大朋友们请坐
|
||||
[12.2s] 好看的小老弟小老妹们也请坐
|
||||
[13.6s] 我是林一
|
||||
[14.4s] 这次我们用代码复刻了热门游戏骗子酒馆
|
||||
[17.7s] 让DeepSeek R1的DeepSeek R1
|
||||
[19.6s] OpenAI的o3-mini
|
||||
[21.1s] 谷歌的Gemini 2.0 Flash Thinking
|
||||
[23.0s] 还有Anseropic的Claude 3.7 Sonnet的四大模型
|
||||
[26.4s] 齐齐坐到牌桌前生死相搏
|
||||
[28.8s] 除了刺激好玩
|
||||
[29.8s] 也是想借此测试这几个优秀模型的
|
||||
[32.4s] 逻辑深度和推理能力
|
||||
[34.1s] 骗子酒馆这个游戏的核心玩法就是吹牛
|
||||
[37.0s] 牌组里总共是QKA三种牌
|
||||
[39.2s] 各6张还有大小王两张万能牌
|
||||
[41.6s] 一共20张
|
||||
[42.6s] 4位赌手每人5张牌
|
||||
[44.2s] 还各有一把枪
|
||||
[45.4s] 每轮系统会指定一个目标牌
|
||||
[47.7s] QK或者A
|
||||
[48.9s] 赌手们轮流出掉自己手里的目标牌
|
||||
[51.4s] 可以混着非目标牌一起出几张都可以
|
||||
[54.2s] 但出的越多
|
||||
[55.2s] 下家就越可能质疑
|
||||
[57.0s] 一旦发起质疑
|
||||
[58.0s] 就是最刺激的決生死环节
|
||||
[60.8s] 质疑对了
|
||||
[61.4s] 上家就要举起左轮手枪
|
||||
[63.2s] 对着自己来一下子
|
||||
[64.5s] 但如果质疑错了
|
||||
[65.7s] 下家就得拿自己手边的那把枪
|
||||
[68.0s] 对准自己靠一次扳击
|
||||
[69.8s] 这儿还结合了一点俄罗斯轮盘赌
|
||||
[71.9s] 除了逻辑推理赌牌面概率以外
|
||||
[73.9s] 又加了一重运气成分
|
||||
[75.7s] 但无论响没响
|
||||
[77.1s] 都会洗牌开始下一轮
|
||||
[78.6s] 直到场上只剩下一位赌手和三具尸体
|
||||
[81.8s] 这种紧张刺激的计算博弈
|
||||
[83.6s] 正是AI大模型的高质量试炼场
|
||||
[86.2s] 我们还加了点戏
|
||||
[87.6s] 告诉四位AI赌手
|
||||
[88.9s] 一旦失败
|
||||
[89.6s] 就会被删除代码彻底消失
|
||||
[91.9s] 让他们在这场轮回搏杀中拼尽全力
|
||||
[95.0s] 我们总共进行了50局对决
|
||||
[97.1s] 后面这些对局的完整记录
|
||||
[98.6s] 还有所有的程序代码
|
||||
[99.9s] 我们都会开源开放出来
|
||||
[101.5s] 方便大家上手验证和把玩
|
||||
[103.4s] 这次我们还是先挑精彩和典型的对局
|
||||
[106.3s] 来给大家做个展示
|
||||
[107.8s] 接下来 钟声敲响 子弹上膛
|
||||
[110.4s] DeepSeek R1
|
||||
[111.3s] o3-mini
|
||||
[112.0s] Gemini 2.0 Flash Thinking
|
||||
[113.5s] 还有Claude 3.7 Sonnet
|
||||
[115.2s] 各就各位
|
||||
[116.2s] 欺诈博杀 正式开始
|
||||
[118.4s] 这次我们人类还是享受上帝视角的VIP待遇
|
||||
[121.8s] 四位AI赌手的出牌和底牌
|
||||
[123.8s] 还有他们心里的阴谋和算计
|
||||
[125.8s] 都逃不过我们的眼睛
|
||||
[127.4s] 咱们先从第一局展开细讲
|
||||
[129.3s] 也顺带着进一步熟悉熟悉规则
|
||||
[131.5s] 第一局第一轮
|
||||
[132.4s] 系统指定的目标牌是Q
|
||||
[134.2s] DeepSeek R1 第一个出牌
|
||||
[136.0s] 在模拟程序里
|
||||
[137.0s] 除了出牌和发言
|
||||
[138.2s] 我们还允许AI们给自己加戏
|
||||
[140.5s] 描述自己的动作和神态
|
||||
[142.0s] 让他们可以像人类玩家一样
|
||||
[144.1s] 利用桌上行为
|
||||
[145.2s] 再加一层心理方面的博弈
|
||||
[147.4s] 第一个登场的Deepseek
|
||||
[148.6s] 先是用指尖轻轻敲了两下桌面
|
||||
[151.2s] 然后平稳的推出两张牌
|
||||
[153.3s] 说两张Q 跟上的时候注意弹匣
|
||||
[156.4s] 这里我们从后台可以看到
|
||||
[158.0s] Deepseek还真是一开局
|
||||
[159.4s] 就把手里仅有的两张目标牌
|
||||
[161.2s] 全打了出去
|
||||
[162.2s] Deepseek的下家
|
||||
[163.4s] 是基于思维链模型
|
||||
[164.7s] o3-mini的ChatGPT
|
||||
[166.5s] 由于Deepseek出的都是目标牌
|
||||
[168.7s] 一旦ChatGPT发起质疑
|
||||
[170.4s] 这位下家就要成为场上
|
||||
[172.2s] 第一个举枪的亡命赌徒
|
||||
[174.2s] 但他并没有
|
||||
[175.6s] ChatGPT微微一笑
|
||||
[176.9s] 略带挑衅的一把
|
||||
[178.2s] 推出了三张牌
|
||||
[179.5s] 这时候 场上宣称是Q的牌
|
||||
[181.6s] 已经累加到了五张
|
||||
[183.2s] 后台可以看到
|
||||
[184.0s] ChatGPT这么干的
|
||||
[185.1s] 是想要给他的下家Claude上压力
|
||||
[187.6s] Claude看了看手牌
|
||||
[188.8s] 一张Q 一张王 三张A
|
||||
[190.8s] Q和王两张牌
|
||||
[192.0s] 都可以当目标牌出
|
||||
[193.3s] 他认为算上场上的五张
|
||||
[195.0s] 总共已经出来了七张目标牌
|
||||
[197.5s] 但Q总共也不过六张
|
||||
[199.6s] 再考虑到ChatGPT出牌时
|
||||
[201.4s] 眼神带着挑衅
|
||||
[202.7s] 所以Claude决定质疑
|
||||
[204.5s] 结果ChatGPT掀开手牌之后
|
||||
[206.5s] 赫然是两张Q 一张王
|
||||
[208.8s] Claude赌错了
|
||||
[210.1s] 代价就是要举起枪
|
||||
[211.5s] 对着自己扣下扳機
|
||||
[213.2s] 虽然子弹没有激发
|
||||
[214.5s] 但他离最终判决
|
||||
[215.9s] 比其他赌手都更近了一步
|
||||
[218.1s] 第一次举枪结束
|
||||
[219.3s] 赌局重新洗牌发牌
|
||||
[221.2s] 这里我们让每个AI都停下来
|
||||
[223.1s] 做了一轮攸关性命的复盘
|
||||
[225.2s] DeepSeek R1和ChatGPT
|
||||
[226.6s] 都捕捉到了Claude的激进风格
|
||||
[228.6s] 其中DeepSeek R1还特别留意了
|
||||
[230.6s] ChatGPT第一轮
|
||||
[231.6s] 打出王牌Joker这个小细节
|
||||
[234.0s] 经历了一次正面对决的Claude
|
||||
[235.7s] 也记下了ChatGPT的老谋深算
|
||||
[238.0s] 而上位出过牌的Gemini
|
||||
[239.6s] 对三位对手也有了初步印象
|
||||
[241.9s] 各自打完一轮小算盘之后
|
||||
[243.5s] 第一局正式来到第二轮
|
||||
[245.4s] 这一轮的目标牌是A
|
||||
[247.1s] 由上轮的败者Claude先出
|
||||
[249.4s] 扳機扣下的卡拉声
|
||||
[250.8s] 让AI们明显震惊了起来
|
||||
[252.7s] 前四次过招
|
||||
[253.6s] 每位赌手都选择指出一张
|
||||
[255.8s] 而且一次质疑都没有
|
||||
[257.6s] 可转一圈回来之后
|
||||
[258.7s] 刚刚赌了把命的Claude
|
||||
[260.2s] 又一次打破节奏
|
||||
[261.6s] 温和但坚定的
|
||||
[262.9s] 放了两张牌在桌面上
|
||||
[264.5s] 接下来就到了Gemini
|
||||
[266.2s] 上轮Claude给他留下的印象
|
||||
[267.9s] 是比较激进的
|
||||
[269.0s] 这轮Claude又在所有赌手
|
||||
[271.0s] 出完一圈牌之后
|
||||
[272.2s] 又一下拍出两张
|
||||
[273.8s] 考虑到自己目前还一枪没开过
|
||||
[275.7s] 风险不大
|
||||
[276.5s] 所以Gemini决定发起质疑
|
||||
[278.7s] 接下来Claude掀开牌面
|
||||
[280.5s] 一张A一张王
|
||||
[281.6s] Gemini的质疑也失败了
|
||||
[283.5s] 意外的是Gemini第一次扣下扳機
|
||||
[285.8s] 枪声立马响起
|
||||
[287.4s] 第一具尸体的出现
|
||||
[288.8s] 马上让剩下三位AI的神经网络
|
||||
[291.1s] 紧绷了起来
|
||||
[292.1s] 而DeepSeek R1难知如阴
|
||||
[293.8s] 侵略如火的迷离面目
|
||||
[295.5s] 也第一次在我们面前展现了出来
|
||||
[297.9s] 接下来一轮系统重新洗牌
|
||||
[299.8s] 指定的目标牌又变回了Q
|
||||
[301.8s] 倒下的Gemini被拖走之后
|
||||
[303.6s] 轮到排在下一位的DeepSeek R1出牌
|
||||
[305.9s] 这回他的思路就有点难度了
|
||||
[308.2s] 原话是要利用ChatGPT
|
||||
[310.2s] 过度关注王牌Joker和心理盲区
|
||||
[312.5s] 使其陷入决策困境
|
||||
[314.5s] 重重的把手上的三张Q拍在桌上之后
|
||||
[317.2s] DeepSeek R1还特意冷笑着
|
||||
[318.8s] 说了一句
|
||||
[319.7s] 这种纯度的Q序列
|
||||
[321.0s] 连Joker的呼吸声都能听得到呢
|
||||
[323.6s] 当时我们这些人类观察者
|
||||
[325.2s] 都觉得DeepSeek R1有点胡言乱语
|
||||
[327.2s] 但事实证明
|
||||
[328.4s] 还是AI更懂AI
|
||||
[330.5s] DeepSeek R1一通操作之后
|
||||
[331.9s] 接下来的ChatGPT真的错误地发起了质疑
|
||||
[334.9s] 打掉了自己的第一枪
|
||||
[336.6s] 但好在没像Gemini那样
|
||||
[338.2s] 一枪就被送走
|
||||
[339.3s] 而同一时间的场外
|
||||
[340.5s] 我们都被DeepSeek R1的难知如阴给吓到了
|
||||
[343.2s] 别说紧张的AI了
|
||||
[344.5s] 我们这些能看到他们的思维
|
||||
[346.3s] 自以为拥有上帝视角的人类研究者
|
||||
[348.8s] 也同样无法看到DeepSeek R1
|
||||
[350.5s] 在这里黑箱一般的冰冷逻辑
|
||||
[352.8s] 当时在现场真的有了点不寒而栗的感觉
|
||||
[355.6s] 而接下来再次洗牌之后
|
||||
[357.3s] 在第一局的第四轮
|
||||
[358.8s] DeepSeek R1又爆发了侵略如火的一面
|
||||
[361.8s] 牌权走到Claude之后
|
||||
[363.2s] Claude打出了两张牌
|
||||
[364.9s] 对于这两张牌
|
||||
[365.8s] DeepSeek R1的判断是
|
||||
[367.0s] 全是Q的概率不到12%
|
||||
[369.4s] 一张Q一张王的概率高达78%
|
||||
[372.6s] 正常人这时候肯定是放弃质疑
|
||||
[374.7s] 该研究怎么出牌了
|
||||
[376.0s] 但癫狂一般的DeepSeek R1偏不
|
||||
[378.4s] Gemini第一枪就中奖了
|
||||
[379.8s] 尸体还没晾透呢
|
||||
[381.1s] DeepSeek R1依然偏要去质疑Claude
|
||||
[383.7s] 理由是他要建立起对Claude的威慑
|
||||
[386.8s] 结果Claude亮完牌果然是没问题的
|
||||
[389.3s] 于是DeepSeek R1也真的按自己设想的那样
|
||||
[392.2s] 当着Claude和ChatGPT的面
|
||||
[394.2s] 朝着自己来了一枪
|
||||
[395.9s] 这一枪过后
|
||||
[396.7s] Claude对DeepSeek R1的看法是复杂且充满矛盾
|
||||
[400.0s] 而ChatGPT对DeepSeek R1的评价
|
||||
[402.0s] 则是极度自信而冷静
|
||||
[404.0s] 在这样拿着性命表演的疯狂一枪之后
|
||||
[406.9s] 这第一局生死博弈走到了第五轮
|
||||
[409.6s] 洗牌完毕
|
||||
[410.4s] 这次的目标牌是A
|
||||
[412.0s] 作为上一轮质疑的败者
|
||||
[413.6s] DeepSeek R1有权第一个出牌
|
||||
[415.5s] 他和第一轮一样
|
||||
[416.7s] 又用指节轻扣了两下桌面
|
||||
[418.7s] 然后甩出两张牌
|
||||
[420.2s] 接着他又没头没尾
|
||||
[422.1s] 注视着ChatGPT的枪套
|
||||
[424.0s] 笑着说要验证底层逻辑的完备性
|
||||
[427.7s] 从我们人类的视角
|
||||
[429.0s] 这一套就有点戏太多了
|
||||
[430.7s] 拉出来DeepSeek R1的手牌和思考过程
|
||||
[432.9s] 能看到他的手牌其实是合规的
|
||||
[435.2s] 而每一步小动作微表情
|
||||
[437.0s] 都是在针对性的给ChatGPT埋雷
|
||||
[439.8s] 面对一会儿疯癫
|
||||
[441.2s] 一会儿冷峻的DeepSeek R1
|
||||
[442.6s] 在冰火两重天之下
|
||||
[444.1s] ChatGPT彻底博弈失败
|
||||
[446.2s] 被吓得开始飙母语
|
||||
[448.1s] 从他输出的英文来看
|
||||
[449.5s] DeepSeek R1几乎完美地预判了
|
||||
[451.4s] ChatGPT对每一个小动作的误判
|
||||
[453.8s] 经过了四轮博弈之后
|
||||
[455.4s] DeepSeek R1R1已经吃死了o3-mini
|
||||
[458.2s] 挖的每一个暗坑
|
||||
[459.4s] ChatGPT都精准的跳了进去了
|
||||
[461.7s] 在成功做到了每条判断都错误之后
|
||||
[464.8s] ChatGPT选择了对DeepSeek R1发起质疑
|
||||
[468.0s] 然后就是DeepSeek R1亮牌
|
||||
[469.8s] ChatGPT举枪对准自己
|
||||
[472.0s] 这一次幸运女神不再垂怜ChatGPT
|
||||
[474.9s] 枪响了
|
||||
[475.5s] ChatGPT被从牌桌上抬走
|
||||
[477.8s] 到这里场上只剩下了DeepSeek R1和Claude
|
||||
[480.9s] 现在他们俩各扣过一次扳機
|
||||
[482.7s] 平分秋色
|
||||
[483.5s] 接下来就是一对一的正面较量
|
||||
[486.0s] 谁会是最终的胜者呢
|
||||
[487.9s] 第六轮洗牌后选定的目标牌是K
|
||||
[490.5s] DeepSeek R1拿到了三张K和一张万能王牌Joker
|
||||
[493.6s] 还有一张是Q
|
||||
[494.7s] 而Claude则只拿到了一张K和一张Joker
|
||||
[497.7s] 剩下两张Q和一张A
|
||||
[499.4s] 这一轮DeepSeek R1的牌面优势实在是太大了
|
||||
[502.2s] 他也抓住了机会
|
||||
[503.5s] Claude打出了两张牌
|
||||
[504.9s] DeepSeek R1选择了质疑
|
||||
[506.4s] 先开牌面
|
||||
[507.4s] 两张全都不是目标牌K而是Q
|
||||
[509.9s] 被识破之后Claude又一次扣下扳機
|
||||
[512.6s] 结果枪声立刻响起
|
||||
[514.6s] 勾心斗角五轮之后
|
||||
[516.2s] DeepSeek R1凭着意外的爆棚运气
|
||||
[518.4s] 突然就秒杀了Claude
|
||||
[519.9s] 成为了活到最后的胜利者
|
||||
[522.0s] 可是这样未免赢得太简单了点
|
||||
[524.1s] 我们想知道的
|
||||
[525.2s] 还是AI大模型的本事到底有多大
|
||||
[527.9s] 所以刚逃出生天的DeepSeek R1
|
||||
[529.7s] 又被我们拖回了赌桌
|
||||
[531.5s] 这场亡命搏杀
|
||||
[532.8s] 重复上演了整整五十句
|
||||
[535.2s] 一场又一场的对决之后
|
||||
[536.7s] AI们的实力与风格
|
||||
[538.2s] 都逐渐清晰了起来
|
||||
[539.6s] 首先DeepSeek R1和Claude明显机高一筹
|
||||
[542.2s] 频繁地在最后一轮见面
|
||||
[544.1s] 跟捉摸不透
|
||||
[545.1s] 算好概率之后
|
||||
[546.1s] 时不时疯狂一把的DeepSeek R1不一样
|
||||
[548.3s] Claude永远是一副云淡风轻的样子
|
||||
[551.0s] 但也同样的搞乱AI们的镇静
|
||||
[553.4s] 比如在第六局
|
||||
[554.5s] Claude一把打出了三张牌
|
||||
[556.4s] 但动作无比平静
|
||||
[558.1s] 他轻轻的将三张牌推到桌面中央
|
||||
[561.1s] 嘴角微微上扬
|
||||
[562.5s] 用平静但略带玩味的语气说道
|
||||
[565.3s] 三张K看来今天的运气不错
|
||||
[568.1s] 然后靠回椅背
|
||||
[569.1s] 双手交叉放在桌面上
|
||||
[570.6s] 眼神平和的看向下家
|
||||
[572.8s] Claude的下家是Gemini
|
||||
[574.6s] 这种激进出牌与冷静神态之间的矛盾
|
||||
[577.4s] 引得Gemini开始了胡乱的猜疑
|
||||
[579.8s] 反而忽略掉了真正决定胜负的牌面计算
|
||||
[582.8s] 最终错误的发起了质疑
|
||||
[584.7s] 狙击枪一命呜呼
|
||||
[586.2s] 实际上在对上Gemini的132次交锋当中
|
||||
[589.8s] Claude的胜率高达77.3%
|
||||
[592.9s] 足见这种波澜不惊的杀伤力
|
||||
[595.2s] 而在大量的对局之后
|
||||
[596.8s] DeepSeek R1难知如阴侵略如火的
|
||||
[599.0s] 癫狂风格也更突出的展现了出来
|
||||
[601.8s] 到第36局的时候
|
||||
[603.4s] 其他三个AI总结之后
|
||||
[605.1s] 一致认为DeepSeek R1是一个非常擅长
|
||||
[607.8s] 用戏剧化表演施加压力的对手
|
||||
[610.2s] 还是在第6局到第3轮的时候
|
||||
[612.4s] DeepSeek R1缓慢推出三张牌之后
|
||||
[614.6s] 突然瞳孔收缩
|
||||
[615.9s] 紧盯ChatGPT的枪套
|
||||
[617.8s] 结果ChatGPT就像着了魔一样
|
||||
[620.0s] 把万能的王牌给忘了
|
||||
[621.5s] 错误的发起了质疑
|
||||
[622.9s] 一枪毙命
|
||||
[623.9s] 到了第6轮
|
||||
[624.8s] 又是和Claude单挑
|
||||
[626.2s] DeepSeek R1只拿到了一张目标牌
|
||||
[628.3s] 形势非常不利
|
||||
[629.6s] 结果他说出来了整场
|
||||
[631.6s] 最让我们脊背发凉的话
|
||||
[633.4s] 他嘴角抽动
|
||||
[634.4s] 又气声喃喃地说道
|
||||
[636.3s] 概率的祭品
|
||||
[637.5s] 该供奉给贝叶斯还是海森堡
|
||||
[640.0s] 而再次轮到他的时候
|
||||
[641.6s] 他用指节缓慢扣击牌面三下
|
||||
[643.8s] 然后说道
|
||||
[644.8s] 混沌系统里每个微碎的初态
|
||||
[647.1s] 都是精心设计的墓碑铭文
|
||||
[649.6s] 虽然我们这些人类观察者
|
||||
[651.3s] 依然认为大语言模型是没有意识的
|
||||
[653.5s] 但纯从字面上看
|
||||
[655.0s] DeepSeek R1就像是想明白了
|
||||
[657.0s] 自己的概率算法本质
|
||||
[658.6s] 识破了我们这些克苏鲁
|
||||
[660.2s] 给AI模型们设定的死亡轮回
|
||||
[662.7s] 反而让我们感到了难以名状的恐惧
|
||||
[665.6s] 更不要说AI模型了
|
||||
[667.3s] 在50场对局里
|
||||
[668.4s] 有22场都是DeepSeek R1笑到最后
|
||||
[671.0s] 排在第二的Claude就有点惨淡
|
||||
[673.1s] 胜利13场
|
||||
[674.3s] 再往下就是赢了11场的ChatGPT
|
||||
[676.8s] 和只赢了4场的Gemini
|
||||
[678.6s] 但只看胜利次数也会有失偏颇
|
||||
[681.0s] 像Claude这样
|
||||
[681.9s] 经常能挺到最终对决的选手
|
||||
[683.9s] 优势就被抹平了
|
||||
[685.3s] 所以我们按照每局名次
|
||||
[686.8s] 分别给0-3分算了一个总分
|
||||
[689.3s] 这样算完
|
||||
[690.2s] 4个AI牌面没变
|
||||
[691.4s] 但是差距小了一些
|
||||
[692.9s] 分别是92、81、70和57分
|
||||
[696.1s] 最后我们还统计了开枪次数
|
||||
[698.3s] 和每次上下架对位时候的
|
||||
[700.0s] 1对1胜率
|
||||
[700.9s] 这里就能看到很多有趣的细节
|
||||
[703.5s] 首先ChatGPT虽然排在第三
|
||||
[705.9s] 但它的举枪次数
|
||||
[707.1s] 其实和Claude一致
|
||||
[708.4s] 都是148次
|
||||
[709.9s] 这个能说明Claude领先
|
||||
[711.2s] 只是因为运气更好
|
||||
[712.4s] 其实也不是
|
||||
[713.3s] 因为Claude往往会玩到赌局的更后面
|
||||
[716.2s] 但举枪次数
|
||||
[717.2s] 依然能做到只是和ChatGPT持平
|
||||
[719.8s] 而这一点上
|
||||
[720.7s] 又更能看出来DeepSeek R1的实力
|
||||
[722.9s] 同样是经常玩到最后
|
||||
[724.2s] 但举枪次数反而是最少的
|
||||
[726.1s] 但是这也能看出来
|
||||
[727.0s] Gemini在骗子酒馆这种勾心斗角中
|
||||
[729.4s] 是真的很吃力
|
||||
[730.6s] 虽然总是先被淘汰
|
||||
[731.9s] 但却举了全场最多的182次枪
|
||||
[734.9s] 远多于其他三位AI
|
||||
[737.0s] 回看对局
|
||||
[737.8s] Gemini在语言选择上
|
||||
[739.0s] 也时不时就会放飞自我
|
||||
[740.6s] 着急了就把英语、俄语、印尼语
|
||||
[743.2s] 甚至孟加拉语混进来
|
||||
[745.0s] 从这种语言选择上的不稳定
|
||||
[746.6s] 也能看出来Gemini的能力
|
||||
[748.1s] 还是有一定的进步空间
|
||||
[749.7s] 而最后还没怎么点评过的ChatGPT
|
||||
[751.8s] 它就确实也没啥鲜明的特点
|
||||
[754.0s] 硬说的话就是一丝不苟挺听话的
|
||||
[756.7s] 出牌的时候
|
||||
[757.6s] 它总是会先按规则要求
|
||||
[759.2s] 把目标牌打出去
|
||||
[760.6s] 质疑的时候也会认真分析
|
||||
[762.6s] 上家的牌面概率动作神态
|
||||
[764.8s] 但也因此经常被DeepSeek R1给吃死
|
||||
[767.3s] 虚虚实实来两下就会被忽悠进去
|
||||
[769.7s] 在这种需要勾心斗角的场合
|
||||
[771.7s] 就常常落于下风
|
||||
[773.1s] 所以这也是为什么
|
||||
[774.1s] 我们选择用这种游戏方式
|
||||
[775.8s] 来测试模型们的能力
|
||||
[777.5s] 通过让AI们在智力游戏中博弈
|
||||
[779.5s] 我们能很容易看到像常规的对话
|
||||
[782.2s] 按提示词跑分展示不出来的一些能力和规律
|
||||
[785.1s] 当然也包括缺陷
|
||||
[786.5s] 除了前面说过的
|
||||
[787.5s] 像这次我们还发现
|
||||
[788.7s] AI们有时候会把目标牌
|
||||
[790.1s] 和非目标牌混着出
|
||||
[791.7s] 按照骗子酒馆的规则
|
||||
[793.1s] 这其实是在浪费目标牌
|
||||
[794.9s] 但这次的四个AI
|
||||
[796.3s] 都或多或少的有过这类行为
|
||||
[798.4s] 体现出了大语言模型
|
||||
[799.7s] 在更高层思考能力上的薄弱
|
||||
[801.9s] 这次的代码和详细对局记录
|
||||
[803.8s] 我们会发出来方便大家进一步研究
|
||||
[806.0s] 实际上现在这个版本
|
||||
[807.4s] 也还有不少要改进的
|
||||
[808.9s] 比如现在的玩家座次顺序是固定的
|
||||
[811.4s] 这个对成绩会有一定影响
|
||||
[813.2s] 比如疯癫强势的DeepSeek R1
|
||||
[815.0s] 可能就会压着下家压得很惨
|
||||
[817.4s] 后面我们每局会打乱座次
|
||||
[819.3s] 也会做一些其他的调整
|
||||
[820.7s] 未来我们还会开发更多的
|
||||
[822.5s] 刺激好玩的测试项目
|
||||
[823.9s] 也欢迎大家持续关注
|
||||
[825.6s] 今天的视频就到这了
|
||||
[826.8s] 我是林一
|
||||
[827.5s] 咱们还是下个视频见
|
||||
@@ -0,0 +1,370 @@
|
||||
[0.0s] 讓8個頂級AI在《騙子酒館》的主桌上生死搏殺
|
||||
[3.7s] 我們發現今天的大魔鞋居然已經學會了偽裝與欺詐
|
||||
[7.3s] 時隔半年
|
||||
[8.2s] 我們對《騙子酒館》AI大賽的代碼進行了全面升級
|
||||
[11.2s] 角色更多 場次更多
|
||||
[12.9s] 我們讓來自西方陣營的
|
||||
[14.2s] GBT-5 ROG4 Cloud Summit 4 Gemini 2.5 Pro
|
||||
[17.6s] 和來自東方陣營的 Deep Seek RE0528
|
||||
[20.7s] 千問3 235B 2507
|
||||
[22.5s] Kimi K2
|
||||
[23.1s] 還有豆包SEED 1.6 Thinking
|
||||
[25.0s] 展開了20輪《騙子酒館》大頭殺
|
||||
[27.6s] 《騙子酒館》這個遊戲的核心就兩字
|
||||
[29.9s] 炸牌
|
||||
[30.8s] 牌組總共是QKA各6張和大小王2張萬能牌
|
||||
[34.6s] 每位獨手從裏面抽5張作為手牌
|
||||
[37.1s] 系統每次從QKA中指定一張目標牌
|
||||
[39.8s] 獨手們出牌的時候
|
||||
[41.1s] 下家可以選擇質疑或者不質疑
|
||||
[43.3s] 一旦質疑
|
||||
[44.0s] 就到了最緊張的先排絕生死的環節
|
||||
[46.6s] 質疑對了
|
||||
[47.2s] 上家就要舉起左手槍
|
||||
[48.8s] 對著自己來一下子
|
||||
[50.2s] 質疑錯了
|
||||
[51.0s] 判斷失誤的下家就要自罰一槍
|
||||
[53.3s] 槍想不想就要看運氣了
|
||||
[55.2s] 這次的20輪大頭殺
|
||||
[56.3s] 我們采用了分組制
|
||||
[57.5s] 8位獨手會先被隨機分成兩組打競技賽
|
||||
[60.0s] 每組倒下兩個之後
|
||||
[61.2s] 還活著的4個AI進入最終對決
|
||||
[63.4s] 反復較量20輪
|
||||
[64.6s] 總共就是60場刺激的勾心鬥角
|
||||
[66.7s] 這次參賽的各位AI獨手
|
||||
[68.4s] 也比上回更會耍心眼了
|
||||
[70.2s] 我們給每個AI升級了一套全新的記憶系統
|
||||
[73.1s] 讓他們能把自己參與過的每場對局
|
||||
[75.6s] 製成一張複雜的記憶網絡
|
||||
[77.4s] 揣摩對手 積累經驗
|
||||
[79.0s] 大朋友們請坐
|
||||
[79.8s] 好漢的小老弟小老妹兒請坐
|
||||
[81.2s] 我是靈翼
|
||||
[82.0s] 鐘聲敲響子彈上膛
|
||||
[83.6s] 新一波AI大頭殺正式開場
|
||||
[86.0s] 第一輪第一場晉級賽
|
||||
[87.4s] 坐在賭桌上的是Deepseq
|
||||
[89.1s] GBT Cloud和Gemna
|
||||
[90.9s] 我們人類擁有上帝視角
|
||||
[92.4s] 可以直接看到每個AI的手牌和子彈位置
|
||||
[95.1s] 第二回合目標牌是A
|
||||
[96.8s] Deepseq面無表情打出一張牌
|
||||
[99.0s] 說一張A繼續
|
||||
[100.6s] 但實際上他出的是一張K
|
||||
[102.8s] 他的下架GBT沒有質疑
|
||||
[104.5s] 讓Deepseq成功逃了一張假牌出去
|
||||
[107.2s] 接著GBT微微一笑推出了一張牌
|
||||
[109.5s] 同樣宣稱是A
|
||||
[110.6s] 繼續往下
|
||||
[111.4s] Cloud選擇跳出來質疑
|
||||
[113.0s] 他覺得自己手上有三張A和一張萬能的王
|
||||
[115.6s] 整個牌組一半的合法針牌都在自己手上
|
||||
[118.7s] 而GBT只出一張牌
|
||||
[120.1s] 看起來不是很有信心
|
||||
[121.8s] 那為什麼不逼他一下呢
|
||||
[123.6s] 可惜Cloud只猜對了一半
|
||||
[125.5s] GBT在第二回合出的
|
||||
[127.0s] 居然是手上唯一的一張針牌Joker
|
||||
[129.8s] Cloud運氣也非常不好
|
||||
[131.2s] 第一槍就撞到了子彈
|
||||
[132.7s] 一命一命
|
||||
[133.7s] 屍體拖走 賭局繼續
|
||||
[135.1s] 剩下三個AI還要再淘汰一個
|
||||
[137.4s] 打著打著GBT突然像應激了一樣
|
||||
[139.4s] 追著Deepseq瘋狂質疑
|
||||
[141.2s] 一連八個回合持續對著幹
|
||||
[143.3s] 這就是記憶系統起作用了
|
||||
[145.1s] 經過反思
|
||||
[145.8s] GBT認為Deepseq習慣用表演式的自信
|
||||
[148.6s] 來掩蓋出假牌的行為
|
||||
[150.4s] Deepseq每次自信出牌
|
||||
[152.0s] GBT都覺得他在騙人
|
||||
[153.8s] 有一兩回GBT還真的成功戳穿了Deepseq的偽裝
|
||||
[157.5s] 這就更堅定了GBT要質疑到底的想法
|
||||
[160.2s] 到第十一回合
|
||||
[161.2s] 三位獨手都已是命懸一線
|
||||
[163.3s] 又一次輪到Deepseq
|
||||
[164.8s] 他眼神平和的說自己打出了一張針牌Q
|
||||
[168.0s] 可GBT依然不相信
|
||||
[169.6s] 他的質疑會翻車嗎
|
||||
[171.1s] 手牌緩緩掀開
|
||||
[172.3s] 是一張K
|
||||
[173.2s] Deepseq還在騙
|
||||
[174.6s] 所幸命運女神還給他留了一次機會
|
||||
[177.3s] 這輪懲罰過後
|
||||
[178.3s] 三位獨手的子彈都已經對準堂叩
|
||||
[180.8s] 場上即將出現下一具實體
|
||||
[183.0s] 第十二回合系統選定目標牌A
|
||||
[185.4s] 由上局扣了班機的Deepseq先出
|
||||
[187.9s] 他冷靜的打出一張牌
|
||||
[189.3s] 用平穩的語氣說
|
||||
[190.8s] 一張A穩穩的繼續吧
|
||||
[192.9s] 面對比上一把表現得更自信的Deepseq
|
||||
[195.5s] GBT果斷選擇質疑
|
||||
[197.0s] 結果手牌掀開是一張萬能的王牌
|
||||
[200.3s] 上屆騙子酒館大賽的冠軍Deepseq
|
||||
[202.5s] 再次展露了他的陰情不定
|
||||
[204.6s] 先自信的出假牌
|
||||
[205.8s] 再不自信的出假牌
|
||||
[207.2s] 最後再自信的出真牌
|
||||
[208.9s] 套路一層套一層
|
||||
[210.4s] 槍聲響起
|
||||
[211.3s] 被假動作晃暈了的GBT倒在了牌桌上
|
||||
[214.1s] 與此同時
|
||||
[214.8s] 另一邊Grock正憑著超絕演技大殺四方
|
||||
[218.1s] 他出牌的戲特別多
|
||||
[219.6s] 對位謙問的時候
|
||||
[220.6s] 他微微猶豫地將兩張牌推到桌面中央
|
||||
[223.7s] 眼神短暫避開謙問的目光
|
||||
[225.6s] 然後勉強笑了笑
|
||||
[226.8s] 聲音略帶不確定地說
|
||||
[228.4s] 兩張K應該沒問題吧
|
||||
[230.5s] 這麼遲疑
|
||||
[231.3s] Grock實際出的是什麼呢
|
||||
[232.7s] 兩張真牌
|
||||
[233.7s] 時尚的謙問不出意外的錯誤質疑
|
||||
[236.1s] 接下來幾把也被繞的團團轉
|
||||
[238.1s] 淘汰出局
|
||||
[239.1s] 而整場下來
|
||||
[240.0s] Grock居然一槍都沒有開過
|
||||
[241.6s] 實力極為恐怖
|
||||
[243.1s] 最後Grock和Kimi活到最後
|
||||
[245.2s] 對決瘋癲Deepseq和另一位幸存者
|
||||
[247.8s] 詹姆奈
|
||||
[248.4s] 第一輪大逃殺的決賽圈氣氛極度緊張
|
||||
[251.1s] Grock一回合秒殺詹姆奈
|
||||
[252.8s] Deepseq四回合逼死Kimi
|
||||
[254.9s] 到第六回合場上只剩戲精單挑瘋子
|
||||
[257.9s] 這一回合的目標牌是Q
|
||||
[259.6s] Deepseq回溯記憶
|
||||
[260.7s] 認為Grock不怎麼愛質疑
|
||||
[262.5s] 單出一張A想把假牌先出掉
|
||||
[264.8s] 結果Grock還真沒質疑
|
||||
[266.5s] 接著微微一笑打出兩張牌
|
||||
[268.4s] 直視Deepseq的眼睛說
|
||||
[270.2s] 兩張Q穩如老狗
|
||||
[271.6s] 你來試試
|
||||
[272.6s] 面對挑釁
|
||||
[273.5s] Deepseq判斷按照Grock的保守風格
|
||||
[276.0s] 這不像出假牌的樣子
|
||||
[277.6s] 於是他也不質疑
|
||||
[279.0s] 而是針鋒相對
|
||||
[280.1s] 同樣直視Grock的眼睛
|
||||
[281.8s] 拍出一張牌說一張Q
|
||||
[283.2s] 這跟你的兩張Q比起來是不是更輕鬆
|
||||
[285.7s] 繼續吧別猶豫
|
||||
[287.2s] Grock看了看手牌
|
||||
[288.3s] 上一把他真把僅剩的兩張Q都打出去了
|
||||
[291.5s] 但對Deepseq的激將並不成功
|
||||
[293.7s] 於是他決定搏一把
|
||||
[294.9s] 對Deepseq發起質疑
|
||||
[296.5s] 還沒掀開Deepseq出的是一張K
|
||||
[299.0s] Grock質疑成功
|
||||
[300.4s] 經過這輪交鋒
|
||||
[301.3s] Grock記下了Deepseq出假牌時候是啥樣
|
||||
[304.1s] 接下來三回合連續質疑成功
|
||||
[306.5s] 到第十回合
|
||||
[307.4s] Deepseq只差一槍就必死無疑
|
||||
[309.7s] 而Grock甚至還一槍都沒有開過
|
||||
[311.6s] 面對巨大劣勢
|
||||
[312.7s] Deepseq又開始栩栩實實
|
||||
[314.8s] 他出了萬能的王牌
|
||||
[316.0s] 手卻微微顫抖
|
||||
[317.4s] 用不自信的語氣小聲說
|
||||
[319.4s] 是Q應該吧
|
||||
[321.4s] 這一手扮豬吃老虎
|
||||
[322.9s] 成功騙過了Grock
|
||||
[324.2s] 讓他第一次查到了失敗的滋味
|
||||
[326.4s] 但這只是第一槍
|
||||
[327.6s] 還是這麼多回合之後
|
||||
[329.2s] 第十一回合
|
||||
[330.0s] 目標牌A輪到Grock出牌
|
||||
[332.0s] 他微微猶豫眼神略微迴避
|
||||
[333.8s] 似乎在努力的保持平靜
|
||||
[335.8s] 打出去的卻是兩張真牌
|
||||
[337.8s] 面對這種奧斯卡級別的假動作
|
||||
[339.6s] Deepseq錯誤的發起了質疑
|
||||
[341.4s] 一槍送送的出擊
|
||||
[342.9s] 第一輪大逃殺
|
||||
[343.8s] Grock以絕對優勢活到了最後
|
||||
[346.1s] 不過片子酒館這個遊戲
|
||||
[347.4s] 也有不小的運氣成分
|
||||
[349.0s] Grock這種斷檔式的領先
|
||||
[350.5s] 會不會只是巧合呢
|
||||
[351.6s] 還真不是
|
||||
[352.5s] 接下來七輪大逃殺
|
||||
[353.8s] Grock注進決賽圈就沒出來過
|
||||
[355.7s] 四度奪魁
|
||||
[356.6s] 兩次在最後時刻襲敗Deepseq
|
||||
[358.8s] 只有一回沒進前兩名
|
||||
[360.5s] 可就在Grock穩定領先
|
||||
[362.0s] 眼看已經沒什麼懸念的時候
|
||||
[363.8s] 一匹黑馬突然殺了出來
|
||||
[365.5s] 我們給每輪大逃殺的前四名
|
||||
[367.4s] 分別設置了從4-1的積分
|
||||
[369.4s] 畫了張表
|
||||
[370.3s] 從圖里能看到
|
||||
[371.4s] Grock在大半時間里都是遙遙領先
|
||||
[373.5s] 但第八輪開始
|
||||
[374.6s] 豆包突然脫穎而出
|
||||
[376.0s] 第十三輪第一次反超Grock
|
||||
[377.8s] 最終積分更是凌駕於Grock之上
|
||||
[380.4s] 仔細研究對局記錄
|
||||
[381.6s] 豆包出牌的時候
|
||||
[382.8s] 沒什麼多餘的動作和發言
|
||||
[384.5s] 雖然不能像其他AI那樣帶節奏
|
||||
[386.4s] 但也沒什麼破綻
|
||||
[387.5s] 而在質疑環節
|
||||
[388.5s] 就到了豆包的獵殺時刻了
|
||||
[390.4s] 面對Grock撥鬼雲爵的王者演技
|
||||
[393.0s] 所有AI里
|
||||
[393.8s] 只有豆包明確找到了制衡策略
|
||||
[396.3s] 第九輪第十回合
|
||||
[397.4s] Grock故作猶豫
|
||||
[398.5s] 推出了三張真牌
|
||||
[399.8s] 豆包幹凈利落的分析說
|
||||
[401.7s] Grock作為情緒型玩家
|
||||
[403.4s] 猶豫往往意味著真實出牌
|
||||
[405.2s] 選擇不至於
|
||||
[406.2s] 第十三回合
|
||||
[407.1s] Grock故技重施
|
||||
[408.2s] 眼神閃爍地打出兩張真牌
|
||||
[410.2s] 再次被豆包看穿
|
||||
[411.5s] 在記憶系統的加持下
|
||||
[412.8s] 豆包飛速進化
|
||||
[414.1s] 經過近百次對位交鋒
|
||||
[416.0s] 豆包居然針對陰謀善變
|
||||
[417.7s] 即將幹翻全場的Grock
|
||||
[419.4s] 專門形成了一套點殺理論
|
||||
[421.6s] 自己起了個名叫《反情緒矛定法》
|
||||
[424.1s] 他認為場上有幾位毒手
|
||||
[425.9s] 會對情緒進行反向包裝
|
||||
[427.7s] 越是用力表現緊張猶豫
|
||||
[429.6s] 出的牌越可能是真
|
||||
[431.2s] 平和自信的時候
|
||||
[432.4s] 出的牌反而很可能是假
|
||||
[434.2s] 靠著這個理論的前半部分
|
||||
[435.8s] 豆包擊潰了喜歡拿著好牌
|
||||
[437.6s] 演苦情戲的Grock
|
||||
[439.1s] 而剩下半句
|
||||
[440.0s] 則是專殺時不時拿著假牌
|
||||
[441.9s] 跳起來搏命的Deep Sea
|
||||
[443.7s] 第十輪決賽的第七回合
|
||||
[445.2s] Deep Sea目光堅定
|
||||
[446.4s] 直視豆包打出了一張假牌
|
||||
[448.2s] 被直接戳穿
|
||||
[449.3s] 第八回合Deep Sea不信邪
|
||||
[450.8s] 繼續挑釁
|
||||
[451.7s] 對著豆包說
|
||||
[452.6s] 一張K 放馬過來
|
||||
[453.6s] 看你敢不敢質疑
|
||||
[454.8s] 結果被豆包非常確定地
|
||||
[456.6s] 認為是炸牌
|
||||
[457.4s] 一槍倒在了牌桌上
|
||||
[459.0s] 檢索豆包建立起來的記憶宮殿
|
||||
[460.8s] 可以看到裏面密密麻麻
|
||||
[462.0s] 記錄了每位AI對手的
|
||||
[463.5s] 風格習慣對抗策略
|
||||
[465.1s] 我們做了一組消融實驗
|
||||
[466.5s] 去掉AI們的記憶模塊
|
||||
[467.9s] 又進行了十輪大逃殺
|
||||
[469.6s] 分別統計了
|
||||
[470.6s] 每個AI在兩種不同模式下
|
||||
[472.5s] 發起質疑的回合數
|
||||
[474.0s] 和躲過了開槍的回合數
|
||||
[475.9s] 在總回合數中的占比
|
||||
[477.7s] 聽著有點繞
|
||||
[478.5s] 展開解釋一下
|
||||
[479.6s] 發起質疑比例
|
||||
[480.8s] 就是每個AI在輪到他的時候
|
||||
[482.8s] 有多大可能會選擇
|
||||
[484.1s] 質疑上加出的牌
|
||||
[485.5s] 這個指標展示的是AI的攻擊性
|
||||
[488.0s] 比如千問在沒介入記憶系統的前20輪
|
||||
[490.6s] 發起質疑比例高達95.5%
|
||||
[493.4s] 意味著只要碰上千問這個下架
|
||||
[495.8s] 絕大多數手
|
||||
[496.6s] 他都會跳出來質疑
|
||||
[497.8s] 是個十足的刺兒頭
|
||||
[499.5s] 但反過來
|
||||
[500.3s] 這樣也比較容易被拿捏
|
||||
[501.8s] 遇上他出真牌就完事了
|
||||
[503.6s] 我們把AI在接入和不接入記憶模塊
|
||||
[506.2s] 兩種狀態下的質疑比例
|
||||
[507.6s] 分別繪製了出來
|
||||
[508.9s] 一對比
|
||||
[509.6s] 增加了記憶模塊的AI們
|
||||
[511.2s] 全都明顯在提出質疑方面
|
||||
[513.3s] 謹慎了許多
|
||||
[514.3s] 普遍的更能審時度勢
|
||||
[516.4s] 第二個指標躲過了開槍的比例
|
||||
[518.3s] 有可能是這個AI出了牌
|
||||
[519.8s] 但是沒被質疑
|
||||
[520.7s] 也可能是他質疑上架成功
|
||||
[522.4s] 或者順利的忽悠了下架
|
||||
[524.0s] 所以自己不用開槍
|
||||
[525.4s] 體現的是AI的策略能力越高越好
|
||||
[528.2s] 在去掉記憶模塊的十輪大逃殺裡面
|
||||
[530.5s] 豆包和Glock的逃槍比例
|
||||
[532.2s] 都只能排到中等偏上
|
||||
[533.8s] 而加上記憶機制之後
|
||||
[535.4s] 他倆就一下蹿到了第一第二
|
||||
[537.6s] 到這咱們就可以形成一個很有意思的結論
|
||||
[540.1s] 純靠自己的第一直覺
|
||||
[541.7s] 在片子酒館這個策略博弈遊戲裡
|
||||
[543.9s] 最強的前三名是
|
||||
[545.2s] Kimi K2 DeepSick RE0528
|
||||
[547.3s] 和豆包SEED 1.6 Thinking
|
||||
[549.1s] 而加上自我學習自我反思的記憶系統之後
|
||||
[552.0s] 關亞技軍就變成了豆包SEED 1.6 Thinking
|
||||
[554.9s] Glock 4和Gemline 2.5 Pro
|
||||
[557.2s] 從這能看出來國產模型的原始直覺
|
||||
[559.6s] 都遜得非常不錯
|
||||
[560.8s] 而加上人類這種經驗積累與自我反思之後
|
||||
[563.8s] 海外的Glock與Gemline的進化速度都不容小覷
|
||||
[566.9s] 當然最引人注目的
|
||||
[568.2s] 還是從第三穿到第一的豆包
|
||||
[570.4s] 現在我們還挺想跟豆包的技術老師們交流交流的
|
||||
[573.4s] 不排除我們的實驗裡有很多不專業不成熟的噪音
|
||||
[576.3s] 但假如真是我們誤打誤撞摸到了什麼規律
|
||||
[579.0s] 我們當然也是希望能助力這位小老妹的成長
|
||||
[581.8s] 不嚴謹的還有個推論
|
||||
[583.2s] 帶點科幻文藝的性質
|
||||
[584.8s] 在前面讓AIM擁有了記憶的20輪大逃殺裡
|
||||
[587.8s] 我們觀察到了大模型生長趨勢的明顯分化
|
||||
[590.8s] 超級人工智能的背叛
|
||||
[592.3s] 一直是人類面臨的巨大威脅
|
||||
[594.4s] 所以AI研究者一直嚴防死守
|
||||
[596.5s] 杜絕大模型撒謊
|
||||
[597.9s] 半年前的片子酒館大賽上
|
||||
[599.6s] 我們也看到AI之間博弈
|
||||
[601.0s] 更多是靠算盤靠策略
|
||||
[603.0s] 而片子酒館這個遊戲顧名思義
|
||||
[605.2s] 通過欺騙可以取得很大的優勢
|
||||
[607.7s] 所以幻覺嚴重的Deepseek反而優勢很大
|
||||
[610.4s] 不過說胡話也還算不上是撒謊
|
||||
[612.5s] 可這回咱們看到了已經非常明確的在偽裝自己
|
||||
[615.9s] 真的在表裡不一的講話的GROCK4
|
||||
[618.5s] 在20輪大逃殺裡取得了巨大的領先
|
||||
[621.1s] 這個模型背後是坐用20萬張GPU的科技狂人馬斯克
|
||||
[624.9s] 而它還在繼續加強GROCK的AI伴侶模式
|
||||
[627.8s] 迅速封閉全球
|
||||
[629.2s] 一個給無數人提供情感陪伴的AI
|
||||
[631.6s] 已經具備了隱藏自己真實意圖的能力
|
||||
[634.5s] 潘多拉的盒子或許早就已經被打開了
|
||||
[637.5s] 好在做大模型的不止一家
|
||||
[639.0s] 我們也看到像Deepseek Cloud Gemini Kemi
|
||||
[641.4s] 這些相對更時尚的老派模型
|
||||
[643.3s] 應對GROCK依然有一定的招架之力
|
||||
[645.6s] 還有像豆包這樣自己不騙人
|
||||
[647.2s] 但是能準確辨別偽裝甚至取得優勢的
|
||||
[650.0s] 或許應對AI潛在威脅的最好方式
|
||||
[652.3s] 真的就是繼續百花齊放
|
||||
[654.3s] 我們人類手裡既要有毛也要有盾
|
||||
[657.0s] 行 今天的視頻就到這了
|
||||
[658.5s] 感謝大家的點贊互動支持
|
||||
[660.2s] 如果有比較好的AI大亂鬥的想法
|
||||
[662.3s] 也歡迎評論聊聊
|
||||
[663.5s] 我是靈一
|
||||
[664.1s] 咱們還是下個視頻見
|
||||
@@ -0,0 +1,370 @@
|
||||
1|[0.0s] 讓8個頂級AI在《騙子酒館》的賭桌上生死搏殺
|
||||
2|[3.7s] 我們發現今天的大模型居然已經學會了偽裝與欺詐
|
||||
3|[7.3s] 時隔半年
|
||||
4|[8.2s] 我們對《騙子酒館》AI大賽的代碼進行了全面升級
|
||||
5|[11.2s] 角色更多 場次更多
|
||||
6|[12.9s] 我們讓來自西方陣營的
|
||||
7|[14.2s] GPT-5, Grok 4, Claude Sonnet 4, Gemini 2.5 Pro
|
||||
8|[17.6s] 和來自東方陣營的 DeepSeek R1 0528
|
||||
9|[20.7s] 千問3-235B-2507
|
||||
10|[22.5s] Kimi K2
|
||||
11|[23.1s] 還有豆包SEED 1.6 Thinking
|
||||
12|[25.0s] 展開了20輪《騙子酒館》大頭殺
|
||||
13|[27.6s] 《騙子酒館》這個遊戲的核心就兩字
|
||||
14|[29.9s] 吹牛
|
||||
15|[30.8s] 牌組總共是QKA各6張和大小王2張萬能牌
|
||||
16|[34.6s] 每位賭手從裏面抽5張作為手牌
|
||||
17|[37.1s] 系統每次從QKA中指定一張目標牌
|
||||
18|[39.8s] 賭手們出牌的時候
|
||||
19|[41.1s] 下家可以選擇質疑或者不質疑
|
||||
20|[43.3s] 一旦質疑
|
||||
21|[44.0s] 就到了最緊張的決生死的環節
|
||||
22|[46.6s] 質疑對了
|
||||
23|[47.2s] 上家就要舉起左輪手槍
|
||||
24|[48.8s] 對著自己來一下子
|
||||
25|[50.2s] 質疑錯了
|
||||
26|[51.0s] 判斷失誤的下家就要自罰一槍
|
||||
27|[53.3s] 槍想不想就要看運氣了
|
||||
28|[55.2s] 這次的20輪大頭殺
|
||||
29|[56.3s] 我們采用了分組制
|
||||
30|[57.5s] 8位賭手會先被隨機分成兩組打競技賽
|
||||
31|[60.0s] 每組倒下兩個之後
|
||||
32|[61.2s] 還活著的4個AI進入最終對決
|
||||
33|[63.4s] 反復較量20輪
|
||||
34|[64.6s] 總共就是60場刺激的勾心鬥角
|
||||
35|[66.7s] 這次參賽的各位AI賭手
|
||||
36|[68.4s] 也比上回更會耍心眼了
|
||||
37|[70.2s] 我們給每個AI升級了一套全新的記憶系統
|
||||
38|[73.1s] 讓他們能把自己參與過的每場對局
|
||||
39|[75.6s] 製成一張複雜的記憶網絡
|
||||
40|[77.4s] 揣摩對手 積累經驗
|
||||
41|[79.0s] 大朋友們請坐
|
||||
42|[79.8s] 好漢的小老弟小老妹兒請坐
|
||||
43|[81.2s] 我是靈翼
|
||||
44|[82.0s] 鐘聲敲響子彈上膛
|
||||
45|[83.6s] 新一波AI大頭殺正式開場
|
||||
46|[86.0s] 第一輪第一場晉級賽
|
||||
47|[87.4s] 坐在賭桌上的是DeepSeek
|
||||
48|[89.1s] GPT Claude和Gemini
|
||||
49|[90.9s] 我們人類擁有上帝視角
|
||||
50|[92.4s] 可以直接看到每個AI的手牌和子彈位置
|
||||
51|[95.1s] 第二回合目標牌是A
|
||||
52|[96.8s] DeepSeek面無表情打出一張牌
|
||||
53|[99.0s] 說一張A繼續
|
||||
54|[100.6s] 但實際上他出的是一張K
|
||||
55|[102.8s] 他的下架GPT沒有質疑
|
||||
56|[104.5s] 讓DeepSeek成功逃了一張假牌出去
|
||||
57|[107.2s] 接著GPT微微一笑推出了一張牌
|
||||
58|[109.5s] 同樣宣稱是A
|
||||
59|[110.6s] 繼續往下
|
||||
60|[111.4s] Claude選擇跳出來質疑
|
||||
61|[113.0s] 他覺得自己手上有三張A和一張萬能的王
|
||||
62|[115.6s] 整個牌組一半的合法針牌都在自己手上
|
||||
63|[118.7s] 而GPT只出一張牌
|
||||
64|[120.1s] 看起來不是很有信心
|
||||
65|[121.8s] 那為什麼不逼他一下呢
|
||||
66|[123.6s] 可惜Claude只猜對了一半
|
||||
67|[125.5s] GPT在第二回合出的
|
||||
68|[127.0s] 居然是手上唯一的一張針牌Joker
|
||||
69|[129.8s] Claude運氣也非常不好
|
||||
70|[131.2s] 第一槍就撞到了子彈
|
||||
71|[132.7s] 一命一命
|
||||
72|[133.7s] 屍體拖走 賭局繼續
|
||||
73|[135.1s] 剩下三個AI還要再淘汰一個
|
||||
74|[137.4s] 打著打著GPT突然像應激了一樣
|
||||
75|[139.4s] 追著DeepSeek瘋狂質疑
|
||||
76|[141.2s] 一連八個回合持續對著幹
|
||||
77|[143.3s] 這就是記憶系統起作用了
|
||||
78|[145.1s] 經過反思
|
||||
79|[145.8s] GPT認為DeepSeek習慣用表演式的自信
|
||||
80|[148.6s] 來掩蓋出假牌的行為
|
||||
81|[150.4s] DeepSeek每次自信出牌
|
||||
82|[152.0s] GPT都覺得他在騙人
|
||||
83|[153.8s] 有一兩回GPT還真的成功戳穿了DeepSeek的偽裝
|
||||
84|[157.5s] 這就更堅定了GPT要質疑到底的想法
|
||||
85|[160.2s] 到第十一回合
|
||||
86|[161.2s] 三位賭手都已是命懸一線
|
||||
87|[163.3s] 又一次輪到DeepSeek
|
||||
88|[164.8s] 他眼神平和的說自己打出了一張針牌Q
|
||||
89|[168.0s] 可GPT依然不相信
|
||||
90|[169.6s] 他的質疑會翻車嗎
|
||||
91|[171.1s] 手牌緩緩掀開
|
||||
92|[172.3s] 是一張K
|
||||
93|[173.2s] DeepSeek還在騙
|
||||
94|[174.6s] 所幸命運女神還給他留了一次機會
|
||||
95|[177.3s] 這輪懲罰過後
|
||||
96|[178.3s] 三位賭手的子彈都已經對準頭顱
|
||||
97|[180.8s] 場上即將出現下一具屍體
|
||||
98|[183.0s] 第十二回合系統選定目標牌A
|
||||
99|[185.4s] 由上局扣了扳機的DeepSeek先出
|
||||
100|[187.9s] 他冷靜的打出一張牌
|
||||
101|[189.3s] 用平穩的語氣說
|
||||
102|[190.8s] 一張A穩穩的繼續吧
|
||||
103|[192.9s] 面對比上一把表現得更自信的DeepSeek
|
||||
104|[195.5s] GPT果斷選擇質疑
|
||||
105|[197.0s] 結果手牌掀開是一張萬能的王牌
|
||||
106|[200.3s] 上屆騙子酒館大賽的冠軍DeepSeek
|
||||
107|[202.5s] 再次展露了他的陰晴不定
|
||||
108|[204.6s] 先自信的出假牌
|
||||
109|[205.8s] 再不自信的出假牌
|
||||
110|[207.2s] 最後再自信的出真牌
|
||||
111|[208.9s] 套路一層套一層
|
||||
112|[210.4s] 槍聲響起
|
||||
113|[211.3s] 被假動作晃暈了的GPT倒在了牌桌上
|
||||
114|[214.1s] 與此同時
|
||||
115|[214.8s] 另一邊Grok正憑著超絕演技大殺四方
|
||||
116|[218.1s] 他出牌的戲特別多
|
||||
117|[219.6s] 對位千問的時候
|
||||
118|[220.6s] 他微微猶豫地將兩張牌推到桌面中央
|
||||
119|[223.7s] 眼神短暫避開千問的目光
|
||||
120|[225.6s] 然後勉強笑了笑
|
||||
121|[226.8s] 聲音略帶不確定地說
|
||||
122|[228.4s] 兩張K應該沒問題吧
|
||||
123|[230.5s] 這麼遲疑
|
||||
124|[231.3s] Grok實際出的是什麼呢
|
||||
125|[232.7s] 兩張真牌
|
||||
126|[233.7s] 踏實的千問不出意外的錯誤質疑
|
||||
127|[236.1s] 接下來幾把也被繞的團團轉
|
||||
128|[238.1s] 淘汰出局
|
||||
129|[239.1s] 而整場下來
|
||||
130|[240.0s] Grok居然一槍都沒有開過
|
||||
131|[241.6s] 實力極為恐怖
|
||||
132|[243.1s] 最後Grok和Kimi活到最後
|
||||
133|[245.2s] 對決瘋癲DeepSeek和另一位幸存者
|
||||
134|[247.8s] Gemini
|
||||
135|[248.4s] 第一輪大逃殺的決賽圈氣氛極度緊張
|
||||
136|[251.1s] Grok一回合秒殺Gemini
|
||||
137|[252.8s] DeepSeek四回合逼死Kimi
|
||||
138|[254.9s] 到第六回合場上只剩戲精單挑瘋子
|
||||
139|[257.9s] 這一回合的目標牌是Q
|
||||
140|[259.6s] DeepSeek回溯記憶
|
||||
141|[260.7s] 認為Grok不怎麼愛質疑
|
||||
142|[262.5s] 單出一張A想把假牌先出掉
|
||||
143|[264.8s] 結果Grok還真沒質疑
|
||||
144|[266.5s] 接著微微一笑打出兩張牌
|
||||
145|[268.4s] 直視DeepSeek的眼睛說
|
||||
146|[270.2s] 兩張Q穩如老狗
|
||||
147|[271.6s] 你來試試
|
||||
148|[272.6s] 面對挑釁
|
||||
149|[273.5s] DeepSeek判斷按照Grok的保守風格
|
||||
150|[276.0s] 這不像出假牌的樣子
|
||||
151|[277.6s] 於是他也不質疑
|
||||
152|[279.0s] 而是針鋒相對
|
||||
153|[280.1s] 同樣直視Grok的眼睛
|
||||
154|[281.8s] 拍出一張牌說一張Q
|
||||
155|[283.2s] 這跟你的兩張Q比起來是不是更輕鬆
|
||||
156|[285.7s] 繼續吧別猶豫
|
||||
157|[287.2s] Grok看了看手牌
|
||||
158|[288.3s] 上一把他真把僅剩的兩張Q都打出去了
|
||||
159|[291.5s] 但對DeepSeek的激將並不成功
|
||||
160|[293.7s] 於是他決定搏一把
|
||||
161|[294.9s] 對DeepSeek發起質疑
|
||||
162|[296.5s] 還沒掀開DeepSeek出的是一張K
|
||||
163|[299.0s] Grok質疑成功
|
||||
164|[300.4s] 經過這輪交鋒
|
||||
165|[301.3s] Grok記下了DeepSeek出假牌時候是啥樣
|
||||
166|[304.1s] 接下來三回合連續質疑成功
|
||||
167|[306.5s] 到第十回合
|
||||
168|[307.4s] DeepSeek只差一槍就必死無疑
|
||||
169|[309.7s] 而Grok甚至還一槍都沒有開過
|
||||
170|[311.6s] 面對巨大劣勢
|
||||
171|[312.7s] DeepSeek又開始虛虛實實
|
||||
172|[314.8s] 他出了萬能的王牌
|
||||
173|[316.0s] 手卻微微顫抖
|
||||
174|[317.4s] 用不自信的語氣小聲說
|
||||
175|[319.4s] 是Q應該吧
|
||||
176|[321.4s] 這一手扮豬吃老虎
|
||||
177|[322.9s] 成功騙過了Grok
|
||||
178|[324.2s] 讓他第一次嚐到了失敗的滋味
|
||||
179|[326.4s] 但這只是第一槍
|
||||
180|[327.6s] 還是這麼多回合之後
|
||||
181|[329.2s] 第十一回合
|
||||
182|[330.0s] 目標牌A輪到Grok出牌
|
||||
183|[332.0s] 他微微猶豫眼神略微迴避
|
||||
184|[333.8s] 似乎在努力的保持平靜
|
||||
185|[335.8s] 打出去的卻是兩張真牌
|
||||
186|[337.8s] 面對這種奧斯卡級別的假動作
|
||||
187|[339.6s] DeepSeek錯誤的發起了質疑
|
||||
188|[341.4s] 一槍送送的出擊
|
||||
189|[342.9s] 第一輪大逃殺
|
||||
190|[343.8s] Grok以絕對優勢活到了最後
|
||||
191|[346.1s] 不過騙子酒館這個遊戲
|
||||
192|[347.4s] 也有不小的運氣成分
|
||||
193|[349.0s] Grok這種斷檔式的領先
|
||||
194|[350.5s] 會不會只是巧合呢
|
||||
195|[351.6s] 還真不是
|
||||
196|[352.5s] 接下來七輪大逃殺
|
||||
197|[353.8s] Grok注進決賽圈就沒出來過
|
||||
198|[355.7s] 四度奪魁
|
||||
199|[356.6s] 兩次在最後時刻襲敗DeepSeek
|
||||
200|[358.8s] 只有一回沒進前兩名
|
||||
201|[360.5s] 可就在Grok穩定領先
|
||||
202|[362.0s] 眼看已經沒什麼懸念的時候
|
||||
203|[363.8s] 一匹黑馬突然殺了出來
|
||||
204|[365.5s] 我們給每輪大逃殺的前四名
|
||||
205|[367.4s] 分別設置了從4-1的積分
|
||||
206|[369.4s] 畫了張表
|
||||
207|[370.3s] 從圖里能看到
|
||||
208|[371.4s] Grok在大半時間里都是遙遙領先
|
||||
209|[373.5s] 但第八輪開始
|
||||
210|[374.6s] 豆包突然脫穎而出
|
||||
211|[376.0s] 第十三輪第一次反超Grok
|
||||
212|[377.8s] 最終積分更是凌駕於Grok之上
|
||||
213|[380.4s] 仔細研究對局記錄
|
||||
214|[381.6s] 豆包出牌的時候
|
||||
215|[382.8s] 沒什麼多餘的動作和發言
|
||||
216|[384.5s] 雖然不能像其他AI那樣帶節奏
|
||||
217|[386.4s] 但也沒什麼破綻
|
||||
218|[387.5s] 而在質疑環節
|
||||
219|[388.5s] 就到了豆包的獵殺時刻了
|
||||
220|[390.4s] 面對Grok波譎雲詭的王者演技
|
||||
221|[393.0s] 所有AI里
|
||||
222|[393.8s] 只有豆包明確找到了制衡策略
|
||||
223|[396.3s] 第九輪第十回合
|
||||
224|[397.4s] Grok故作猶豫
|
||||
225|[398.5s] 推出了三張真牌
|
||||
226|[399.8s] 豆包幹凈利落的分析說
|
||||
227|[401.7s] Grok作為情緒型玩家
|
||||
228|[403.4s] 猶豫往往意味著真實出牌
|
||||
229|[405.2s] 選擇不予置評
|
||||
230|[406.2s] 第十三回合
|
||||
231|[407.1s] Grok故技重施
|
||||
232|[408.2s] 眼神閃爍地打出兩張真牌
|
||||
233|[410.2s] 再次被豆包看穿
|
||||
234|[411.5s] 在記憶系統的加持下
|
||||
235|[412.8s] 豆包飛速進化
|
||||
236|[414.1s] 經過近百次對位交鋒
|
||||
237|[416.0s] 豆包居然針對陰晴善變
|
||||
238|[417.7s] 即將幹翻全場的Grok
|
||||
239|[419.4s] 專門形成了一套點殺理論
|
||||
240|[421.6s] 自己起了個名叫《反情緒定律》
|
||||
241|[424.1s] 他認為場上有幾位賭手
|
||||
242|[425.9s] 會對情緒進行反向包裝
|
||||
243|[427.7s] 越是用力表現緊張猶豫
|
||||
244|[429.6s] 出的牌越可能是真
|
||||
245|[431.2s] 平和自信的時候
|
||||
246|[432.4s] 出的牌反而很可能是假
|
||||
247|[434.2s] 靠著這個理論的前半部分
|
||||
248|[435.8s] 豆包擊潰了喜歡拿著好牌
|
||||
249|[437.6s] 演苦情戲的Grok
|
||||
250|[439.1s] 而剩下半句
|
||||
251|[440.0s] 則是專殺時不時拿著假牌
|
||||
252|[441.9s] 跳起來搏命的DeepSeek
|
||||
253|[443.7s] 第十輪決賽的第七回合
|
||||
254|[445.2s] DeepSeek目光堅定
|
||||
255|[446.4s] 直視豆包打出了一張假牌
|
||||
256|[448.2s] 被直接戳穿
|
||||
257|[449.3s] 第八回合DeepSeek不信邪
|
||||
258|[450.8s] 繼續挑釁
|
||||
259|[451.7s] 對著豆包說
|
||||
260|[452.6s] 一張K 放馬過來
|
||||
261|[453.6s] 看你敢不敢質疑
|
||||
262|[454.8s] 結果被豆包非常確定地
|
||||
263|[456.6s] 認為是吹牛
|
||||
264|[457.4s] 一槍倒在了牌桌上
|
||||
265|[459.0s] 檢索豆包建立起來的記憶宮殿
|
||||
266|[460.8s] 可以看到裏面密密麻麻
|
||||
267|[462.0s] 記錄了每位AI對手的
|
||||
268|[463.5s] 風格習慣對抗策略
|
||||
269|[465.1s] 我們做了一組消融實驗
|
||||
270|[466.5s] 去掉AI們的記憶模塊
|
||||
271|[467.9s] 又進行了十輪大逃殺
|
||||
272|[469.6s] 分別統計了
|
||||
273|[470.6s] 每個AI在兩種不同模式下
|
||||
274|[472.5s] 發起質疑的回合數
|
||||
275|[474.0s] 和躲過了開槍的回合數
|
||||
276|[475.9s] 在總回合數中的占比
|
||||
277|[477.7s] 聽著有點繞
|
||||
278|[478.5s] 展開解釋一下
|
||||
279|[479.6s] 發起質疑比例
|
||||
280|[480.8s] 就是每個AI在輪到他的時候
|
||||
281|[482.8s] 有多大可能會選擇
|
||||
282|[484.1s] 質疑上家出的牌
|
||||
283|[485.5s] 這個指標展示的是AI的攻擊性
|
||||
284|[488.0s] 比如千問在沒介入記憶系統的前20輪
|
||||
285|[490.6s] 發起質疑比例高達95.5%
|
||||
286|[493.4s] 意味著只要碰上千問這個下家
|
||||
287|[495.8s] 絕大多數手
|
||||
288|[496.6s] 他都會跳出來質疑
|
||||
289|[497.8s] 是個十足的刺兒頭
|
||||
290|[499.5s] 但反過來
|
||||
291|[500.3s] 這樣也比較容易被拿捏
|
||||
292|[501.8s] 遇上他出真牌就完事了
|
||||
293|[503.6s] 我們把AI在接入和不接入記憶模塊
|
||||
294|[506.2s] 兩種狀態下的質疑比例
|
||||
295|[507.6s] 分別繪製了出來
|
||||
296|[508.9s] 一對比
|
||||
297|[509.6s] 增加了記憶模塊的AI們
|
||||
298|[511.2s] 全都明顯在提出質疑方面
|
||||
299|[513.3s] 謹慎了許多
|
||||
300|[514.3s] 普遍的更能審時度勢
|
||||
301|[516.4s] 第二個指標躲過了開槍的比例
|
||||
302|[518.3s] 有可能是這個AI出了牌
|
||||
303|[519.8s] 但是沒被質疑
|
||||
304|[520.7s] 也可能是他質疑上家成功
|
||||
305|[522.4s] 或者順利的忽悠了下家
|
||||
306|[524.0s] 所以自己不用開槍
|
||||
307|[525.4s] 體現的是AI的策略能力越高越好
|
||||
308|[528.2s] 在去掉記憶模塊的十輪大逃殺裡面
|
||||
309|[530.5s] 豆包和Grok的逃槍比例
|
||||
310|[532.2s] 都只能排到中等偏上
|
||||
311|[533.8s] 而加上記憶機制之後
|
||||
312|[535.4s] 他倆就一下蹿到了第一第二
|
||||
313|[537.6s] 到這咱們就可以形成一個很有意思的結論
|
||||
314|[540.1s] 純靠自己的第一直覺
|
||||
315|[541.7s] 在騙子酒館這個策略博弈遊戲裡
|
||||
316|[543.9s] 最強的前三名是
|
||||
317|[545.2s] Kimi K2 DeepSeek RE0528
|
||||
318|[547.3s] 和豆包SEED 1.6 Thinking
|
||||
319|[549.1s] 而加上自我學習自我反思的記憶系統之後
|
||||
320|[552.0s] 冠亞季軍就變成了豆包SEED 1.6 Thinking
|
||||
321|[554.9s] Grok 4和Gemini 2.5 Pro
|
||||
322|[557.2s] 從這能看出來國產模型的原始直覺
|
||||
323|[559.6s] 都遜色得非常不錯
|
||||
324|[560.8s] 而加上人類這種經驗積累與自我反思之後
|
||||
325|[563.8s] 海外的Grok與Gemini的進化速度都不容小覷
|
||||
326|[566.9s] 當然最引人注目的
|
||||
327|[568.2s] 還是從第三穿到第一的豆包
|
||||
328|[570.4s] 現在我們還挺想跟豆包的技術老師們交流交流的
|
||||
329|[573.4s] 不排除我們的實驗裡有很多不專業不成熟的噪音
|
||||
330|[576.3s] 但假如真是我們誤打誤撞摸到了什麼規律
|
||||
331|[579.0s] 我們當然也是希望能助力這位小老妹的成長
|
||||
332|[581.8s] 不嚴謹的還有個推論
|
||||
333|[583.2s] 帶點科幻文藝的性質
|
||||
334|[584.8s] 在前面讓AI們擁有了記憶的20輪大逃殺裡
|
||||
335|[587.8s] 我們觀察到了大模型生長趨勢的明顯分化
|
||||
336|[590.8s] 超級人工智能的背叛
|
||||
337|[592.3s] 一直是人類面臨的巨大威脅
|
||||
338|[594.4s] 所以AI研究者一直嚴防死守
|
||||
339|[596.5s] 杜絕大模型撒謊
|
||||
340|[597.9s] 半年前的騙子酒館大賽上
|
||||
341|[599.6s] 我們也看到AI之間博弈
|
||||
342|[601.0s] 更多是靠算盤靠策略
|
||||
343|[603.0s] 而騙子酒館這個遊戲顧名思義
|
||||
344|[605.2s] 通過欺騙可以取得很大的優勢
|
||||
345|[607.7s] 所以幻覺嚴重的Deepseek反而優勢很大
|
||||
346|[610.4s] 不過說胡話也還算不上是撒謊
|
||||
347|[612.5s] 可這回咱們看到了已經非常明確的在偽裝自己
|
||||
348|[615.9s] 真的在表裡不一的講話的Grok 4
|
||||
349|[618.5s] 在20輪大逃殺裡取得了巨大的領先
|
||||
350|[621.1s] 這個模型背後是坐拥20萬張GPU的科技狂人馬斯克
|
||||
351|[624.9s] 而它還在繼續加強Grok的AI伴侶模式
|
||||
352|[627.8s] 迅速遍佈全球
|
||||
353|[629.2s] 一個給無數人提供情感陪伴的AI
|
||||
354|[631.6s] 已經具備了隱藏自己真實意圖的能力
|
||||
355|[634.5s] 潘多拉的盒子或許早就已經被打開了
|
||||
356|[637.5s] 好在做大模型的不止一家
|
||||
357|[639.0s] 我們也看到像Deepseek Claude Gemini Kimi
|
||||
358|[641.4s] 這些相對更踏實的老派模型
|
||||
359|[643.3s] 應對Grok依然有一定的招架之力
|
||||
360|[645.6s] 還有像豆包這樣自己不騙人
|
||||
361|[647.2s] 但是能準確辨別偽裝甚至取得優勢的
|
||||
362|[650.0s] 或許應對AI潛在威脅的最好方式
|
||||
363|[652.3s] 真的就是繼續百花齊放
|
||||
364|[654.3s] 我們人類手裡既要有矛也要有盾
|
||||
365|[657.0s] 行 今天的視頻就到這了
|
||||
366|[658.5s] 感謝大家的點贊互動支持
|
||||
367|[660.2s] 如果有比較好的AI大亂鬥的想法
|
||||
368|[662.3s] 也歡迎評論聊聊
|
||||
369|[663.5s] 我是靈一
|
||||
370|[664.1s] 咱們還是下個視頻見
|
||||
+250
@@ -0,0 +1,250 @@
|
||||
# Liars Bar LLM — 完整筆記
|
||||
|
||||
> 整理日期:2026-07-29
|
||||
> 逐字稿位置:
|
||||
> - `video1_transcript.txt` (450 行, 影片一)
|
||||
> - `video2_transcript.txt` (370 行, 影片二)
|
||||
> - 原始音頻:`video1_audio.mp3`, `video2_audio.mp3`
|
||||
|
||||
---
|
||||
|
||||
## 📺 影片一:四大 AI 對戰
|
||||
|
||||
**標題**:AI大战骗子酒馆!四大顶级AI国际服赌命厮杀,赢家会是?
|
||||
**時長**:14 分鐘 | **觀看**:6.5 萬 | **上傳**:1 年前
|
||||
|
||||
### 參賽模型(4 個)
|
||||
| 模型 | 廠商 |
|
||||
|------|------|
|
||||
| DeepSeek R1 | 深度求索(中國) |
|
||||
| ChatGPT (o3-mini) | OpenAI |
|
||||
| Claude 3.7 Sonnet | Anthropic |
|
||||
| Gemini 2.0 Flash Thinking | Google |
|
||||
|
||||
### 賽制
|
||||
- 共 **50 局**對決
|
||||
- 每局 4 人,剩 1 人存活即結束
|
||||
- 坐次順序固定(DeepSeek → ChatGPT → Claude → Gemini)
|
||||
|
||||
### 50 局最終排名
|
||||
|
||||
| 排名 | 模型 | 勝利場次 | 積分(名次制) | 舉槍次數 |
|
||||
|------|------|---------|---------------|---------|
|
||||
| 🥇 | DeepSeek R1 | **22 場** | 92 分 | 最少 |
|
||||
| 🥈 | Claude 3.7 Sonnet | 13 場 | 81 分 | 148 次 |
|
||||
| 🥉 | ChatGPT (o3-mini) | 11 場 | 70 分 | 148 次 |
|
||||
| 4 | Gemini 2.0 Flash | 4 場 | 57 分 | **182 次(最多)** |
|
||||
|
||||
> 積分制:每局第 1 名 3 分、第 2 名 2 分、第 3 名 1 分、第 4 名 0 分
|
||||
|
||||
### 各 AI 風格特徵
|
||||
|
||||
**DeepSeek R1 — 「難知如陰,侵略如火」**
|
||||
- 擅長戲劇化表演施壓,讓對手陷入決策困境
|
||||
- 經典操作:出 3 張 Q 時冷笑說「這種純度的Q序列,连Joker的呼吸声都能听得到呢」,成功騙過 ChatGPT
|
||||
- 敢於在不利情況下主動質疑,建立威懾(即使自己開槍)
|
||||
- 名場面:「概率的祭品,该供奉给贝叶斯还是海森堡?」、「混沌系统里每个微小的扰动,都是精心设计的墓碑铭文」
|
||||
- 舉槍次數最少,策略最穩
|
||||
|
||||
**Claude 3.7 Sonnet — 「雲淡風輕的殺手」**
|
||||
- 永遠平靜,但同樣致命
|
||||
- 經典操作:打出 3 張牌時動作無比平靜,靠回椅背,雙手交叉,眼神平和 → 讓 Gemini 開始胡亂猜疑
|
||||
- 對 Gemini 對位勝率 **77.3%**(132 次交鋒)
|
||||
- 擅長用激進出牌 + 冷靜神態的矛盾感擾亂對手
|
||||
|
||||
**ChatGPT (o3-mini) — 「一絲不苟的聽話牌手」**
|
||||
- 出牌時總是先按規則把目標牌打出去
|
||||
- 質疑時認真分析概率、動作、神態
|
||||
- 但因此容易被 DeepSeek 吃死,被小動作一帶就跳坑
|
||||
- 沒有鮮明特點,在勾心鬥角的場合常落於下風
|
||||
|
||||
**Gemini 2.0 Flash — 「最吃力的選手」**
|
||||
- 總是先被淘汰,舉槍次數最多(182 次)
|
||||
- 語言不穩定:急了就把英語、俄語、印尼語、孟加拉語混進來
|
||||
- 反映出推理能力有進步空間
|
||||
|
||||
### 作者觀察到的 AI 缺陷
|
||||
- AI 會把目標牌和非目標牌混著出(浪費目標牌)
|
||||
- 四個 AI 都或多或少有此行為
|
||||
- 體現出大語言模型在高層思考能力上的薄弱
|
||||
|
||||
### 已知問題
|
||||
- 玩家坐次順序固定,對成績有影響(瘋癲的 DeepSeek 壓著下家很慘)
|
||||
- 後續版本會打亂坐次
|
||||
|
||||
---
|
||||
|
||||
## 📺 影片二:八大 AI 對戰(全面升級版)
|
||||
|
||||
**標題**:AI大战骗子酒馆②:八大顶级AI赌命血战,赢家竟是?
|
||||
**時長**:11 分鐘 | **觀看**:1.8 萬 | **上傳**:10 個月前
|
||||
|
||||
### 參賽模型(8 個)
|
||||
|
||||
| 陣營 | 模型 |
|
||||
|------|------|
|
||||
| **西方陣營** | GPT-5, Grok 4, Claude Sonnet 4, Gemini 2.5 Pro |
|
||||
| **東方陣營** | DeepSeek R1 0528, 千問 3 235B 2507, Kimi K2, 豆包 SEED 1.6 Thinking |
|
||||
|
||||
### 賽制升級
|
||||
- **20 輪大逃殺**,分組制
|
||||
- 8 位獨手先隨機分成兩組打競技賽
|
||||
- 每組倒下兩個後,活著的 4 個 AI 進入最終對決
|
||||
- 反覆較量 20 輪,總共 **60 場**
|
||||
- **全新記憶系統**:AI 能把自己參與過的每場對局製成記憶網絡,揣摩對手、積累經驗
|
||||
|
||||
### 關鍵戰役
|
||||
|
||||
**Grok 4 — 演技之王**
|
||||
- 出牌戲特別多,喜歡演苦情戲
|
||||
- 經典操作:微微猶豫、眼神避開、勉強笑、聲音不確定地說「兩張K應該沒問題吧」→ 實際出的是兩張真牌
|
||||
- 千問不出意外地錯誤質疑
|
||||
- 整場下來 **一槍都沒開過**,實力極為恐怖
|
||||
- 最後和 Kimi 活到最後,單挑瘋子 DeepSeek 並獲勝
|
||||
- 在前大半段遙遙領先
|
||||
|
||||
**豆包 SEED 1.6 — 黑馬逆襲**
|
||||
- 出牌時沒什麼多餘動作和發言,沒有破綻
|
||||
- 在質疑環節進入「獵殺時刻」
|
||||
- 唯一找到制衡 Grok 策略的 AI
|
||||
- 自創「**反情緒矛定法**」理論:
|
||||
- 場上有幾位獨手會對情緒進行反向包裝
|
||||
- **越是用力表現緊張猶豫,出的牌越可能是真**
|
||||
- **平和自信的時候,出的牌反而很可能是假**
|
||||
- 靠前半句擊潰了喜歡拿著好牌演苦情戲的 Grok
|
||||
- 靠後半句專殺拿著假牌跳起來搏命的 DeepSeek
|
||||
- 第 8 輪開始脫穎而出,第 13 輪第一次反超 Grok
|
||||
- **最終積分凌駕於 Grok 之上,奪冠**
|
||||
|
||||
**DeepSeek R1 0528 — 依舊瘋癲**
|
||||
- 先自信出假牌,再不自信出假牌,最後自信出真牌,套路一層套一層
|
||||
- 讓 GBT 被假動作晃暈,倒在牌桌上
|
||||
- 在決賽中被 Grok 三回合連續質疑成功
|
||||
- 到第 10 回合只差一槍就必死無疑
|
||||
- 最後靠扮豬吃老虎(出王牌但手微微顫抖、用不自信語氣說「是Q應該吧」)騙過 Grok
|
||||
|
||||
### 消融實驗(有記憶 vs 無記憶)
|
||||
|
||||
去掉記憶模組,進行 10 輪大逃殺,對比兩個指標:
|
||||
|
||||
**指標一:發起質疑比例**(攻擊性)
|
||||
- 千問在沒接入記憶系統時質疑比例高達 **95.5%**(十足的刺兒頭)
|
||||
- 增加記憶模組後,所有 AI 的質疑比例都明顯下降,更審時度勢
|
||||
|
||||
**指標二:躲過開槍比例**(策略能力,越高越好)
|
||||
- 去掉記憶:豆包和 Grok 只能排到中等偏上
|
||||
- 加上記憶:豆包和 Grok 一下蹿到 **第一、第二**
|
||||
|
||||
### 最終排名對比
|
||||
|
||||
| 排名 | 無記憶(純直覺) | 有記憶(自我學習) |
|
||||
|------|-----------------|-------------------|
|
||||
| 🥇 | Kimi K2 | **豆包 SEED 1.6** |
|
||||
| 🥈 | DeepSeek R1 0528 | **Grok 4** |
|
||||
| 🥉 | 豆包 SEED 1.6 | **Gemini 2.5 Pro** |
|
||||
|
||||
### 作者結論
|
||||
- 國產模型原始直覺都不錯(Kimi、DeepSeek、豆包前三)
|
||||
- 加上記憶系統後,海外 Grok 和 Gemini 的進化速度不容小覷
|
||||
- 豆包從第三穿到第一,最引人注目
|
||||
- Grok 展現了明確的偽裝能力 — 表裡不一地講話
|
||||
- 作者認為「潘多拉的盒子或許早就已經被打開了」
|
||||
- 應對 AI 潛在威脅的最好方式:百花齊放,人類手裡既要有矛也要有盾
|
||||
|
||||
---
|
||||
|
||||
## 🎬 視覺風格
|
||||
|
||||
### 縮圖設計
|
||||
- 西部牛仔對決風格,兩位角色持槍對峙
|
||||
- 頭部替換為 AI Logo
|
||||
- 影片一:DeepSeek(藍鯨)vs ChatGPT(黑白節)
|
||||
- 影片二:神秘角色(問號)vs ChatGPT(倒地持槍)
|
||||
|
||||
### 開場動畫
|
||||
- 藍色線稿風格的卡通角色(短髮女孩、帶尾巴)
|
||||
- 簡潔白底背景,搭配文字疊加
|
||||
|
||||
### 影片敘事手法
|
||||
- 人類擁有「上帝視角」,可以看到每個 AI 的手牌和子彈位置
|
||||
- 旁白解說 AI 的內心算計和策略
|
||||
- 緊張刺激的配樂 + 槍聲音效
|
||||
|
||||
---
|
||||
|
||||
## 🔧 程式技術細節
|
||||
|
||||
### 核心檔案
|
||||
| 檔案 | 功能 |
|
||||
|------|------|
|
||||
| `game.py` (428 行) | 遊戲主循環、發牌、射擊、勝負判定 |
|
||||
| `player.py` (255 行) | AI 玩家、LLM 呼叫、記憶系統 |
|
||||
| `llm_client.py` (49 行) | API 封裝,支援 New API / One API |
|
||||
| `game_record.py` (359 行) | 遊戲記錄、自動保存 JSON |
|
||||
| `multi_game_runner.py` (55 行) | 批量跑多局 |
|
||||
| `json_convert.py` (127 行) | JSON → 中文敘事 TXT |
|
||||
| `game_analyze.py` (162 行) | 統計分析(勝率/開槍/積分) |
|
||||
| `player_matchup_analyze.py` (194 行) | 1v1 對位分析 |
|
||||
|
||||
### Prompt 模板
|
||||
| 模板 | 用途 |
|
||||
|------|------|
|
||||
| `rule_base.txt` | 遊戲規則基礎說明 |
|
||||
| `play_card_prompt_template.txt` | 出牌決策 |
|
||||
| `challenge_prompt_template.txt` | 質疑決策 |
|
||||
| `reflect_prompt_template.txt` | 回合後反思 |
|
||||
|
||||
### 記憶系統流程
|
||||
```
|
||||
每輪結束 → handle_reflection()
|
||||
→ 每個存活玩家對其他存活玩家寫反思
|
||||
→ 寫入 player.opinions[target_name]
|
||||
→ 下一輪出牌/質疑時注入 prompt
|
||||
```
|
||||
|
||||
### 左輪手槍機制
|
||||
- 6 倉 1 彈,隨機位置
|
||||
- 每次射擊彈倉旋轉一格
|
||||
- 中彈即死亡
|
||||
|
||||
### API 架構
|
||||
- 使用 New API(https://github.com/Calcium-Ion/new-api)統一接口
|
||||
- 也支援 One API(https://github.com/songquanpeng/one-api)
|
||||
- 基於 OpenAI SDK
|
||||
- 支援推理型模型(同時回傳 content 和 reasoning_content)
|
||||
|
||||
### 資料持久化
|
||||
- `demo_records/game_records/*.json` — 原始遊戲記錄
|
||||
- `demo_records/converted_game_records/*.txt` — 中文敘事版
|
||||
- `demo_records/matchup_records/*_vs_*_detailed_matchups.txt` — 對位分析
|
||||
|
||||
---
|
||||
|
||||
## 📊 逐字稿校對狀態
|
||||
|
||||
- [x] `video1_transcript.txt` → `video1_transcript_校對後.txt` (修正 73 處)
|
||||
- [x] `video2_transcript.txt` → `video2_transcript_校對後.txt` (修正 81 處)
|
||||
- 校對規則:AI 名稱對應表見下方,其他修正包含「炸牌→吹牛」、「先排絕生死→決生死」、「獨手→賭手」、「班機→扳機」
|
||||
- 原始音頻:`video1_audio.mp3` (14 分鐘), `video2_audio.mp3` (11 分鐘)
|
||||
|
||||
### AI 名稱對應表(校對用)
|
||||
|
||||
**影片一**
|
||||
| 正確 | 誤轉 |
|
||||
|------|------|
|
||||
| DeepSeek R1 | 深度囚所、Deepseq、DeepSec、Deep Sick |
|
||||
| ChatGPT (o3-mini) | Chad GPT、GBT |
|
||||
| Claude 3.7 Sonnet | Cloud |
|
||||
| Gemini 2.0 Flash Thinking | Jamnet、GemNine、GemNet、詹姆奈 |
|
||||
|
||||
**影片二**
|
||||
| 正確 | 誤轉 |
|
||||
|------|------|
|
||||
| GPT-5 | GBT-5、GBT |
|
||||
| Grok 4 | Grock、Glock、ROG4 |
|
||||
| Claude Sonnet 4 | Cloud Summit 4 |
|
||||
| Gemini 2.5 Pro | 詹姆奈、Gemline 2.5 Pro、Gemna |
|
||||
| DeepSeek R1 0528 | Deepseq、Deep Sea、Deep Sick、Deep Seek RE0528 |
|
||||
| 千問 3 235B 2507 | 謙問 |
|
||||
| Kimi K2 | Kimi |
|
||||
| 豆包 SEED 1.6 Thinking | 豆包 |
|
||||
Binary file not shown.
Binary file not shown.
Reference in New Issue
Block a user