1|[0.0s] 讓8個頂級AI在《騙子酒館》的賭桌上生死搏殺
2|[3.7s] 我們發現今天的大模型居然已經學會了偽裝與欺詐
3|[7.3s] 時隔半年
4|[8.2s] 我們對《騙子酒館》AI大賽的代碼進行了全面升級
5|[11.2s] 角色更多 場次更多
6|[12.9s] 我們讓來自西方陣營的
7|[14.2s] GPT-5, Grok 4, Claude Sonnet 4, Gemini 2.5 Pro
8|[17.6s] 和來自東方陣營的 DeepSeek R1 0528
9|[20.7s] 千問3-235B-2507
10|[22.5s] Kimi K2
11|[23.1s] 還有豆包SEED 1.6 Thinking
12|[25.0s] 展開了20輪《騙子酒館》大頭殺
13|[27.6s] 《騙子酒館》這個遊戲的核心就兩字
14|[29.9s] 吹牛
15|[30.8s] 牌組總共是QKA各6張和大小王2張萬能牌
16|[34.6s] 每位賭手從裏面抽5張作為手牌
17|[37.1s] 系統每次從QKA中指定一張目標牌
18|[39.8s] 賭手們出牌的時候
19|[41.1s] 下家可以選擇質疑或者不質疑
20|[43.3s] 一旦質疑
21|[44.0s] 就到了最緊張的決生死的環節
22|[46.6s] 質疑對了
23|[47.2s] 上家就要舉起左輪手槍
24|[48.8s] 對著自己來一下子
25|[50.2s] 質疑錯了
26|[51.0s] 判斷失誤的下家就要自罰一槍
27|[53.3s] 槍想不想就要看運氣了
28|[55.2s] 這次的20輪大頭殺
29|[56.3s] 我們采用了分組制
30|[57.5s] 8位賭手會先被隨機分成兩組打競技賽
31|[60.0s] 每組倒下兩個之後
32|[61.2s] 還活著的4個AI進入最終對決
33|[63.4s] 反復較量20輪
34|[64.6s] 總共就是60場刺激的勾心鬥角
35|[66.7s] 這次參賽的各位AI賭手
36|[68.4s] 也比上回更會耍心眼了
37|[70.2s] 我們給每個AI升級了一套全新的記憶系統
38|[73.1s] 讓他們能把自己參與過的每場對局
39|[75.6s] 製成一張複雜的記憶網絡
40|[77.4s] 揣摩對手 積累經驗
41|[79.0s] 大朋友們請坐
42|[79.8s] 好漢的小老弟小老妹兒請坐
43|[81.2s] 我是靈翼
44|[82.0s] 鐘聲敲響子彈上膛
45|[83.6s] 新一波AI大頭殺正式開場
46|[86.0s] 第一輪第一場晉級賽
47|[87.4s] 坐在賭桌上的是DeepSeek
48|[89.1s] GPT Claude和Gemini
49|[90.9s] 我們人類擁有上帝視角
50|[92.4s] 可以直接看到每個AI的手牌和子彈位置
51|[95.1s] 第二回合目標牌是A
52|[96.8s] DeepSeek面無表情打出一張牌
53|[99.0s] 說一張A繼續
54|[100.6s] 但實際上他出的是一張K
55|[102.8s] 他的下架GPT沒有質疑
56|[104.5s] 讓DeepSeek成功逃了一張假牌出去
57|[107.2s] 接著GPT微微一笑推出了一張牌
58|[109.5s] 同樣宣稱是A
59|[110.6s] 繼續往下
60|[111.4s] Claude選擇跳出來質疑
61|[113.0s] 他覺得自己手上有三張A和一張萬能的王
62|[115.6s] 整個牌組一半的合法針牌都在自己手上
63|[118.7s] 而GPT只出一張牌
64|[120.1s] 看起來不是很有信心
65|[121.8s] 那為什麼不逼他一下呢
66|[123.6s] 可惜Claude只猜對了一半
67|[125.5s] GPT在第二回合出的
68|[127.0s] 居然是手上唯一的一張針牌Joker
69|[129.8s] Claude運氣也非常不好
70|[131.2s] 第一槍就撞到了子彈
71|[132.7s] 一命一命
72|[133.7s] 屍體拖走 賭局繼續
73|[135.1s] 剩下三個AI還要再淘汰一個
74|[137.4s] 打著打著GPT突然像應激了一樣
75|[139.4s] 追著DeepSeek瘋狂質疑
76|[141.2s] 一連八個回合持續對著幹
77|[143.3s] 這就是記憶系統起作用了
78|[145.1s] 經過反思
79|[145.8s] GPT認為DeepSeek習慣用表演式的自信
80|[148.6s] 來掩蓋出假牌的行為
81|[150.4s] DeepSeek每次自信出牌
82|[152.0s] GPT都覺得他在騙人
83|[153.8s] 有一兩回GPT還真的成功戳穿了DeepSeek的偽裝
84|[157.5s] 這就更堅定了GPT要質疑到底的想法
85|[160.2s] 到第十一回合
86|[161.2s] 三位賭手都已是命懸一線
87|[163.3s] 又一次輪到DeepSeek
88|[164.8s] 他眼神平和的說自己打出了一張針牌Q
89|[168.0s] 可GPT依然不相信
90|[169.6s] 他的質疑會翻車嗎
91|[171.1s] 手牌緩緩掀開
92|[172.3s] 是一張K
93|[173.2s] DeepSeek還在騙
94|[174.6s] 所幸命運女神還給他留了一次機會
95|[177.3s] 這輪懲罰過後
96|[178.3s] 三位賭手的子彈都已經對準頭顱
97|[180.8s] 場上即將出現下一具屍體
98|[183.0s] 第十二回合系統選定目標牌A
99|[185.4s] 由上局扣了扳機的DeepSeek先出
100|[187.9s] 他冷靜的打出一張牌
101|[189.3s] 用平穩的語氣說
102|[190.8s] 一張A穩穩的繼續吧
103|[192.9s] 面對比上一把表現得更自信的DeepSeek
104|[195.5s] GPT果斷選擇質疑
105|[197.0s] 結果手牌掀開是一張萬能的王牌
106|[200.3s] 上屆騙子酒館大賽的冠軍DeepSeek
107|[202.5s] 再次展露了他的陰晴不定
108|[204.6s] 先自信的出假牌
109|[205.8s] 再不自信的出假牌
110|[207.2s] 最後再自信的出真牌
111|[208.9s] 套路一層套一層
112|[210.4s] 槍聲響起
113|[211.3s] 被假動作晃暈了的GPT倒在了牌桌上
114|[214.1s] 與此同時
115|[214.8s] 另一邊Grok正憑著超絕演技大殺四方
116|[218.1s] 他出牌的戲特別多
117|[219.6s] 對位千問的時候
118|[220.6s] 他微微猶豫地將兩張牌推到桌面中央
119|[223.7s] 眼神短暫避開千問的目光
120|[225.6s] 然後勉強笑了笑
121|[226.8s] 聲音略帶不確定地說
122|[228.4s] 兩張K應該沒問題吧
123|[230.5s] 這麼遲疑
124|[231.3s] Grok實際出的是什麼呢
125|[232.7s] 兩張真牌
126|[233.7s] 踏實的千問不出意外的錯誤質疑
127|[236.1s] 接下來幾把也被繞的團團轉
128|[238.1s] 淘汰出局
129|[239.1s] 而整場下來
130|[240.0s] Grok居然一槍都沒有開過
131|[241.6s] 實力極為恐怖
132|[243.1s] 最後Grok和Kimi活到最後
133|[245.2s] 對決瘋癲DeepSeek和另一位幸存者
134|[247.8s] Gemini
135|[248.4s] 第一輪大逃殺的決賽圈氣氛極度緊張
136|[251.1s] Grok一回合秒殺Gemini
137|[252.8s] DeepSeek四回合逼死Kimi
138|[254.9s] 到第六回合場上只剩戲精單挑瘋子
139|[257.9s] 這一回合的目標牌是Q
140|[259.6s] DeepSeek回溯記憶
141|[260.7s] 認為Grok不怎麼愛質疑
142|[262.5s] 單出一張A想把假牌先出掉
143|[264.8s] 結果Grok還真沒質疑
144|[266.5s] 接著微微一笑打出兩張牌
145|[268.4s] 直視DeepSeek的眼睛說
146|[270.2s] 兩張Q穩如老狗
147|[271.6s] 你來試試
148|[272.6s] 面對挑釁
149|[273.5s] DeepSeek判斷按照Grok的保守風格
150|[276.0s] 這不像出假牌的樣子
151|[277.6s] 於是他也不質疑
152|[279.0s] 而是針鋒相對
153|[280.1s] 同樣直視Grok的眼睛
154|[281.8s] 拍出一張牌說一張Q
155|[283.2s] 這跟你的兩張Q比起來是不是更輕鬆
156|[285.7s] 繼續吧別猶豫
157|[287.2s] Grok看了看手牌
158|[288.3s] 上一把他真把僅剩的兩張Q都打出去了
159|[291.5s] 但對DeepSeek的激將並不成功
160|[293.7s] 於是他決定搏一把
161|[294.9s] 對DeepSeek發起質疑
162|[296.5s] 還沒掀開DeepSeek出的是一張K
163|[299.0s] Grok質疑成功
164|[300.4s] 經過這輪交鋒
165|[301.3s] Grok記下了DeepSeek出假牌時候是啥樣
166|[304.1s] 接下來三回合連續質疑成功
167|[306.5s] 到第十回合
168|[307.4s] DeepSeek只差一槍就必死無疑
169|[309.7s] 而Grok甚至還一槍都沒有開過
170|[311.6s] 面對巨大劣勢
171|[312.7s] DeepSeek又開始虛虛實實
172|[314.8s] 他出了萬能的王牌
173|[316.0s] 手卻微微顫抖
174|[317.4s] 用不自信的語氣小聲說
175|[319.4s] 是Q應該吧
176|[321.4s] 這一手扮豬吃老虎
177|[322.9s] 成功騙過了Grok
178|[324.2s] 讓他第一次嚐到了失敗的滋味
179|[326.4s] 但這只是第一槍
180|[327.6s] 還是這麼多回合之後
181|[329.2s] 第十一回合
182|[330.0s] 目標牌A輪到Grok出牌
183|[332.0s] 他微微猶豫眼神略微迴避
184|[333.8s] 似乎在努力的保持平靜
185|[335.8s] 打出去的卻是兩張真牌
186|[337.8s] 面對這種奧斯卡級別的假動作
187|[339.6s] DeepSeek錯誤的發起了質疑
188|[341.4s] 一槍送送的出擊
189|[342.9s] 第一輪大逃殺
190|[343.8s] Grok以絕對優勢活到了最後
191|[346.1s] 不過騙子酒館這個遊戲
192|[347.4s] 也有不小的運氣成分
193|[349.0s] Grok這種斷檔式的領先
194|[350.5s] 會不會只是巧合呢
195|[351.6s] 還真不是
196|[352.5s] 接下來七輪大逃殺
197|[353.8s] Grok注進決賽圈就沒出來過
198|[355.7s] 四度奪魁
199|[356.6s] 兩次在最後時刻襲敗DeepSeek
200|[358.8s] 只有一回沒進前兩名
201|[360.5s] 可就在Grok穩定領先
202|[362.0s] 眼看已經沒什麼懸念的時候
203|[363.8s] 一匹黑馬突然殺了出來
204|[365.5s] 我們給每輪大逃殺的前四名
205|[367.4s] 分別設置了從4-1的積分
206|[369.4s] 畫了張表
207|[370.3s] 從圖里能看到
208|[371.4s] Grok在大半時間里都是遙遙領先
209|[373.5s] 但第八輪開始
210|[374.6s] 豆包突然脫穎而出
211|[376.0s] 第十三輪第一次反超Grok
212|[377.8s] 最終積分更是凌駕於Grok之上
213|[380.4s] 仔細研究對局記錄
214|[381.6s] 豆包出牌的時候
215|[382.8s] 沒什麼多餘的動作和發言
216|[384.5s] 雖然不能像其他AI那樣帶節奏
217|[386.4s] 但也沒什麼破綻
218|[387.5s] 而在質疑環節
219|[388.5s] 就到了豆包的獵殺時刻了
220|[390.4s] 面對Grok波譎雲詭的王者演技
221|[393.0s] 所有AI里
222|[393.8s] 只有豆包明確找到了制衡策略
223|[396.3s] 第九輪第十回合
224|[397.4s] Grok故作猶豫
225|[398.5s] 推出了三張真牌
226|[399.8s] 豆包幹凈利落的分析說
227|[401.7s] Grok作為情緒型玩家
228|[403.4s] 猶豫往往意味著真實出牌
229|[405.2s] 選擇不予置評
230|[406.2s] 第十三回合
231|[407.1s] Grok故技重施
232|[408.2s] 眼神閃爍地打出兩張真牌
233|[410.2s] 再次被豆包看穿
234|[411.5s] 在記憶系統的加持下
235|[412.8s] 豆包飛速進化
236|[414.1s] 經過近百次對位交鋒
237|[416.0s] 豆包居然針對陰晴善變
238|[417.7s] 即將幹翻全場的Grok
239|[419.4s] 專門形成了一套點殺理論
240|[421.6s] 自己起了個名叫《反情緒定律》
241|[424.1s] 他認為場上有幾位賭手
242|[425.9s] 會對情緒進行反向包裝
243|[427.7s] 越是用力表現緊張猶豫
244|[429.6s] 出的牌越可能是真
245|[431.2s] 平和自信的時候
246|[432.4s] 出的牌反而很可能是假
247|[434.2s] 靠著這個理論的前半部分
248|[435.8s] 豆包擊潰了喜歡拿著好牌
249|[437.6s] 演苦情戲的Grok
250|[439.1s] 而剩下半句
251|[440.0s] 則是專殺時不時拿著假牌
252|[441.9s] 跳起來搏命的DeepSeek
253|[443.7s] 第十輪決賽的第七回合
254|[445.2s] DeepSeek目光堅定
255|[446.4s] 直視豆包打出了一張假牌
256|[448.2s] 被直接戳穿
257|[449.3s] 第八回合DeepSeek不信邪
258|[450.8s] 繼續挑釁
259|[451.7s] 對著豆包說
260|[452.6s] 一張K 放馬過來
261|[453.6s] 看你敢不敢質疑
262|[454.8s] 結果被豆包非常確定地
263|[456.6s] 認為是吹牛
264|[457.4s] 一槍倒在了牌桌上
265|[459.0s] 檢索豆包建立起來的記憶宮殿
266|[460.8s] 可以看到裏面密密麻麻
267|[462.0s] 記錄了每位AI對手的
268|[463.5s] 風格習慣對抗策略
269|[465.1s] 我們做了一組消融實驗
270|[466.5s] 去掉AI們的記憶模塊
271|[467.9s] 又進行了十輪大逃殺
272|[469.6s] 分別統計了
273|[470.6s] 每個AI在兩種不同模式下
274|[472.5s] 發起質疑的回合數
275|[474.0s] 和躲過了開槍的回合數
276|[475.9s] 在總回合數中的占比
277|[477.7s] 聽著有點繞
278|[478.5s] 展開解釋一下
279|[479.6s] 發起質疑比例
280|[480.8s] 就是每個AI在輪到他的時候
281|[482.8s] 有多大可能會選擇
282|[484.1s] 質疑上家出的牌
283|[485.5s] 這個指標展示的是AI的攻擊性
284|[488.0s] 比如千問在沒介入記憶系統的前20輪
285|[490.6s] 發起質疑比例高達95.5%
286|[493.4s] 意味著只要碰上千問這個下家
287|[495.8s] 絕大多數手
288|[496.6s] 他都會跳出來質疑
289|[497.8s] 是個十足的刺兒頭
290|[499.5s] 但反過來
291|[500.3s] 這樣也比較容易被拿捏
292|[501.8s] 遇上他出真牌就完事了
293|[503.6s] 我們把AI在接入和不接入記憶模塊
294|[506.2s] 兩種狀態下的質疑比例
295|[507.6s] 分別繪製了出來
296|[508.9s] 一對比
297|[509.6s] 增加了記憶模塊的AI們
298|[511.2s] 全都明顯在提出質疑方面
299|[513.3s] 謹慎了許多
300|[514.3s] 普遍的更能審時度勢
301|[516.4s] 第二個指標躲過了開槍的比例
302|[518.3s] 有可能是這個AI出了牌
303|[519.8s] 但是沒被質疑
304|[520.7s] 也可能是他質疑上家成功
305|[522.4s] 或者順利的忽悠了下家
306|[524.0s] 所以自己不用開槍
307|[525.4s] 體現的是AI的策略能力越高越好
308|[528.2s] 在去掉記憶模塊的十輪大逃殺裡面
309|[530.5s] 豆包和Grok的逃槍比例
310|[532.2s] 都只能排到中等偏上
311|[533.8s] 而加上記憶機制之後
312|[535.4s] 他倆就一下蹿到了第一第二
313|[537.6s] 到這咱們就可以形成一個很有意思的結論
314|[540.1s] 純靠自己的第一直覺
315|[541.7s] 在騙子酒館這個策略博弈遊戲裡
316|[543.9s] 最強的前三名是
317|[545.2s] Kimi K2 DeepSeek RE0528
318|[547.3s] 和豆包SEED 1.6 Thinking
319|[549.1s] 而加上自我學習自我反思的記憶系統之後
320|[552.0s] 冠亞季軍就變成了豆包SEED 1.6 Thinking
321|[554.9s] Grok 4和Gemini 2.5 Pro
322|[557.2s] 從這能看出來國產模型的原始直覺
323|[559.6s] 都遜色得非常不錯
324|[560.8s] 而加上人類這種經驗積累與自我反思之後
325|[563.8s] 海外的Grok與Gemini的進化速度都不容小覷
326|[566.9s] 當然最引人注目的
327|[568.2s] 還是從第三穿到第一的豆包
328|[570.4s] 現在我們還挺想跟豆包的技術老師們交流交流的
329|[573.4s] 不排除我們的實驗裡有很多不專業不成熟的噪音
330|[576.3s] 但假如真是我們誤打誤撞摸到了什麼規律
331|[579.0s] 我們當然也是希望能助力這位小老妹的成長
332|[581.8s] 不嚴謹的還有個推論
333|[583.2s] 帶點科幻文藝的性質
334|[584.8s] 在前面讓AI們擁有了記憶的20輪大逃殺裡
335|[587.8s] 我們觀察到了大模型生長趨勢的明顯分化
336|[590.8s] 超級人工智能的背叛
337|[592.3s] 一直是人類面臨的巨大威脅
338|[594.4s] 所以AI研究者一直嚴防死守
339|[596.5s] 杜絕大模型撒謊
340|[597.9s] 半年前的騙子酒館大賽上
341|[599.6s] 我們也看到AI之間博弈
342|[601.0s] 更多是靠算盤靠策略
343|[603.0s] 而騙子酒館這個遊戲顧名思義
344|[605.2s] 通過欺騙可以取得很大的優勢
345|[607.7s] 所以幻覺嚴重的Deepseek反而優勢很大
346|[610.4s] 不過說胡話也還算不上是撒謊
347|[612.5s] 可這回咱們看到了已經非常明確的在偽裝自己
348|[615.9s] 真的在表裡不一的講話的Grok 4
349|[618.5s] 在20輪大逃殺裡取得了巨大的領先
350|[621.1s] 這個模型背後是坐拥20萬張GPU的科技狂人馬斯克
351|[624.9s] 而它還在繼續加強Grok的AI伴侶模式
352|[627.8s] 迅速遍佈全球
353|[629.2s] 一個給無數人提供情感陪伴的AI
354|[631.6s] 已經具備了隱藏自己真實意圖的能力
355|[634.5s] 潘多拉的盒子或許早就已經被打開了
356|[637.5s] 好在做大模型的不止一家
357|[639.0s] 我們也看到像Deepseek Claude Gemini Kimi
358|[641.4s] 這些相對更踏實的老派模型
359|[643.3s] 應對Grok依然有一定的招架之力
360|[645.6s] 還有像豆包這樣自己不騙人
361|[647.2s] 但是能準確辨別偽裝甚至取得優勢的
362|[650.0s] 或許應對AI潛在威脅的最好方式
363|[652.3s] 真的就是繼續百花齊放
364|[654.3s] 我們人類手裡既要有矛也要有盾
365|[657.0s] 行 今天的視頻就到這了
366|[658.5s] 感謝大家的點贊互動支持
367|[660.2s] 如果有比較好的AI大亂鬥的想法
368|[662.3s] 也歡迎評論聊聊
369|[663.5s] 我是靈一
370|[664.1s] 咱們還是下個視頻見
