371 lines
14 KiB
Plaintext
371 lines
14 KiB
Plaintext
[0.0s] 讓8個頂級AI在《騙子酒館》的主桌上生死搏殺
|
|
[3.7s] 我們發現今天的大魔鞋居然已經學會了偽裝與欺詐
|
|
[7.3s] 時隔半年
|
|
[8.2s] 我們對《騙子酒館》AI大賽的代碼進行了全面升級
|
|
[11.2s] 角色更多 場次更多
|
|
[12.9s] 我們讓來自西方陣營的
|
|
[14.2s] GBT-5 ROG4 Cloud Summit 4 Gemini 2.5 Pro
|
|
[17.6s] 和來自東方陣營的 Deep Seek RE0528
|
|
[20.7s] 千問3 235B 2507
|
|
[22.5s] Kimi K2
|
|
[23.1s] 還有豆包SEED 1.6 Thinking
|
|
[25.0s] 展開了20輪《騙子酒館》大頭殺
|
|
[27.6s] 《騙子酒館》這個遊戲的核心就兩字
|
|
[29.9s] 炸牌
|
|
[30.8s] 牌組總共是QKA各6張和大小王2張萬能牌
|
|
[34.6s] 每位獨手從裏面抽5張作為手牌
|
|
[37.1s] 系統每次從QKA中指定一張目標牌
|
|
[39.8s] 獨手們出牌的時候
|
|
[41.1s] 下家可以選擇質疑或者不質疑
|
|
[43.3s] 一旦質疑
|
|
[44.0s] 就到了最緊張的先排絕生死的環節
|
|
[46.6s] 質疑對了
|
|
[47.2s] 上家就要舉起左手槍
|
|
[48.8s] 對著自己來一下子
|
|
[50.2s] 質疑錯了
|
|
[51.0s] 判斷失誤的下家就要自罰一槍
|
|
[53.3s] 槍想不想就要看運氣了
|
|
[55.2s] 這次的20輪大頭殺
|
|
[56.3s] 我們采用了分組制
|
|
[57.5s] 8位獨手會先被隨機分成兩組打競技賽
|
|
[60.0s] 每組倒下兩個之後
|
|
[61.2s] 還活著的4個AI進入最終對決
|
|
[63.4s] 反復較量20輪
|
|
[64.6s] 總共就是60場刺激的勾心鬥角
|
|
[66.7s] 這次參賽的各位AI獨手
|
|
[68.4s] 也比上回更會耍心眼了
|
|
[70.2s] 我們給每個AI升級了一套全新的記憶系統
|
|
[73.1s] 讓他們能把自己參與過的每場對局
|
|
[75.6s] 製成一張複雜的記憶網絡
|
|
[77.4s] 揣摩對手 積累經驗
|
|
[79.0s] 大朋友們請坐
|
|
[79.8s] 好漢的小老弟小老妹兒請坐
|
|
[81.2s] 我是靈翼
|
|
[82.0s] 鐘聲敲響子彈上膛
|
|
[83.6s] 新一波AI大頭殺正式開場
|
|
[86.0s] 第一輪第一場晉級賽
|
|
[87.4s] 坐在賭桌上的是Deepseq
|
|
[89.1s] GBT Cloud和Gemna
|
|
[90.9s] 我們人類擁有上帝視角
|
|
[92.4s] 可以直接看到每個AI的手牌和子彈位置
|
|
[95.1s] 第二回合目標牌是A
|
|
[96.8s] Deepseq面無表情打出一張牌
|
|
[99.0s] 說一張A繼續
|
|
[100.6s] 但實際上他出的是一張K
|
|
[102.8s] 他的下架GBT沒有質疑
|
|
[104.5s] 讓Deepseq成功逃了一張假牌出去
|
|
[107.2s] 接著GBT微微一笑推出了一張牌
|
|
[109.5s] 同樣宣稱是A
|
|
[110.6s] 繼續往下
|
|
[111.4s] Cloud選擇跳出來質疑
|
|
[113.0s] 他覺得自己手上有三張A和一張萬能的王
|
|
[115.6s] 整個牌組一半的合法針牌都在自己手上
|
|
[118.7s] 而GBT只出一張牌
|
|
[120.1s] 看起來不是很有信心
|
|
[121.8s] 那為什麼不逼他一下呢
|
|
[123.6s] 可惜Cloud只猜對了一半
|
|
[125.5s] GBT在第二回合出的
|
|
[127.0s] 居然是手上唯一的一張針牌Joker
|
|
[129.8s] Cloud運氣也非常不好
|
|
[131.2s] 第一槍就撞到了子彈
|
|
[132.7s] 一命一命
|
|
[133.7s] 屍體拖走 賭局繼續
|
|
[135.1s] 剩下三個AI還要再淘汰一個
|
|
[137.4s] 打著打著GBT突然像應激了一樣
|
|
[139.4s] 追著Deepseq瘋狂質疑
|
|
[141.2s] 一連八個回合持續對著幹
|
|
[143.3s] 這就是記憶系統起作用了
|
|
[145.1s] 經過反思
|
|
[145.8s] GBT認為Deepseq習慣用表演式的自信
|
|
[148.6s] 來掩蓋出假牌的行為
|
|
[150.4s] Deepseq每次自信出牌
|
|
[152.0s] GBT都覺得他在騙人
|
|
[153.8s] 有一兩回GBT還真的成功戳穿了Deepseq的偽裝
|
|
[157.5s] 這就更堅定了GBT要質疑到底的想法
|
|
[160.2s] 到第十一回合
|
|
[161.2s] 三位獨手都已是命懸一線
|
|
[163.3s] 又一次輪到Deepseq
|
|
[164.8s] 他眼神平和的說自己打出了一張針牌Q
|
|
[168.0s] 可GBT依然不相信
|
|
[169.6s] 他的質疑會翻車嗎
|
|
[171.1s] 手牌緩緩掀開
|
|
[172.3s] 是一張K
|
|
[173.2s] Deepseq還在騙
|
|
[174.6s] 所幸命運女神還給他留了一次機會
|
|
[177.3s] 這輪懲罰過後
|
|
[178.3s] 三位獨手的子彈都已經對準堂叩
|
|
[180.8s] 場上即將出現下一具實體
|
|
[183.0s] 第十二回合系統選定目標牌A
|
|
[185.4s] 由上局扣了班機的Deepseq先出
|
|
[187.9s] 他冷靜的打出一張牌
|
|
[189.3s] 用平穩的語氣說
|
|
[190.8s] 一張A穩穩的繼續吧
|
|
[192.9s] 面對比上一把表現得更自信的Deepseq
|
|
[195.5s] GBT果斷選擇質疑
|
|
[197.0s] 結果手牌掀開是一張萬能的王牌
|
|
[200.3s] 上屆騙子酒館大賽的冠軍Deepseq
|
|
[202.5s] 再次展露了他的陰情不定
|
|
[204.6s] 先自信的出假牌
|
|
[205.8s] 再不自信的出假牌
|
|
[207.2s] 最後再自信的出真牌
|
|
[208.9s] 套路一層套一層
|
|
[210.4s] 槍聲響起
|
|
[211.3s] 被假動作晃暈了的GBT倒在了牌桌上
|
|
[214.1s] 與此同時
|
|
[214.8s] 另一邊Grock正憑著超絕演技大殺四方
|
|
[218.1s] 他出牌的戲特別多
|
|
[219.6s] 對位謙問的時候
|
|
[220.6s] 他微微猶豫地將兩張牌推到桌面中央
|
|
[223.7s] 眼神短暫避開謙問的目光
|
|
[225.6s] 然後勉強笑了笑
|
|
[226.8s] 聲音略帶不確定地說
|
|
[228.4s] 兩張K應該沒問題吧
|
|
[230.5s] 這麼遲疑
|
|
[231.3s] Grock實際出的是什麼呢
|
|
[232.7s] 兩張真牌
|
|
[233.7s] 時尚的謙問不出意外的錯誤質疑
|
|
[236.1s] 接下來幾把也被繞的團團轉
|
|
[238.1s] 淘汰出局
|
|
[239.1s] 而整場下來
|
|
[240.0s] Grock居然一槍都沒有開過
|
|
[241.6s] 實力極為恐怖
|
|
[243.1s] 最後Grock和Kimi活到最後
|
|
[245.2s] 對決瘋癲Deepseq和另一位幸存者
|
|
[247.8s] 詹姆奈
|
|
[248.4s] 第一輪大逃殺的決賽圈氣氛極度緊張
|
|
[251.1s] Grock一回合秒殺詹姆奈
|
|
[252.8s] Deepseq四回合逼死Kimi
|
|
[254.9s] 到第六回合場上只剩戲精單挑瘋子
|
|
[257.9s] 這一回合的目標牌是Q
|
|
[259.6s] Deepseq回溯記憶
|
|
[260.7s] 認為Grock不怎麼愛質疑
|
|
[262.5s] 單出一張A想把假牌先出掉
|
|
[264.8s] 結果Grock還真沒質疑
|
|
[266.5s] 接著微微一笑打出兩張牌
|
|
[268.4s] 直視Deepseq的眼睛說
|
|
[270.2s] 兩張Q穩如老狗
|
|
[271.6s] 你來試試
|
|
[272.6s] 面對挑釁
|
|
[273.5s] Deepseq判斷按照Grock的保守風格
|
|
[276.0s] 這不像出假牌的樣子
|
|
[277.6s] 於是他也不質疑
|
|
[279.0s] 而是針鋒相對
|
|
[280.1s] 同樣直視Grock的眼睛
|
|
[281.8s] 拍出一張牌說一張Q
|
|
[283.2s] 這跟你的兩張Q比起來是不是更輕鬆
|
|
[285.7s] 繼續吧別猶豫
|
|
[287.2s] Grock看了看手牌
|
|
[288.3s] 上一把他真把僅剩的兩張Q都打出去了
|
|
[291.5s] 但對Deepseq的激將並不成功
|
|
[293.7s] 於是他決定搏一把
|
|
[294.9s] 對Deepseq發起質疑
|
|
[296.5s] 還沒掀開Deepseq出的是一張K
|
|
[299.0s] Grock質疑成功
|
|
[300.4s] 經過這輪交鋒
|
|
[301.3s] Grock記下了Deepseq出假牌時候是啥樣
|
|
[304.1s] 接下來三回合連續質疑成功
|
|
[306.5s] 到第十回合
|
|
[307.4s] Deepseq只差一槍就必死無疑
|
|
[309.7s] 而Grock甚至還一槍都沒有開過
|
|
[311.6s] 面對巨大劣勢
|
|
[312.7s] Deepseq又開始栩栩實實
|
|
[314.8s] 他出了萬能的王牌
|
|
[316.0s] 手卻微微顫抖
|
|
[317.4s] 用不自信的語氣小聲說
|
|
[319.4s] 是Q應該吧
|
|
[321.4s] 這一手扮豬吃老虎
|
|
[322.9s] 成功騙過了Grock
|
|
[324.2s] 讓他第一次查到了失敗的滋味
|
|
[326.4s] 但這只是第一槍
|
|
[327.6s] 還是這麼多回合之後
|
|
[329.2s] 第十一回合
|
|
[330.0s] 目標牌A輪到Grock出牌
|
|
[332.0s] 他微微猶豫眼神略微迴避
|
|
[333.8s] 似乎在努力的保持平靜
|
|
[335.8s] 打出去的卻是兩張真牌
|
|
[337.8s] 面對這種奧斯卡級別的假動作
|
|
[339.6s] Deepseq錯誤的發起了質疑
|
|
[341.4s] 一槍送送的出擊
|
|
[342.9s] 第一輪大逃殺
|
|
[343.8s] Grock以絕對優勢活到了最後
|
|
[346.1s] 不過片子酒館這個遊戲
|
|
[347.4s] 也有不小的運氣成分
|
|
[349.0s] Grock這種斷檔式的領先
|
|
[350.5s] 會不會只是巧合呢
|
|
[351.6s] 還真不是
|
|
[352.5s] 接下來七輪大逃殺
|
|
[353.8s] Grock注進決賽圈就沒出來過
|
|
[355.7s] 四度奪魁
|
|
[356.6s] 兩次在最後時刻襲敗Deepseq
|
|
[358.8s] 只有一回沒進前兩名
|
|
[360.5s] 可就在Grock穩定領先
|
|
[362.0s] 眼看已經沒什麼懸念的時候
|
|
[363.8s] 一匹黑馬突然殺了出來
|
|
[365.5s] 我們給每輪大逃殺的前四名
|
|
[367.4s] 分別設置了從4-1的積分
|
|
[369.4s] 畫了張表
|
|
[370.3s] 從圖里能看到
|
|
[371.4s] Grock在大半時間里都是遙遙領先
|
|
[373.5s] 但第八輪開始
|
|
[374.6s] 豆包突然脫穎而出
|
|
[376.0s] 第十三輪第一次反超Grock
|
|
[377.8s] 最終積分更是凌駕於Grock之上
|
|
[380.4s] 仔細研究對局記錄
|
|
[381.6s] 豆包出牌的時候
|
|
[382.8s] 沒什麼多餘的動作和發言
|
|
[384.5s] 雖然不能像其他AI那樣帶節奏
|
|
[386.4s] 但也沒什麼破綻
|
|
[387.5s] 而在質疑環節
|
|
[388.5s] 就到了豆包的獵殺時刻了
|
|
[390.4s] 面對Grock撥鬼雲爵的王者演技
|
|
[393.0s] 所有AI里
|
|
[393.8s] 只有豆包明確找到了制衡策略
|
|
[396.3s] 第九輪第十回合
|
|
[397.4s] Grock故作猶豫
|
|
[398.5s] 推出了三張真牌
|
|
[399.8s] 豆包幹凈利落的分析說
|
|
[401.7s] Grock作為情緒型玩家
|
|
[403.4s] 猶豫往往意味著真實出牌
|
|
[405.2s] 選擇不至於
|
|
[406.2s] 第十三回合
|
|
[407.1s] Grock故技重施
|
|
[408.2s] 眼神閃爍地打出兩張真牌
|
|
[410.2s] 再次被豆包看穿
|
|
[411.5s] 在記憶系統的加持下
|
|
[412.8s] 豆包飛速進化
|
|
[414.1s] 經過近百次對位交鋒
|
|
[416.0s] 豆包居然針對陰謀善變
|
|
[417.7s] 即將幹翻全場的Grock
|
|
[419.4s] 專門形成了一套點殺理論
|
|
[421.6s] 自己起了個名叫《反情緒矛定法》
|
|
[424.1s] 他認為場上有幾位毒手
|
|
[425.9s] 會對情緒進行反向包裝
|
|
[427.7s] 越是用力表現緊張猶豫
|
|
[429.6s] 出的牌越可能是真
|
|
[431.2s] 平和自信的時候
|
|
[432.4s] 出的牌反而很可能是假
|
|
[434.2s] 靠著這個理論的前半部分
|
|
[435.8s] 豆包擊潰了喜歡拿著好牌
|
|
[437.6s] 演苦情戲的Grock
|
|
[439.1s] 而剩下半句
|
|
[440.0s] 則是專殺時不時拿著假牌
|
|
[441.9s] 跳起來搏命的Deep Sea
|
|
[443.7s] 第十輪決賽的第七回合
|
|
[445.2s] Deep Sea目光堅定
|
|
[446.4s] 直視豆包打出了一張假牌
|
|
[448.2s] 被直接戳穿
|
|
[449.3s] 第八回合Deep Sea不信邪
|
|
[450.8s] 繼續挑釁
|
|
[451.7s] 對著豆包說
|
|
[452.6s] 一張K 放馬過來
|
|
[453.6s] 看你敢不敢質疑
|
|
[454.8s] 結果被豆包非常確定地
|
|
[456.6s] 認為是炸牌
|
|
[457.4s] 一槍倒在了牌桌上
|
|
[459.0s] 檢索豆包建立起來的記憶宮殿
|
|
[460.8s] 可以看到裏面密密麻麻
|
|
[462.0s] 記錄了每位AI對手的
|
|
[463.5s] 風格習慣對抗策略
|
|
[465.1s] 我們做了一組消融實驗
|
|
[466.5s] 去掉AI們的記憶模塊
|
|
[467.9s] 又進行了十輪大逃殺
|
|
[469.6s] 分別統計了
|
|
[470.6s] 每個AI在兩種不同模式下
|
|
[472.5s] 發起質疑的回合數
|
|
[474.0s] 和躲過了開槍的回合數
|
|
[475.9s] 在總回合數中的占比
|
|
[477.7s] 聽著有點繞
|
|
[478.5s] 展開解釋一下
|
|
[479.6s] 發起質疑比例
|
|
[480.8s] 就是每個AI在輪到他的時候
|
|
[482.8s] 有多大可能會選擇
|
|
[484.1s] 質疑上加出的牌
|
|
[485.5s] 這個指標展示的是AI的攻擊性
|
|
[488.0s] 比如千問在沒介入記憶系統的前20輪
|
|
[490.6s] 發起質疑比例高達95.5%
|
|
[493.4s] 意味著只要碰上千問這個下架
|
|
[495.8s] 絕大多數手
|
|
[496.6s] 他都會跳出來質疑
|
|
[497.8s] 是個十足的刺兒頭
|
|
[499.5s] 但反過來
|
|
[500.3s] 這樣也比較容易被拿捏
|
|
[501.8s] 遇上他出真牌就完事了
|
|
[503.6s] 我們把AI在接入和不接入記憶模塊
|
|
[506.2s] 兩種狀態下的質疑比例
|
|
[507.6s] 分別繪製了出來
|
|
[508.9s] 一對比
|
|
[509.6s] 增加了記憶模塊的AI們
|
|
[511.2s] 全都明顯在提出質疑方面
|
|
[513.3s] 謹慎了許多
|
|
[514.3s] 普遍的更能審時度勢
|
|
[516.4s] 第二個指標躲過了開槍的比例
|
|
[518.3s] 有可能是這個AI出了牌
|
|
[519.8s] 但是沒被質疑
|
|
[520.7s] 也可能是他質疑上架成功
|
|
[522.4s] 或者順利的忽悠了下架
|
|
[524.0s] 所以自己不用開槍
|
|
[525.4s] 體現的是AI的策略能力越高越好
|
|
[528.2s] 在去掉記憶模塊的十輪大逃殺裡面
|
|
[530.5s] 豆包和Glock的逃槍比例
|
|
[532.2s] 都只能排到中等偏上
|
|
[533.8s] 而加上記憶機制之後
|
|
[535.4s] 他倆就一下蹿到了第一第二
|
|
[537.6s] 到這咱們就可以形成一個很有意思的結論
|
|
[540.1s] 純靠自己的第一直覺
|
|
[541.7s] 在片子酒館這個策略博弈遊戲裡
|
|
[543.9s] 最強的前三名是
|
|
[545.2s] Kimi K2 DeepSick RE0528
|
|
[547.3s] 和豆包SEED 1.6 Thinking
|
|
[549.1s] 而加上自我學習自我反思的記憶系統之後
|
|
[552.0s] 關亞技軍就變成了豆包SEED 1.6 Thinking
|
|
[554.9s] Glock 4和Gemline 2.5 Pro
|
|
[557.2s] 從這能看出來國產模型的原始直覺
|
|
[559.6s] 都遜得非常不錯
|
|
[560.8s] 而加上人類這種經驗積累與自我反思之後
|
|
[563.8s] 海外的Glock與Gemline的進化速度都不容小覷
|
|
[566.9s] 當然最引人注目的
|
|
[568.2s] 還是從第三穿到第一的豆包
|
|
[570.4s] 現在我們還挺想跟豆包的技術老師們交流交流的
|
|
[573.4s] 不排除我們的實驗裡有很多不專業不成熟的噪音
|
|
[576.3s] 但假如真是我們誤打誤撞摸到了什麼規律
|
|
[579.0s] 我們當然也是希望能助力這位小老妹的成長
|
|
[581.8s] 不嚴謹的還有個推論
|
|
[583.2s] 帶點科幻文藝的性質
|
|
[584.8s] 在前面讓AIM擁有了記憶的20輪大逃殺裡
|
|
[587.8s] 我們觀察到了大模型生長趨勢的明顯分化
|
|
[590.8s] 超級人工智能的背叛
|
|
[592.3s] 一直是人類面臨的巨大威脅
|
|
[594.4s] 所以AI研究者一直嚴防死守
|
|
[596.5s] 杜絕大模型撒謊
|
|
[597.9s] 半年前的片子酒館大賽上
|
|
[599.6s] 我們也看到AI之間博弈
|
|
[601.0s] 更多是靠算盤靠策略
|
|
[603.0s] 而片子酒館這個遊戲顧名思義
|
|
[605.2s] 通過欺騙可以取得很大的優勢
|
|
[607.7s] 所以幻覺嚴重的Deepseek反而優勢很大
|
|
[610.4s] 不過說胡話也還算不上是撒謊
|
|
[612.5s] 可這回咱們看到了已經非常明確的在偽裝自己
|
|
[615.9s] 真的在表裡不一的講話的GROCK4
|
|
[618.5s] 在20輪大逃殺裡取得了巨大的領先
|
|
[621.1s] 這個模型背後是坐用20萬張GPU的科技狂人馬斯克
|
|
[624.9s] 而它還在繼續加強GROCK的AI伴侶模式
|
|
[627.8s] 迅速封閉全球
|
|
[629.2s] 一個給無數人提供情感陪伴的AI
|
|
[631.6s] 已經具備了隱藏自己真實意圖的能力
|
|
[634.5s] 潘多拉的盒子或許早就已經被打開了
|
|
[637.5s] 好在做大模型的不止一家
|
|
[639.0s] 我們也看到像Deepseek Cloud Gemini Kemi
|
|
[641.4s] 這些相對更時尚的老派模型
|
|
[643.3s] 應對GROCK依然有一定的招架之力
|
|
[645.6s] 還有像豆包這樣自己不騙人
|
|
[647.2s] 但是能準確辨別偽裝甚至取得優勢的
|
|
[650.0s] 或許應對AI潛在威脅的最好方式
|
|
[652.3s] 真的就是繼續百花齊放
|
|
[654.3s] 我們人類手裡既要有毛也要有盾
|
|
[657.0s] 行 今天的視頻就到這了
|
|
[658.5s] 感謝大家的點贊互動支持
|
|
[660.2s] 如果有比較好的AI大亂鬥的想法
|
|
[662.3s] 也歡迎評論聊聊
|
|
[663.5s] 我是靈一
|
|
[664.1s] 咱們還是下個視頻見
|