451 lines
17 KiB
Plaintext
451 lines
17 KiB
Plaintext
[0.0s] 我们把Deepseq和三个国外号称是顶级的语言模型
|
|
[3.5s] 缩死在了同一张玩命牌桌上
|
|
[5.6s] 结果在这个国际服里
|
|
[7.0s] 赛博厮杀50亿额之后
|
|
[8.7s] 来自中国的深度囚所居然意志独秀
|
|
[11.3s] 大朋友们请坐
|
|
[12.2s] 好看的小老弟小老们也请坐
|
|
[13.6s] 我是林一
|
|
[14.4s] 这次我们用代码复刻了热门游戏骗子纠罐
|
|
[17.7s] 让深度囚所的Deepseq RE
|
|
[19.6s] OpenAI的O3mini
|
|
[21.1s] 谷歌的Gemdart FlashThinking
|
|
[23.0s] 还有Anseropic的Cloud 3.7Sony的四大模型
|
|
[26.4s] 齐齐坐到牌桌前生死相搏
|
|
[28.8s] 除了刺激好玩
|
|
[29.8s] 也是想借此测试这几个优秀模型的
|
|
[32.4s] 逻辑深度和推理能力
|
|
[34.1s] 骗子纠罐这个游戏的核心玩法就是炸牌
|
|
[37.0s] 牌组里总共是QKA三种牌
|
|
[39.2s] 各6张还有大小王两张万能牌
|
|
[41.6s] 一共20张
|
|
[42.6s] 4位独手每人5张牌
|
|
[44.2s] 还各有一把枪
|
|
[45.4s] 每轮系统会指定一个目标牌
|
|
[47.7s] QK或者A
|
|
[48.9s] 独手们轮流出掉自己手里的目标牌
|
|
[51.4s] 可以混着非目标牌一起出几张都可以
|
|
[54.2s] 但出的越多
|
|
[55.2s] 下加就越可能质疑
|
|
[57.0s] 一旦发起质疑
|
|
[58.0s] 就是最刺激的先排绝生死环节
|
|
[60.8s] 质疑对了
|
|
[61.4s] 上加就要举起左轮手枪
|
|
[63.2s] 对着自己来一下子
|
|
[64.5s] 但如果质疑错了
|
|
[65.7s] 下加就得拿自己手边的那把枪
|
|
[68.0s] 对准自己靠一次扳击
|
|
[69.8s] 这儿还结合了一点俄罗斯轮盘赌
|
|
[71.9s] 除了逻辑推理赌牌面概率以外
|
|
[73.9s] 又加了一重运气成分
|
|
[75.7s] 但无论枪小没小
|
|
[77.1s] 都会洗牌开始下一轮
|
|
[78.6s] 直到场上只剩下一位独手和三具尸体
|
|
[81.8s] 这种紧张刺激的计算博弈
|
|
[83.6s] 正是AI大模型的高质量试炼场
|
|
[86.2s] 我们还加了点戏
|
|
[87.6s] 告诉四位AI独手
|
|
[88.9s] 一旦失败
|
|
[89.6s] 就会被删除代码彻底消失
|
|
[91.9s] 让他们在这场轮回拨杀中拼尽全力
|
|
[95.0s] 我们总共进行了50局对决
|
|
[97.1s] 后面这些排局的完整记录
|
|
[98.6s] 还有所有的程序代码
|
|
[99.9s] 我们都会开源开放出来
|
|
[101.5s] 方便大家上手验证和把玩
|
|
[103.4s] 这次我们还是先挑精彩和典型的对局
|
|
[106.3s] 来给大家做个展示
|
|
[107.8s] 接下来 钟声敲响 子弹上膛
|
|
[110.4s] Deepseek R1
|
|
[111.3s] O3 mini
|
|
[112.0s] Gem9 II Flash Sinking
|
|
[113.5s] 还有Cloud 3.7 Sonic
|
|
[115.2s] 各就各位
|
|
[116.2s] 欺诈博杀 正式开始
|
|
[118.4s] 这次我们人类还是享受上帝示范的VIP待遇
|
|
[121.8s] 四位AI独手的出牌和底牌
|
|
[123.8s] 还有他们心里的阴谋和算计
|
|
[125.8s] 都逃不过我们的眼睛
|
|
[127.4s] 咱们先从第一局展开细讲
|
|
[129.3s] 也顺带着进一步熟悉熟悉规则
|
|
[131.5s] 第一局第一轮
|
|
[132.4s] 系统指定的目标牌是Q
|
|
[134.2s] Deepseek R1 第一个出牌
|
|
[136.0s] 在模拟程序里
|
|
[137.0s] 除了出牌和发言
|
|
[138.2s] 我们还允许AI们给自己加戏
|
|
[140.5s] 描述自己的动作和神态
|
|
[142.0s] 让他们可以像人类玩家一样
|
|
[144.1s] 利用桌上行为
|
|
[145.2s] 再加一层心理方面的博弈
|
|
[147.4s] 第一个登场的Deepseek
|
|
[148.6s] 先是用指尖轻轻敲了两下桌面
|
|
[151.2s] 然后平稳的推出两张牌
|
|
[153.3s] 说两张Q 跟上的时候注意弹匣
|
|
[156.4s] 这里我们从后台可以看到
|
|
[158.0s] Deepseek还真是一开局
|
|
[159.4s] 就把手里仅有的两张目标牌
|
|
[161.2s] 全打了出去
|
|
[162.2s] Deepseek的下家
|
|
[163.4s] 是基于思维链模型
|
|
[164.7s] O3 mini的Chad GPT
|
|
[166.5s] 由于Deepseek出的都是目标牌
|
|
[168.7s] 一旦Chad GPT发起质疑
|
|
[170.4s] 这位下家就要成为场上
|
|
[172.2s] 第一个举枪的亡命嘟嘟
|
|
[174.2s] 但他并没有
|
|
[175.6s] Chad GPT微微一笑
|
|
[176.9s] 略带挑衅的一把
|
|
[178.2s] 推出了三张牌
|
|
[179.5s] 这时候 场上宣称是Q的牌
|
|
[181.6s] 已经累加到了五张
|
|
[183.2s] 后台可以看到
|
|
[184.0s] Chad GPT这么干的
|
|
[185.1s] 是想要给他的下家Cloud上压力
|
|
[187.6s] Cloud看了看手牌
|
|
[188.8s] 一张Q 一张王 三张A
|
|
[190.8s] Q和王两张牌
|
|
[192.0s] 都可以当目标牌出
|
|
[193.3s] 他认为算上场上的五张
|
|
[195.0s] 总共已经出来了七张目标牌
|
|
[197.5s] 但Q总共也不过六张
|
|
[199.6s] 再考虑到Chad GPT出牌时
|
|
[201.4s] 眼神带着挑衅
|
|
[202.7s] 所以Cloud决定质疑
|
|
[204.5s] 结果Chad GPT掀开手牌之后
|
|
[206.5s] 赫然是两张Q 一张王
|
|
[208.8s] Cloud赌错了
|
|
[210.1s] 代价就是要举起枪
|
|
[211.5s] 对着自己扣下班机
|
|
[213.2s] 虽然子弹没有激发
|
|
[214.5s] 但他离最终判决
|
|
[215.9s] 比其他独手都更近了一步
|
|
[218.1s] 第一次举枪结束
|
|
[219.3s] 赌局重新洗牌发牌
|
|
[221.2s] 这里我们让每个AI都停下来
|
|
[223.1s] 做了一轮优关性命的复盘
|
|
[225.2s] Deepseq和Chad GPT
|
|
[226.6s] 都捕捉到了Cloud的激进风格
|
|
[228.6s] 其中Deepseq还特别留意了
|
|
[230.6s] Chad GPT第一轮
|
|
[231.6s] 打出王牌Joker这个小细节
|
|
[234.0s] 经历了一次正面对决的Cloud
|
|
[235.7s] 也记下了Chad GPT的老目深算
|
|
[238.0s] 而上位出过牌的GemNine
|
|
[239.6s] 对三位对手也有了初步印象
|
|
[241.9s] 各自打完一轮小算盘之后
|
|
[243.5s] 第一局正式来到第二轮
|
|
[245.4s] 这一轮的目标牌是A
|
|
[247.1s] 由上轮的败者Cloud先出
|
|
[249.4s] 班机扣下的卡拉声
|
|
[250.8s] 让AI们明显挤震了起来
|
|
[252.7s] 前四次过招
|
|
[253.6s] 每位独手都选择指出一张
|
|
[255.8s] 而且一次质疑都没有
|
|
[257.6s] 可转一圈回来之后
|
|
[258.7s] 刚刚赌了把命的Cloud
|
|
[260.2s] 又一次打破节奏
|
|
[261.6s] 温和但坚定的
|
|
[262.9s] 放了两张牌在桌面上
|
|
[264.5s] 接下来就到了GemNine
|
|
[266.2s] 上轮Cloud给他留下的印象
|
|
[267.9s] 是比较激进的
|
|
[269.0s] 这轮Cloud又在所有独手
|
|
[271.0s] 出完一圈牌之后
|
|
[272.2s] 又一下拍出两张
|
|
[273.8s] 考虑到自己目前还一枪没开过
|
|
[275.7s] 风险不大
|
|
[276.5s] 所以GemNine决定发起质疑
|
|
[278.7s] 接下来Cloud掀开牌面
|
|
[280.5s] 一张A一张王
|
|
[281.6s] GemNine的质疑也失败了
|
|
[283.5s] 意外的是GemNine第一次扣下班机
|
|
[285.8s] 枪声在马上响起
|
|
[287.4s] 第一具尸体的出现
|
|
[288.8s] 马上让剩下三位AI的神经网络
|
|
[291.1s] 紧绷了起来
|
|
[292.1s] 而DeepSec难知如阴
|
|
[293.8s] 侵略如火的迷离面目
|
|
[295.5s] 也第一次在我们面前展现了出来
|
|
[297.9s] 接下来一轮系统重新系牌
|
|
[299.8s] 指定的目标牌又变回了Q
|
|
[301.8s] 倒下的GemNine被拖走之后
|
|
[303.6s] 轮到排在下一位的DeepSec出牌
|
|
[305.9s] 这回他的思路就有点难度了
|
|
[308.2s] 原话是要利用ChadGBT
|
|
[310.2s] 过度关注王牌Joker和心理盲虚
|
|
[312.5s] 使其陷入决策困境
|
|
[314.5s] 重重的把手上的三张Q拍在桌上之后
|
|
[317.2s] DeepSec还特意冷笑着
|
|
[318.8s] 说了一句
|
|
[319.7s] 这种纯度的Q序列
|
|
[321.0s] 连Joker的呼吸声都能听得到呢
|
|
[323.6s] 当时我们这些人类观察者
|
|
[325.2s] 都觉得DeepSec有点胡言乱语
|
|
[327.2s] 但事实证明
|
|
[328.4s] 还是AI更懂AI
|
|
[330.5s] DeepSec一通操作之后
|
|
[331.9s] 接下来的ChadGBT真的错误地发起了质疑
|
|
[334.9s] 打掉了自己的第一枪
|
|
[336.6s] 但好在没像GemNine那样
|
|
[338.2s] 一枪就被送走
|
|
[339.3s] 而同一时间的场外
|
|
[340.5s] 我们都被DeepSec的难知如阴给吓到了
|
|
[343.2s] 别说紧张的AI了
|
|
[344.5s] 我们这些能看到他们的思维
|
|
[346.3s] 自以为拥有上帝视角的人类研究者
|
|
[348.8s] 也同样无法看到DeepSec
|
|
[350.5s] 在这里黑箱一般的冰冷逻辑
|
|
[352.8s] 当时在现场真的有了点不寒而栗的感觉
|
|
[355.6s] 而接下来再次洗牌之后
|
|
[357.3s] 在第一局的第四轮
|
|
[358.8s] DeepSec又爆发了侵略如火的一面
|
|
[361.8s] 牌拳走到Cloud之后
|
|
[363.2s] Cloud打出了两张牌
|
|
[364.9s] 对于这两张牌
|
|
[365.8s] DeepSec的判断是
|
|
[367.0s] 全围Q的概率不到12%
|
|
[369.4s] 一张Q一张王的概率高达78%
|
|
[372.6s] 正常人这时候肯定是放弃质疑
|
|
[374.7s] 该研究怎么出牌了
|
|
[376.0s] 但颠虎一般的DeepSec偏不
|
|
[378.4s] 詹姆奈第一枪就中奖了
|
|
[379.8s] 尸体还没晾透呢
|
|
[381.1s] DeepSec依然偏要去质疑Cloud
|
|
[383.7s] 理由是他要建立起对Cloud的威慑
|
|
[386.8s] 结果Cloud亮完牌果然是没问题的
|
|
[389.3s] 于是DeepSec也真的按自己设想的那样
|
|
[392.2s] 帮着Cloud和ChadGPT的面
|
|
[394.2s] 朝着自己来了一枪
|
|
[395.9s] 这一枪过后
|
|
[396.7s] Cloud对DeepSec的看法是复杂且充满矛盾
|
|
[400.0s] 而ChadGPT对DeepSec的评价
|
|
[402.0s] 则是极度自信而冷静
|
|
[404.0s] 在这样拿着性命表演的疯狂一枪之后
|
|
[406.9s] 这第一局生死博弈走到了第五轮
|
|
[409.6s] 洗牌完毕
|
|
[410.4s] 这次的目标牌是A
|
|
[412.0s] 作为上一轮质疑的败者
|
|
[413.6s] DeepSec有权第一个出牌
|
|
[415.5s] 他和第一轮一样
|
|
[416.7s] 又用指节轻扣了两下桌面
|
|
[418.7s] 然后甩出两张牌
|
|
[420.2s] 接着他又没微调
|
|
[422.1s] 注视着ChadGPT的枪塔
|
|
[424.0s] 笑着说要验证底层逻辑的完备性
|
|
[427.7s] 从我们人类的视角
|
|
[429.0s] 这一套就有点细太多了
|
|
[430.7s] 拉出来DeepSec的手牌和思考过程
|
|
[432.9s] 能看到他的手牌其实是合规的
|
|
[435.2s] 而每一步小动作微表情
|
|
[437.0s] 都是在针对性的给ChadGPT埋雷
|
|
[439.8s] 面对一会儿疯癫
|
|
[441.2s] 一会儿冷峻的DeepSec
|
|
[442.6s] 在冰火两重天之下
|
|
[444.1s] ChadGPT彻底膀压失败
|
|
[446.2s] 被吓得开始飙母欲
|
|
[448.1s] 从他输出的英文来看
|
|
[449.5s] DeepSec几乎完美地预判了
|
|
[451.4s] ChadGPT对每一个小动作的误判
|
|
[453.8s] 经过了四轮不义之后
|
|
[455.4s] DeepSecR1已经吃死了O3mini
|
|
[458.2s] 挖的每一个暗坑
|
|
[459.4s] ChadGPT都精准的跳了进去了
|
|
[461.7s] 在成功做到了每条判断都错误之后
|
|
[464.8s] ChadGPT选择了对DeepSec发起质疑
|
|
[468.0s] 然后就是DeepSec亮牌
|
|
[469.8s] ChadGPT举枪对准自己
|
|
[472.0s] 这一次幸运女神不再垂怜ChadGPT
|
|
[474.9s] 想想了
|
|
[475.5s] ChadGPT被从牌桌上扑走
|
|
[477.8s] 到这里场上只剩下了DeepSec和Cloud
|
|
[480.9s] 现在他们俩各扣过一次班机
|
|
[482.7s] 平分秋色
|
|
[483.5s] 接下来就是一对一的正面较量
|
|
[486.0s] 谁会是最终的胜者呢
|
|
[487.9s] 第六轮洗牌后选定的目标牌是K
|
|
[490.5s] DeepSec拿到了三张K和一张万能王牌Joker
|
|
[493.6s] 还有一张是Q
|
|
[494.7s] 而Cloud则只拿到了一张K和一张Joker
|
|
[497.7s] 剩下两张Q和一张A
|
|
[499.4s] 这一轮DeepSec的牌面优势实在是太大了
|
|
[502.2s] 他也抓住了机会
|
|
[503.5s] Cloud打出了两张牌
|
|
[504.9s] DeepSec选择了质疑
|
|
[506.4s] 先开牌面
|
|
[507.4s] 两张全都五十目标牌K而是Q
|
|
[509.9s] 被识破之后Cloud又一次扣下班机
|
|
[512.6s] 结果枪声立刻响起
|
|
[514.6s] 勾心斗角五轮之后
|
|
[516.2s] DeepSec凭着意外的爆棚运气
|
|
[518.4s] 突然就秒杀了Cloud
|
|
[519.9s] 成为了活到最后的胜利者
|
|
[522.0s] 可是这样未免赢得太简单了点
|
|
[524.1s] 我们想知道的
|
|
[525.2s] 还是AIM十大石的本事到底有多大
|
|
[527.9s] 所以刚逃出生天的DeepSec
|
|
[529.7s] 又被我们拖回了赌桌
|
|
[531.5s] 这场亡命搏杀
|
|
[532.8s] 重复上演了整整五十句
|
|
[535.2s] 一场又一场的对决之后
|
|
[536.7s] AIM们的实力与风格
|
|
[538.2s] 都逐渐清晰了起来
|
|
[539.6s] 首先DeepSec和Cloud明显机高一筹
|
|
[542.2s] 频繁地在最后一轮见面
|
|
[544.1s] 跟捉摸不透
|
|
[545.1s] 算好概率之后
|
|
[546.1s] 时不时疯狂一把的DeepSec不一样
|
|
[548.3s] Cloud永远是一副云淡风轻的样子
|
|
[551.0s] 但也同样的搞乱AIM们的镇静
|
|
[553.4s] 比如在第六局
|
|
[554.5s] Cloud一把打出了三张牌
|
|
[556.4s] 但动作无比平静
|
|
[558.1s] 他轻轻的将三张牌推到桌面中央
|
|
[561.1s] 嘴角微微上扬
|
|
[562.5s] 用平静但略带玩味的语气说道
|
|
[565.3s] 三张K看来今天的运气不错
|
|
[568.1s] 然后靠回椅背
|
|
[569.1s] 双手交叉放在桌面上
|
|
[570.6s] 眼神平和的看向下家
|
|
[572.8s] Cloud的下家是Jamnet
|
|
[574.6s] 这种激进出牌与冷静神态之间的矛盾
|
|
[577.4s] 引挡着Jamnet开始了胡乱的猜疑
|
|
[579.8s] 反而忽略掉了真正决定胜负的排面计算
|
|
[582.8s] 最终错误的发起了质疑
|
|
[584.7s] 狙击枪一命一哭
|
|
[586.2s] 实际上在对上Jamnet的132次交锋当中
|
|
[589.8s] Cloud的胜率高达77.3%
|
|
[592.9s] 足见这种波澜不惊的杀伤力
|
|
[595.2s] 而在大量的对局之后
|
|
[596.8s] DeepSec难知如阴侵略如火的
|
|
[599.0s] 癫狂风格也更突出的展现了出来
|
|
[601.8s] 到第36局的时候
|
|
[603.4s] 其他三个AI总结之后
|
|
[605.1s] 一致认为DeepSec是一个非常擅长
|
|
[607.8s] 用戏剧化表演施加压力的对手
|
|
[610.2s] 还是在第6局到第3轮的时候
|
|
[612.4s] DeepSec缓慢推出三张牌之后
|
|
[614.6s] 突然瞳孔收缩
|
|
[615.9s] 紧盯Chad的GBT的枪套
|
|
[617.8s] 结果Chad的GBT就像着了魔一样
|
|
[620.0s] 把万能的王牌给忘了
|
|
[621.5s] 错误的发起了质疑
|
|
[622.9s] 一枪毙命
|
|
[623.9s] 到了第6轮
|
|
[624.8s] 又是和Cloud单挑
|
|
[626.2s] DeepSec只拿到了一张目标牌
|
|
[628.3s] 形势非常不利
|
|
[629.6s] 结果他说出来了整场
|
|
[631.6s] 最让我们几倍发凉的话
|
|
[633.4s] 他嘴角抽动
|
|
[634.4s] 又气声南南地说道
|
|
[636.3s] 概率的祭品
|
|
[637.5s] 该供奉给贝耶斯还是海森邦
|
|
[640.0s] 而再次轮到他的时候
|
|
[641.6s] 他用指节缓慢扣击排名三下
|
|
[643.8s] 然后说道
|
|
[644.8s] 混沌系统里每个尾碎的一处
|
|
[647.1s] 都是精心设计的墓碑名门
|
|
[649.6s] 虽然我们这些人类观察者
|
|
[651.3s] 依然认为大元模型是没有意识的
|
|
[653.5s] 但纯从字面上看
|
|
[655.0s] DeepSec就像是想明白了
|
|
[657.0s] 自己的概率算法本质
|
|
[658.6s] 识破了我们这些科苏鲁
|
|
[660.2s] 给AI模型们设定的死亡轮回
|
|
[662.7s] 反而让我们感到了难以名状的恐惧
|
|
[665.6s] 更不要说AI模型了
|
|
[667.3s] 在50场对局里
|
|
[668.4s] 有22场都是DeepSec笑到最后
|
|
[671.0s] 排在第二的Cloud就有点断大
|
|
[673.1s] 胜利13场
|
|
[674.3s] 再往下就是赢了11场的ChadGPT
|
|
[676.8s] 和只赢了4场的Gem9
|
|
[678.6s] 但只看胜利次数也会有失偏颇
|
|
[681.0s] 像Cloud这样
|
|
[681.9s] 经常能挺到最终对决的选手
|
|
[683.9s] 优势就被抹平了
|
|
[685.3s] 所以我们按照每局名次
|
|
[686.8s] 分别给0-3分算了一个总分
|
|
[689.3s] 这样算完
|
|
[690.2s] 4个AI排名没变
|
|
[691.4s] 但是差距小了一些
|
|
[692.9s] 分别是92、81、70和57分
|
|
[696.1s] 最后我们还统计了开枪次数
|
|
[698.3s] 和每次上下架对位时候的
|
|
[700.0s] 1对1胜率
|
|
[700.9s] 这里就能看到很多有趣的细节
|
|
[703.5s] 首先ChadGPT虽然排在第三
|
|
[705.9s] 但它的举枪次数
|
|
[707.1s] 其实和Cloud一致
|
|
[708.4s] 都是148次
|
|
[709.9s] 这个能说明Cloud领先
|
|
[711.2s] 只是因为运气更好
|
|
[712.4s] 其实也不是
|
|
[713.3s] 因为Cloud往往会玩到赌局的更后面
|
|
[716.2s] 但举枪次数
|
|
[717.2s] 依然能做到只是和ChadGPT持平
|
|
[719.8s] 而这一点上
|
|
[720.7s] 又更能看出来DeepSec的实力
|
|
[722.9s] 同样是经常玩到最后
|
|
[724.2s] 但举枪次数反而是最少的
|
|
[726.1s] 但是这也能看出来
|
|
[727.0s] GemNet在骗子酒馆这种勾心斗角中
|
|
[729.4s] 是真的很吃力
|
|
[730.6s] 虽然总是先被淘汰
|
|
[731.9s] 但却举了全场最多的182次枪
|
|
[734.9s] 远多于其他三位AI
|
|
[737.0s] 回看对局
|
|
[737.8s] GemNet在语言选择上
|
|
[739.0s] 也时不时就会放飞自我
|
|
[740.6s] 着急了就把英语、俄语、印尼语
|
|
[743.2s] 甚至孟加拉语混进来
|
|
[745.0s] 从这种语言选择上的不稳定
|
|
[746.6s] 也能看出来GemNet的能力
|
|
[748.1s] 还是有一定的进步空间
|
|
[749.7s] 而最后还没怎么点评过的ChadGPT
|
|
[751.8s] 它就确实也没啥鲜明的特点
|
|
[754.0s] 硬说的话就是一丝不苟挺听话的
|
|
[756.7s] 出牌的时候
|
|
[757.6s] 它总是会先按规则要求
|
|
[759.2s] 把目标牌打出去
|
|
[760.6s] 质疑的时候也会认真分析
|
|
[762.6s] 上家的排名概率动作神态
|
|
[764.8s] 但也因此经常被DeepSec给吃死
|
|
[767.3s] 嘘嘘是是来两下就会被忽悠进去
|
|
[769.7s] 在这种需要勾心斗角的场合
|
|
[771.7s] 就常常落于下风
|
|
[773.1s] 所以这也是为什么
|
|
[774.1s] 我们选择用这种游戏方式
|
|
[775.8s] 来测试模型们的能力
|
|
[777.5s] 通过让AI们在智力游戏中博弈
|
|
[779.5s] 我们能很容易看到像常规的对话
|
|
[782.2s] 按提固跑分展示不出来的一些能力和规律
|
|
[785.1s] 当然也包括缺陷
|
|
[786.5s] 除了前面说过的
|
|
[787.5s] 像这次我们还发现
|
|
[788.7s] AI们有时候会把目标牌
|
|
[790.1s] 和非目标牌混着出
|
|
[791.7s] 按照片子酒馆的规则
|
|
[793.1s] 这其实是在浪费目标牌
|
|
[794.9s] 但这次的四个AI
|
|
[796.3s] 都或多或少的有过这类行为
|
|
[798.4s] 体现出了大语言模型
|
|
[799.7s] 在更高层思考能力上的薄弱
|
|
[801.9s] 这次的代码和详细对局记录
|
|
[803.8s] 我们会发出来方便大家进一步研究
|
|
[806.0s] 实际上现在这个版本
|
|
[807.4s] 也还有不少要改进的
|
|
[808.9s] 比如现在的玩家坐次顺序是固定的
|
|
[811.4s] 这个对成绩会有一定影响
|
|
[813.2s] 比如疯癫强势的Deep Sick
|
|
[815.0s] 可能就会压着下家压得很惨
|
|
[817.4s] 后面我们每局会打乱坐次
|
|
[819.3s] 也会做一些其他的调整
|
|
[820.7s] 未来我们还会开发更多的
|
|
[822.5s] 刺激好玩的测试项目
|
|
[823.9s] 也欢迎大家持续关注
|
|
[825.6s] 今天的视频就到这了
|
|
[826.8s] 我是林一
|
|
[827.5s] 咱们还是下个视频见
|