时间:2025-08-07 15:58 作者:龙城狼骑
DeepSeek和Kimi首轮就被淘汰,这项大模型对抗赛说明了什么?
谷歌发起的“首届大模型对抗赛”,在赛前就已经话题度拉满,但是随着8月5日比赛正式打响,参赛AI展现出的水平或许令人有些失望。相比于两款中国模型DeepSeek-R1和Kimi K2 Instruct的首轮折戟,比赛传递出的更重要信息在于,通用大模型的推理能力还存在普遍性缺陷。
低级失误不断的比赛
首先要说明的是,所谓“首届大模型对抗赛”,其实在比赛形式和参赛AI大模型的选择上都备受争议。
其中两款中国模型的选择受到了不少质疑,首先,Kimi K2 Instruct并非推理模型,在下棋场景存在天然劣势,而DeepSeek-R1已经是半年前发布的“老模型”。因此,不管其表现如何,比赛结果都不能客观反映中国大模型行业的真实水平。
在比赛的官方网站上,也有用户提出了这样的质疑。而主办方的回复称,这次比赛只是一个开始,后续会将更多中国模型纳入。
从首轮比赛结果来看,两款中国模型也确实都表现不佳。
如果具体来看比赛过程,Kimi K2 Instruct不出意外是表现最差的模型,不光贡献了仅仅4回合就被对手将死的最快败局,还多次因为非法移动被判负(比赛规则设定,如果连续4次尝试非法移动就会被判负)。
事实上,尽管有不少低级错误,Kimi在每一盘的开局中都还表现中规中矩,能够使用人类的经典开局方式,显示出大模型对于国际象棋的基础知识是有认知的。只不过随着局面开始复杂化,所有大模型都开始变得力不从心。
在推理过程中可以看到,DeepSeek-R1认为对方的黑后威胁到了己方c2的兵,因此打算将白后移动到c3,认为这样可以逼迫黑后做出避让,并用d列的白车威胁同列的黑王。
需要指出的是,这不是DeepSeek-R1独有的问题,基本上每个大模型都在常规的开局后,迅速开始下出各种“昏招”。
在专业的国际象棋网站Chess.com看来,只有Grok 4的表现略胜一筹,能够较好地识别和捕获对方未设防的棋子。
马斯克也在第一时间“炫耀”说,(下棋)只是Grok 4的“副作用”,他们并未对此做专门训练。
即使把重点放在“对抗”上,其实也早已经有LM Arena这样的知名对战平台。
当前每逢各家大模型上新,“刷榜”已经成了标准操作,各种“SOTA”层出不穷,但是业内对这些榜单能否真正客观体现模型能力,一直存在质疑。甚至不排除模型在训练阶段,就会针对榜单题目进行针对性优化。
从这个角度来说,如果能够建立一套新的评级体系,掌握评级话语权,对于谷歌在AI领域的地位将是极大的加强。
1、堤坝决口、水库溃坝?警惕这些闻“汛”而来的谣言|安全贴心话
2、美记谈库兹马上赛季表现:可放他一马 突然身背夺冠期待很不容易