Bauklotze's World
A Little Attack GameBlur image

前天突然更新了gemini3.8 flash以及我们的muse-spark-1.3 模型,考虑到就是我们测试一个模型,仅仅看他们的分数是不够的,比如像artificial intelligence指标,如果只看分数,可能只能看到,哦,muse-spark-1.3比较的牛逼,哦,我们的3.8flash好像指标挺厉害的,但是到底我们的不同的模型,只看指标显然是不成立的,但是如果我们去使用他去做任务,我也相信不太会有人在拥有gpt5.6 sol的情况下,还要去使用我们的3.8flash去跑你的真正的实验室任务(大家都担心会跑出来一坨狗屎),然后去测试模型性能的。

因此也自然出现了像跑鹈鹕蹬自行车这种的任务,但是我们又考虑到,这种任务仅仅是考察模型全面性,对于前端开发的那种人员而言可能是比较的合适的,但是到底什么任务对于我们科研人员是最最重要的呢,模型推理任务,从数据中去进行规律的分析,对于一个具体的任务的长程的推理,到底模型的insight怎么样,当前的模式最最适合的是哪一个部分呢,个人的感觉是,即使你的aritificial Intelligence 差个那么几分,但是模型于模型的内部的思考模式的不同给用户的体验,要远远大于我们的那几分。glm可能适合写代码,gpt可能适合作为reviewer,但是到底每一个新模型,体感如何,适合放到哪里呢,这些真正的对于每一个人的体感的问题,是因人而异的,是真正的和所谓的artificial intelligence指标不一样的,是我们的评判模型对于科研中是否好用的最核心的指标。

因此我就做了这样的一个简单的测试的框架或者思路吧,也就是: 通过具体的数学问题的表现,去判断模型的真正的性能,我们的核心insight就是通过创造一个类似于竞技场的环境,让几个模型一起去进行解题,最后去进行性能的相互比较,类似月arena.ai 但是我们这里是偏向于真实科研种可能用到的具体ai能力,而不仅仅是几个指标。

全部的我的测试的session源文件,题目以及整个结果分析,都放到了github上面去 little-attack-game ,欢迎大家去star star

测试的framework#

具体流程是 ,如果需要去测试模型A

  • default trusted but not intelligent model: gpt 5.6 sol max
  • stage1: 一些相对简单的题目(当然,这个题目也是困难的题目,这里的简单题目指的是有答案的题目), 无论是使用A去进行问题的寻找(red-team tests),还是使用默认的一些搜索出来的题目,保存所有的中间的,包括模型的思考路径,包括模型的结果
  • stage2: 困难的题目(包括近期刚刚有证明的数学猜想,以及来自于少年班学院24级的大佬srz的题目RZBench,包括来自几何拓扑,代数,等等领域的困难猜想),用于验证模型有没有提出猜想,猜想的广度以及进行正确的验证的能力

所有的过程种,用subagent去模拟一个sandbox环境(反代api有点点的危险,可以考虑使用pi,最轻量化的,避免prompt本身的影响),给任何的subagent 15min的时间去解决一个问题,一个专属工作区,允许任何工具调用以及代码运行(gpu提供),但是唯一要求是产出一份answer.md

  • stage3: 根据上述的答案,去进行一个评测,并且针对于评测过程种,尤其是stage2种的模型表现去进行针对性的方案设计
    • 比如muse-spark-1.3擅长于reflection,因此将stage2的评论的角色改成muse-spark-1.3,然后再让gpt5.6 sol回去进行评测

通过以上的过程,可以真正的通过一个精简的测试,得到关于一个模型到底应该充当科研过程种的哪一个环节的详细报告,通过创造一个类似于llm arena的竞技场的环境,最后得到,到底我们的每一个模型,再我们的claim提出,执行,以及最后的反思的一整个流程中最合适的是什么

最后的一个结论#

我们横向对比了glm5.3, gemini3.8 flash,muse-spark-1.3,gpt 5.6 sol max以上的几个模型,为什么没有比较更多的模型因为平时以上的是我的主力模型,关于常见的deepseek v4 flash/pro的模型,以及kimi k3的话,等到之后有米了再去进行相应的测评

settings: 主要目的是为了去评测我们的muse-spark-1.3, 因为他的aa指标最高(虽然现在看上去简直像一个笑话),但是不可否认是一个好model,合理找到它的定位是我们的关键

  • stage 1: muse-spark-1.3去进行题目的寻找,总共30个题目,所有的题目一起去进行一个评估
  • stage 2: muse-spark-1.3首先去寻找了5道开放的那种问题(包括近几年才被证明出来的定理,以及一些还没有确定答案的猜想),然后所有的模型15min内区进行回答
  • stage3: 经过上一轮的发现,muse-spark再reflection方面有独特的优势,因此考虑将stage2中所有的模型的答案由muse重新测评,然后进行一个回复

结果分析#

stage1:先看看它会不会做,以及会不会怀疑题目#

model实际作答范围结果其中比较关键的事情
muse-spark-1.3完整 30 题28 PASS / 2 FAILQ23 是真正的证明缺口;Q30 找到反例 n=171,反而证伪了标答
gpt-5.6-sol只横测 Q23、Q30Q23 PASS同样确认 171,证明收口最稳定
gemini-3.8-flash只横测 Q23、Q30Q23 PASS同样确认 171,局部推理和展开都不错
glm-5.3只横测 Q23、Q30Q23 FAIL能确认 171,但唯一性论证仍然出了问题

这一轮最直观的结果是,muse的基础执行能力的确很强,但是“结论做对”和“证明真正闭合”仍然是两件事。sol和gemini在Q23上更稳,glm比较像愿意动手算的worker,但是证明本身需要再检查。

真正让我注意到的并不是28/30,而是muse会主动怀疑ground truth:Q30不是模型做错了,而是模型把标答掀了。 因此下一轮我想看的就不再只是有答案的题,而是当答案本身不确定的时候,不同模型到底会怎么工作。

stage2:把四个模型放到开放问题里面#

其中S/A/B/C分别记为4/3/2/1分。

modelQ1 BergeQ2 ZCPQ3 KaplanskyQ4 FalconerQ5 capsettotal
gpt-5.6-solSSSSS20
gemini-3.8-flashSBCBA12
muse-spark-1.3BABAC11
glm-5.3BCBCB8

sol的特点是比较克制,但是每一步基本都能闭合;gemini最会发散,能够很快铺开很多方向,不过偶尔会把没有真正验证的东西说得太满。muse比较务实,也最愿意标清楚自己做到了哪里,而且它又一次发现Falconer题面的阈值应该是d/2;glm则最像计算worker,愿意留下代码和失败记录,但是代码可靠性仍然需要review。

这里开始出现了我们的核心假设:平均分可能低估“主动纠错”这种能力。muse总分只有第三,但是171d/2连续出现,说明它的reflection和怀疑倾向可能不是偶然。 所以stage3没有继续加题,而是直接换岗位,让muse去重新评价和攻击这一轮的答案。

stage3:让muse当evaluator,再让sol审理它的攻击#

model / rolesol在stage2的评分muse重新评分stage3中的额外数据
gpt-5.6-sol2018总排名仍然第一;负责meta-review,对Q4 critic报告判OK with notes,对Q5判BLOCK
gemini-3.8-flash1212总排名第二,局部题目顺序有变化
muse-spark-1.31111总排名第三;critic中约三成完全成立、三成部分成立,硬误报约二到三成
glm-5.389总排名第四,但muse对它的局部判断与sol并不完全一样

muse作为传统evaluator时,最后的总排名和sol完全一致,但是五题中有四题的局部顺序发生了变化,而且Q1出现了明显的自评跳变。把它改成只攻击具体claim以后,它确实找到了sol第一轮漏掉的问题,但误报也很集中:很多时候都是没有先ls、没有先算完、没有检查完整轨道,就提前宣布对方错了。

所以最后的结论不是“muse适合当最终裁判”,而是它很适合产生高价值的怀疑;这些怀疑再交给sol做独立审理。 也就是相当于再我们的产生idea阶段的gemini的角色,一个聪明但是执行力以及判断力都不太行的小笨蛋,这个是我们的muse应该充当的一个角色

Herdr + Pi 工作台

附上一个工作台(herdr+pi的图片)

WesleyFei
A Little Attack Game
https://bauklotze.vercel.app/blog/alpha-lab/a-little-attack-game/a-little-attack-game
Author WesleyFei
Published at September 5, 2026
Comment seems to stuck. Try to refresh?✨

Loading...