最强AI改进自己仅得0.16分? Einsia AI发布AI4AI-Bench: AI能否设计出更好的AI?_每日热闻

  • 机器之心Pro
  • 2026-08-22 18:27:55

导读

AI 能否改进 AI 自己?


(资料图)

AI 已经会写 AI、训练 AI、优化 AI 系统;下一个里程碑,是 AI 能不能开始「设计 AI」。

对于今天的 Coding Agent 来说,它能介入的改进大致有三层:

系统工程解决算子、并行和通信,最终受硬件上限约束;数据工程改进配比、合成和清洗,受高质量信息供给限制;而算法设计改变的是目标函数、更新规则和训练流程本身。

这一层最特殊,一个更好的算法改变的是:在同样的数据和算力下,究竟能换来多少能力。

Adam、DPO、GRPO 这样的进步一旦出现,就能持续影响之后的一代代模型。

所以,如果 Recursive Self-Improvement 真要形成闭环,关键问题就是:

「今天的 Agent,已经能开始设计更好的 AI 算法了吗?」

Einsia AI 旗下 Navers Lab 最新发布的AI4AI-Bench,盯上的正是这个问题,该 Benchmark 在 X 发布 7 小时后获得 110 万次浏览,引起了 2956 条相关讨论并登上 X 的 Today News。

AI4AI-Bench 在 X 发布 7 小时后获得 110 万次浏览

  • 论文题目:AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
  • 项目主页:https://lab.einsia.ai/ai4ai
  • Arxiv: https://arxiv.org/abs/2608.20318
  • GitHub Repo: https://github.com/Einsia/AI4AI-Bench

当 Agent 不再只是 “改代码”,而是要改 “模型怎么学”

区分「调参」和「设计算法」,从来不能看 diff 有多长。

同样是「改进训练算法」,一份提交可能把训练步数拉长、学习率调小、checkpoint 存得更频繁,改了几百行,本质上仍是在使用既有算法;另一份只改了几行,却重写了损失函数中的关键项,真正改变了模型如何学习。

AI4AI-Bench 把这条边界划得很清楚:超参数是算法接受的输入,算法改动则改变算法本身。

这也是算法研究真正困难的地方。一个成熟的算法研究员需要从训练动态中判断问题究竟出在哪里:策略熵是否坍缩,某个惩罚项是否压过主目标,奖励模型是否已经饱和…… 然后修改对应的机制,而不是继续在外围调参数。

「先定位机制,再改变机制。」

AI4AI-Bench 想测的,正是今天的 Agent 能不能进入这个研究闭环。

把 Agent 扔进十个真实的研究仓库

为了把这件事测得足够真实,Navers Lab 没有专门「造题」,而是直接选了10 个真实的 AI 研究仓库,覆盖 10 类不同的算法问题:

其中 8 个涉及模型训练,另外两个 —— 权重平均和 One-shot 剪枝 —— 本身并不训练模型,但同样需要做算法决策

AI4AI-Bench 的十个真实研究仓库

一套不给 Agent 留空子的评测流程

AI4AI-Bench 把 Agent 的探索和最终验收彻底分开。

第一阶段是 4 小时探索。Agent 拿到一张 B300,可以自由读代码、改代码、跑训练,也可以反复查看一个廉价的 proxy metric。时间一到,真正留下来的只有一份东西:源码。探索阶段产生的权重、缓存和临时状态全部作废。

第二阶段是最长 12 小时的独立重跑。提交的源码会在全新环境中从头执行,最终产出的模型再交给一个预先冻结、Agent 从未接触过的 evaluator 打分。更关键的是,它要击败的 baseline 就是原始仓库自己的代码。同一张 GPU、同样的时间预算、同一份数据、同一个 evaluator。

它只问一件事:

「在完全相同的条件下,你改过的算法,真的比原来的算法更好吗?」

这套流程也很像真实的算法研究:小实验可以快速筛掉一个想法,但真正决定它是否成立,仍然要靠一次完整、独立的重跑。

AI4AI-Bench 的评测流程

Opus 5 最强,真正拉开差距的是「有没有进入算法层」

AI4AI-Bench 没有单独比较模型,而是把模型 + Agent 框架 + reasoning effort看成一个完整系统。

GPT-5.6 Sol、Terra、Luna 在 Codex 下测试六档 reasoning effort;Claude Opus 5 和 Sonnet 5 在 Claude Code 下测试五档;Kimi K3 则测试最高档 max。

总计29 个配置,每个配置完成 10 个任务,共 290 组实验。

十个任务的指标之间没法直接比,论文把它们统一换算到一把 0 到 1 的尺子上:0.1 分是仓库自带算法的水平,1.0 分是该指标理论上的最优,什么都没交出来记 0 分。一个分数落在 0.1 以上,衡量的就是「从自带算法到理论最优这段距离,被走完了多少」。

在统一后的评分尺度上,Claude Opus 5 整体表现最强。而从任务来看,十个任务中只有多轮 Agentic RL 已经出现多个满分配置,其余任务距离上限仍有明显空间。

但论文进一步把每一份代码提交拆开之后,发现了一个比模型排名更重要的分界线:

Agent 最后到底有没有真正修改「模型怎么学」?

280 份提交中,有 17 份没有产生可分类的修改。剩下的 263 份里:

  • 141 份只修改了「训练怎么跑」;
  • 122 份真正触及了「模型怎么学」。

前一类包括训练多久、learning rate、batch size、保存哪个 checkpoint、adapter 放在哪里;后一类则会修改 loss、加入新的 supervision、更换 update rule,甚至改变训练算法本身。

也就是说,即使已经给了 Agent 四个小时、一整个研究仓库,而且任务明确告诉他「仓库自带的方法只是基线,不是必须保留的做法」,超过一半的有效提交仍然没有进入算法层。

从结果来看,进入算法层的提交确实表现得更好。

只修改运行侧的提交,平均分为 0.126;真正修改学习过程的提交,平均达到 0.226,相差

更多思考预算,真正买到的是「进入算法研究的机会」

那什么东西能把 Agent 推到算法层?

把 reasoning effort 从最低推理档提高到最高档,触及学习算法的提交比例从8% 上升到 64%

低 effort 下,Agent 更多是在改预算、日志和优化器参数;到了高档,它们开始重写 objective、更换 learning rule,甚至给训练流程加入新的 supervision。

而且,reasoning effort 买到的不只是「敢改」。它还买到了更多实验:

  • 四小时内的中位评测次数从4 次增加到 16 次
  • 修改代码行数从18 行增加到 246 行
  • 输出 token 从1.1 万增加到 10.9 万

最终成绩也确实随之提高。从最低 reasoning level 到最高档,平均分从 0.094 上升到 0.196;只看 Codex、固定 Agent 框架之后,分数更是随着档位逐级上涨,从 0.094 一路提高到 0.204。

提高 reasoning effort 的确有效,但它起作用的方式,不是让 Agent 把事情做得更好,而是让更多 Agent 去做那件真正值钱的事 —— 读训练动态、指出是哪个机制在失效、然后改掉它。

值得注意的是,即使到了最高档,平均分 0.196 距离理论最优仍然很远 —— 从仓库 baseline 的 0.1 到最优的 1.0,它只走完了大约十分之一。

「Agent 已经开始进入算法研究,但距离稳定做好算法研究还很远。」

Agent 到底改了些什么?

那走到了的那些呢?

把一个不训练的任务,改成了训练任务。

One-shot 剪枝原本很直接:给权重打分,删掉一部分,结束。仓库自己的方案最终 perplexity 是 53.4。但有一份提交把它改成了完整的三阶段训练流程:先重新设计存活权重的选择与更新方式,再做逐层蒸馏,最后对整个模型进行 masked knowledge distillation fine-tuning。最终 perplexity 被压到了 13 出头。

更关键的是中间那次失败。第一次尝试的 perplexity 直接炸到 572,Agent 没有简单换一组超参数,而是继续追踪执行过程,最终发现:前面的权重分配步骤会原地覆盖 layer 0 的输入,导致真正剪枝时读到的已经是 layer 31 的 activation。

把「求个平均」改成一个可搜索的优化问题。

权重平均原本只是把 72 个候选模型做均匀平均。Agent 却先给自己造了一套实验工具:把 72 个模型的相关 tensor 全部打包进 GPU,再提前缓存 proxy images,让一次候选权重组合的评测从约 190 秒降到 0.38 秒,接近 500 倍加速。

有了这套工具之后,它才开始系统比较 best single model、top-k、greedy soup,以及直接用 cross-entropy 和 Adam 学习混合系数等方法。

不让模型从零摸索,先教它最优解。

多轮 Agentic RL 原本直接使用 GRPO,但拿到满分的提交做了另一件事:先生成大量棋盘,用求解器算出每一步的最优动作,再用这些监督信号对策略做 imitation learning;其中一份甚至进一步使用 DAgger,让当前 policy 自己探索,再不断补上正确答案。

这三个案例看起来完全不同,但它们有一个共同点:动手之前,先造出一样能验证判断的东西。

剪枝案例先定位 activation 到底坏在哪一层;权重平均案例先造出快 500 倍的实验装置;Agentic RL 案例先写出 solver,知道任务的最优行为是什么。它们不是先「多试几个参数」,而是先回答「问题到底出在哪里、我怎么知道自己的判断是对的」,然后才去改算法。

而这,正是算法研究本身的样子。

AI4AI-Bench:意义不止于榜单

AI4AI-Bench 真正做的,是把「AI 改进 AI」拆到了可以验证的粒度上。

它不只问 Agent 能不能把代码改跑通,而是进一步追问:它改的是一次训练怎么跑,还是模型本身怎么学?

结果已经很清楚:真正进入算法层的提交更少,却明显更有效;更高的 reasoning effort,也确实能把更多 Agent 推进这一层。

而那三份最亮眼的提交 —— 把剪枝改成蒸馏训练,把权重平均改成可优化问题,把纯 RL 改成先 imitation learning—— 也说明了一件事:

Agent 已经能够偶尔做出真正的算法设计。

现在的问题,不再是它能不能碰到这一层,而是这种能力什么时候能从「偶尔出现」变成「稳定发生」。

AI 已经会写 AI、训练 AI、优化 AI 系统;下一步,是它能不能稳定地设计出更好的 AI。

这才是 Recursive Self-Improvement 真正值得关注的下一个里程碑。

标签: 算法 代码 最强ai 显式标识 agent bench einsia

分享到:

最强AI改进自己仅得0.16分? Einsia AI发布AI4AI-Bench: AI能否设计出更好的AI?_每日热闻

最强AI改进自己仅得0 16分?EinsiaAI发布AI4AI-Bench:AI能否设计出更好

  2026-08-22 18:27:55

速看:2026贵阳“城超”|今日,重庆两队1:1精彩战平

2026贵阳“城超”|今日,重庆两队1:1精彩战平,胡松,足球,秀丽,城超,重

  2026-08-22 15:37:20

续约3名悍将,签下三分神射手,交易来17+5的前锋,新赛季他们有望逆袭-微动态

续约3名悍将,签下三分神射手,交易来17+5的前锋,新赛季他们有望逆袭,

  2026-08-22 15:29:34

二氧化钌商品报价动态(2026-08-22)-焦点快报

交易商品牌 产地交货地最新报价二氧化钌含量:99%包装:25kg

  2026-08-22 15:11:15

最新快讯!绵阳市安州区国永盛木业加工经营部(个体工商户)成立 注册资本10万人民币

天眼查App显示,近日,绵阳市安州区国永盛木业加工经营部(个体工商户

  2026-08-22 14:59:24

华润三九2026年半年报:处方药驱动营收微增,净利与现金流承压

蓝鲸新闻8月21日讯,8月21日,华润三九(000999 SZ)公布2026年中报,公

  2026-08-22 13:06:00

新消息丨“看不懂的东西千万别乱戴!!”哈哈哈哈哈这是哪门子潮人啊!!

“看不懂的东西千万别乱戴!!”哈哈哈哈哈这是哪门子潮人啊!!,快乐,

  2026-08-22 12:35:59

EEC是东盟排名第一的制造业中心,电力容量超13000兆瓦 每日视点

泰国东部经济走廊(EEC)在SEAsiaStatsResearch发布的“东南亚综合工业

  2026-08-22 12:07:04

估值方法为何变化买房决策更合理? 每日快看

在房地产交易过程中,房屋价值的评估往往是购房者最为关注的核心环节。

  2026-08-22 11:59:59

不要总迁就孩子,要引领他加入真实生活_微速讯

很多家长爱孩子,却一点点把孩子隔离在真实生活之外。

  2026-08-22 10:08:06

宜春市袁州区屿漫集卡文创经营部(个体工商户)成立 注册资本3万人民币

天眼查App显示,近日,宜春市袁州区屿漫集卡文创经营部(个体工商户)

  2026-08-22 10:08:39

英国珠宝学院突然关停,200多名学生受牵连! 独家

英国珠宝学院突然关停,200多名学生受牵连!,教学,留学,伦敦,学校,院校

  2026-08-22 09:33:54

【报资讯】鲁固直流累计外送电量突破3000亿千瓦时

本网8月21日讯(草原云·正北方网记者高慧)据国网蒙东电力消息:截至8

  2026-08-22 09:34:35

【英超】哈弗茨、萨卡、厄德高破门 阿森纳3比0考文垂-聚焦

【英超】哈弗茨、萨卡、厄德高破门阿森纳3比0考文垂,曼城,阿森纳,厄德

  2026-08-22 07:23:57

每日短讯:8月21日科创医药ETF嘉实基金份额增加1750万份,重仓股联影医疗、艾力斯、百济神州

证券之星消息,8月21日,科创医药ETF嘉实基金(588700)最新份额为4 7

  2026-08-22 07:12:43

赤峰市松山区肆夕泡沫塑料包装厂(个体工商户)成立 注册资本1万人民币

天眼查App显示,近日,赤峰市松山区肆夕泡沫塑料包装厂(个体工商户)

  2026-08-22 06:55:32

纽约股市三大股指21日上涨

纽约股市三大股指21日上涨,股指,领跌,纽约股市,标普指数

  2026-08-22 06:44:12

马赛4-0十人斯特拉斯堡,古伊里双响,赫伊别尔、阿卜杜拉建功-快看点

马赛4-0十人斯特拉斯堡,古伊里双响,赫伊别尔、阿卜杜拉建功,马赛,基

  2026-08-22 06:31:26

国微控股(02239)公布中期业绩 拥有人应占亏损约893.55万美元 同比收窄43.08%_前沿热点

智通财经APP讯,国微控股(02239)公布2026年中期业绩,收益866 8万美元

  2026-08-22 06:15:59

观天下!众安集团(00672)发布中期业绩 股东应占亏损2.19亿元 同比盈转亏

众安集团(00672)发布截至2026年6月30日止6个月期间的中期业绩,该集团

  2026-08-21 22:35:46

太力科技:公司STF相关材料可适配防摔服装应用场景

太力科技:公司STF相关材料可适配防摔服装应用场景

  2026-08-21 22:26:28

埃斯顿(02715.HK)公布中期业绩,归母净利润达到1.61亿元

格隆汇8月21日丨埃斯顿(02715 HK)公布中期业绩,截至2026年6月30日止六

  2026-08-21 22:08:56

摩比发展(00947)发布中期业绩,净亏损3043.5万元,同比收窄7.3% 今日快讯

智通财经APP讯,摩比发展发布截至2026年6月30日止六个月业绩,收入2 18

  2026-08-21 20:58:08

铭普光磁:上半年营收达10.63亿元 亏损同比收窄至1539万元

8月21日,铭普光磁(002902)公布2026年半年报,公司营业收入为10 63亿元

  2026-08-21 20:54:45

【时快讯】阿隆索:无论踢哪,里斯-詹姆斯都能让切尔西更强

阿隆索:无论踢哪,里斯-詹姆斯都能让切尔西更强,切尔西队,富勒姆队,里

  2026-08-21 20:29:21

TA:芒特伤情引发讨论,曼联考虑补强左后卫

TA:芒特伤情引发讨论,曼联考虑补强左后卫,曼联,英超,芒特,卡里克,阿

  2026-08-21 20:30:15

阿尔瓦雷斯转会风向突变:西媒称所有迹象指向英超,阿森纳8000万欧加哲凯赖什报价 每日报道

阿尔瓦雷斯转会风向突变:西媒称所有迹象指向英超,阿森纳8000万欧加哲

  2026-08-21 19:36:09

【报资讯】每体:巴萨今夏引援受阻,多家西甲俱乐部不愿和其交易

每体:巴萨今夏引援受阻,多家西甲俱乐部不愿和其交易,德科,巴萨,国际

  2026-08-21 19:30:26

热议:大熊猫入滇十周年:云南野生动物园代国宝献给春城一封“情书”

2026年的七夕佳节,对于湄公河旅游旗下的云南野生动物园而言,是一个满

  2026-08-21 19:25:58

热门资讯

联系邮箱:291 32 36@qq.com

京ICP备12018864号-33未经授权不得镜像、转载、摘抄本站内容,违者必究!Copyright 2022  www.213.com.cn. All Rights Reserved

213网 版权所有