搜索成本直降13倍,科学论文接受率提升1.86倍。这不是换模型,而是让AI自己给自己当裁判。
- 痛点:AI改稿或写代码总被固定标准卡死,达到评估上限就停滞。
- 破局:红皇后哥德尔机让AI和评估器共同进化,测试标准随能力变难。
- 降本:NVIDIA Nemotron 3 Ultra 配合 ChatGPT-5.5,搜索成本砍掉13倍。
这套逻辑对咱们接活做AIGC太有用了。平时用AI出图或写长文案,总是觉得有AI味或者卡在某个固定套路里,就是因为评估标准没跟着变。让开源模型干苦力搜索,闭源模型做终审,你的API账单能省下一大半。
打破固定评估器的死循环
Machine Learning Systems Lab 的 Alex Iacob 指出,自我改进的AI只能达到测试给它设定的上限。测试不仅衡量进度,还定义了进度。以前AI自己改代码,测试集是固定的,学完固定信号就停了。现在团队让评估器和AI一起进化。AI变强,评估器变难。
这个框架叫 Red Queen Gödel Machine。名字来自 Lewis Carroll 的小说《Through the Looking-Glass》里的红皇后,以及1973年提出的进化生物学假设:物种必须不断适应和进化才能生存。团队把这套理论用在了AI上。在科学论文写作和审稿,以及数学奥林匹克级别的证明写作和评分中,这种共同进化打破了天花板。评估器在检查点替换旧版本,引导下一个阶段的标准变得更严苛。
13倍成本降幅是怎么算出来的
研究团队在论文里给出了实打实的数据。共同进化的科学论文写手,在多样化的AI当裁判面板下,接受率提高 1.78倍至1.86倍。共同进化的评分器,ground-truth accuracy 提高 9%。
更关键的是成本。在共同进化AI审稿人和写手的实验里,团队用了 NVIDIA Nemotron 3 Ultra alongside ChatGPT-5.5。这种混合设置逼近了单用ChatGPT的性能,但 search-token costs 降低了约 13倍。
核心配置:开源模型 NVIDIA Nemotron 3 Ultra 承担基础搜索与试错,闭源模型 ChatGPT-5.5 负责高层改进与终审。混合部署大幅压缩搜索token开销。
把这套混合工作流平移到咱们的AIGC接单里,就是降维打击。比如做一套复杂的品牌视觉推导或者长图文案,别全用顶配模型跑全流程,那是给平台打工。用便宜的开源模型去跑几百个初稿变体、做初步筛选,把最优质的几个结果喂给昂贵的闭源大模型做最终精修和逻辑把关。这样既保住了质量底线,又把API调用费压到了原来的十几分之一。认清任务边界,把搜索和试错交给开源,把最终决策留给闭源。
论文与开源资源指路
论文《The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators》已上传arXiv。底层方法将开源以支持更广泛的采用,团队还在调查这套方法在更广泛AI任务中的表现。
作者主页:
实验室主页:
论文地址:
Flower Labs:
Nemotron模型:
论文PDF:
研究团队明确说这是初步结果,需要更长的搜索视野来验证扩展性。对于咱们接活来说,这套AI自己改自己的机制目前更适合有明确对错标准或可量化指标的任务,比如论文审稿、代码测试、数学证明。如果是纯主观的视觉审美,比如客户说感觉不对,这种动态评估很难落地,因为ground-truth无法定义。别盲目把这套逻辑套用到所有设计需求里,主观审美依然需要你亲自把控终审。
NVIDIA Developer Relations Manager Daniel Burkhardt 提到,开源模型在高级agentic系统中扮演重要角色,Nemotron模型专为推理和agent工作负载设计。Prof Nic Lane 也强调,如果开源模型承担大部分搜索,强前沿模型引导高层改进,我们就能以更低成本获得更强大的开放agent系统。对独立创作者而言,未来的工作流不再是单模型死磕,而是模型矩阵协同。
留言聊聊
你现在主力跑什么模型组合?API月账单多少?
往期推荐
- ·2 套记忆系统,解释了为什么你给甲方搭的 AI 工作流全在翻车
- ·15步560p无lora,MiniMax H3搞定15秒连贯分镜
- ·109次机械检查,本地还原MiniMax H3官方级提示词
点击公众号头像 → 历史消息,可翻阅以上文章