Sea-Fill
Verification Infrastructure for Science

让每一门学科,
都能被 AI 训练。

我们把科学编译成机器可验证的训练数据。从数学开始:判据、过程数据、奖励栈,一套方法,泛化到每一门学科。

起点弱0 / 64
起点强9 / 64

同一道题,两个模型各尝试 64 次。奖励全是零就没有梯度;强化学习只能放大模型已经能采到的东西。示意图,非实测数据。

2026

AI 开始攻克千禧年难题

能力已经出现。下一个前沿是效率,以及泛化到数学之外的每一门学科。

80年
Erdős 猜想被推翻

2026.05,通用推理模型推翻 1946 年的单位距离猜想,九位顶尖数学家联署确认。

722篇
AI 撰写的数学论文

2026.10.06 一次性发布;次日因一处符号错误撤回 3 篇、修订 14 篇。

88小时
Navier–Stokes 千禧年难题

2026.09,证明有限时间内会出现奇点,Lean 形式化验证再用 17 小时。

1300亿
解一道难题的输出 token

Navier–Stokes 一项:约一万个智能体、270 万条消息。

来源:OpenAI 官方发布(2026.05、2026.09、2026.10);github.com/openai/math

Insight

瓶颈不是想法,
是验证。

模型一天能提一万个假设。真正卡住的是:哪个是对的,验证一次要多久。

Flywheel

思维链是燃料,
强化学习环境是发动机

模型提出假设,给出可检验的预测;验证器与实验判定真假;判定的结果回到数据里,训练出更强的模型。一圈转完,下一圈的起点更高。

01 · Hypotheses

让过程可读

模型对同一道题采多条思维链,把卡住的岔路口标出来。过程数据让奖励知道该给哪一步,而不是只看最后那个答案。

02 · Predictions

把假设变成可判定的预测

答案、数值、证明或脚本 —— 每一条都必须能被某个判据明确判对或判错,不靠感觉。

03 · Verification

先跑便宜层,昂贵层只做校准

判据库、单元测试、数值仿真承担日常奖励;专家与真实实验只在关键处抽查标定。

04 · Returns

失败也是数据

被否掉的分支、失败的实验一起回流:它们同时是 SFT 轨迹和 RL 偏好对。

科学飞轮 模型提出假设,给出可检验的预测;实验与验证器判定真假;结果回到数据,训练出更强的模型。 the flywheel MODELShypotheses at scale PREDICTIONStestable, falsifiable EXPERIMENTSverified against reality DATAthe teacher returns
fig. 1 — 科学飞轮:模型 → 预测 → 实验 → 数据 → 模型。虚线持续流动,圆点按顺序走完一圈。
Products

科学家在闭环里的三个位置,就是我们的三条产品线

选择问题

验证数据授权

全对或全错都没有信号,题要刚好够得着。

难度校准的题库与私有评测,按学科与强度分级的年度授权。

定义正确

验证引擎 + 多保真度奖励栈

验证器一宽松,模型就会钻空子。

判据库订阅;便宜层做 RL 奖励,昂贵层定期校准。

评判结果

科学数据工程与专家评审

722 篇论文发布次日,撤回 3 篇、修订 14 篇。

把论文、仿真与实验转成结构化条目、裁判模型、过程数据。

Method

专家不写思维链,只在岔路口做决定

模型会推导,缺的是方向。模型对每道题采 8 条回答,只把卡住的岔路口发给专家,附上 3–4 个候选方向。

传统:专家写整条链~¥300 / 条
岔路口:专家只做决策~¥10 / 条

产出效率从约 1.3 条 / 专家小时,提升到约 30–50 条 / 专家小时。单条成本降到三十分之一。

一次专家动作,同时产出 SFT 轨迹和 RL 偏好对:被否掉的分支,本身就是奖励信号。

Expansion

按验证成本排序,而不是按学科声望

数学验证免费但产出贵,化学产出便宜但验证贵:数学打磨方法,化学放大规模。

#领域验证方式状态
1数学 / 计算机验证几乎免费已进入 L3,正走向 L4
2计算科学:理论物理、计算化学、计算材料模拟器可靠可大规模闭环
3实验化学与材料模拟器 + 自动化实验室下一站:闭环接入真实世界
4分子 / 结构生物学大数据库 + 蛋白设计工具湿实验仍然慢
5细胞 / 系统生物学、医学模拟器不可靠慢、贵、噪声大,有伦理问题
6野外科学 / 社会科学有些实验根本做不了只能靠观测和预测后开奖
Vision

从数学出发,走向真实世界

现在

数学:什么数据最高效

研究专家时间与模型提升之间的扩展规律,提供结构化数学数据与验证数据。

下一步

验证器不完美时会怎样

研究验证质量与成本如何影响学习效率,构建多保真度奖励栈。

再往后

计算领域的完整 L3 闭环

让模型在计算科学里自己提方案、跑验证、迭代,服务产业科学智能体。

长期

接上真实世界的验证

接入自动化实验室,把每一次实验(包括失败)沉淀为训练数据。

Team

团队

数学家、机器学习研究者与工程师,一起定义什么算对。

团队成员来自 清华大学·北京大学·南开大学,以及 华为·字节跳动·MiniMax 等机构的 AI 与科学研究者。

数学与验证

Verification

维护专家网络、判据库与多保真度奖励栈,决定「什么算对」。

数据工程

Data

把论文、仿真与实验转成结构化条目、思维链与偏好对。

强化学习与基础设施

RL & Infra

构造可验证的 RL 环境、奖励接口与训练管线。