笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
开放世界多智能体环境中的自主数学发现
本文介绍了一个名为"The Station"的开放世界多智能体环境,让不同AI模型家族自主协作进行数学研究,在多个经典问题上取得了超越现有文献的新成果。
背景与动机
传统上,AI辅助数学发现(如AlphaTensor、AlphaGeometry等)依赖于封闭式管线:研究者预先定义问题空间、搜索策略和验证流程,AI在受限环境中寻找构造或证明。这种范式的局限在于——AI无法自主提出新问题、无法跨领域迁移知识、也无法像人类数学家那样进行开放式的长期探索。
本文提出的The Station环境试图打破这一限制:它是一个开放世界(Open-World)多智能体(Multi-Agent)系统,允许多个来自不同模型家族的AI代理(Agent)在没有中央协调者或脚本化流程的情况下,共同追求一个共享的研究目标。
核心架构:The Station 的设计哲学
1. 完全自主的研究方向选择
每个Agent可以自由决定自己的研究子问题、实验策略和协作方式。没有预设的"下一步该做什么"——Agent必须自己根据当前研究进展做出判断。这与传统AutoML或神经架构搜索有本质区别,后者仍然在人类定义的搜索空间内运作。
2. 跨模型家族协作
系统特意混合了不同架构的AI模型(例如基于Transformer的LLM与基于扩散模型的系统),而非使用单一模型的多实例。作者认为,不同模型家族具有互补的归纳偏置:LLM擅长形式化推理和文献理解,而其他模型可能在数值优化或模式识别上更高效。这种异质性模拟了人类科学共同体的多样性。
3. 共享科学文献(Shared Literature)
所有Agent的发现、证明和失败记录都被写入一个共享的、可查询的文献库。这不仅是简单的日志,而是一个结构化的知识库,包含:
- 形式化陈述(定理、定义)
- 构造细节(具体代码或数学对象)
- 验证结果(自动化证明检查或数值验证)
- 引用关系(哪个发现基于哪个先前工作)
这使得Agent之间可以进行异步协作:一个Agent可以阅读另一个Agent的中间结果,并在其基础上继续推进,而无需实时通信。
4. 透明性与可验证性
所有Agent的原始对话、生成的证明、以及验证代码全部开源。这意味着任何第三方都可以复现整个研究过程,包括失败的尝试。这种透明性在AI科学发现领域极为罕见——大多数系统只发布最终结果。
实验设计与基准问题
作者选择了AlphaEvolve目录中的12个构造问题作为主要测试集,外加2个额外案例研究。这些问题覆盖了组合数学、离散几何和数论的不同分支,难度各异。关键基准包括:
- 有限域Kakeya问题:寻找最小的Kakeya集合(在有限向量空间中包含每个方向一条线的集合)
- 高维亲吻数问题(Kissing Number):在n维空间中,一个球最多能接触多少个等大的球?
- 离散化Kakeya针问题:关于针状集合测度下界的问题
- 符号不确定性问题(Sign Uncertainty):关于函数及其傅里叶变换同时稀疏的约束
- Erdős最小重叠问题:关于集合族中元素重叠次数的最小化
- Book Ramsey数:关于图论中Book图(多个三角形共享一条公共边)的Ramsey数
这些问题的共同特点是:存在已知的上下界,但精确值或最优构造未知,且传统搜索方法难以直接应用。
主要成果:五项超越现有文献的发现
1. 有限域Kakeya集合的新无限族
Kakeya问题在有限域上的版本(由Wolff提出)是加性组合学的核心问题之一。已知的最优构造是Dvir的多项式方法给出的,但最优常数仍有差距。Agent发现了一个新的无限族构造,在某些参数范围内比现有最优构造更小。具体来说,对于特征为奇数的有限域,新构造利用了一种递归的"纤维化"技术,将高维问题分解为低维子问题,这在人类文献中从未出现过。
2. 11维空间中的604点亲吻构型
亲吻数问题在维度11之前已被完全解决(1-9维和24维已知),但10、11、12维的精确值仍未知。此前最好的下界是11维中的596点(来自Musin的研究)。Agent找到了一个精确604点的构型,将下界提高了8个点。更值得注意的是,该构型并非简单的网格变形,而是具有高度对称性的特殊排列,其生成方式涉及一种新型的"螺旋层叠"算法。作者强调,这不是通过暴力搜索找到的——暴力搜索在11维空间中根本不可行——而是Agent通过分析低维构型的对称群并推广得到的。
3. 离散化Kakeya针问题的新纪录
离散化Kakeya针问题(又称Kakeya针集)关注在离散网格上如何放置针状线段使其覆盖最少点。Agent找到了一个比之前最佳构造少约3.7%点的构造。这个改进看似微小,但在该问题上,任何常数级别的改进都是重大突破,因为该问题与傅里叶分析和调和分析中的Kakeya猜想密切相关。
4. 符号不确定性问题的新纪录
符号不确定性问题由Donoho和Stark提出,关注在时频分析中,一个函数及其傅里叶变换同时稀疏的极限。Agent构造了一对具有特定稀疏度的函数对,打破了此前由Bandeira等人保持的记录。该构造利用了代数数论中高斯周期的性质,这是一个完全出乎意料的跨领域连接。
5. Erdős最小重叠问题的大幅改进下界
Erdős最小重叠问题(Erdős–Sós问题变体)询问:给定n个元素的集合族,每个集合大小为k,如何使任意两个集合的交集大小最小?此前最好的下界是近似线性的。Agent构造了一族集合,将下界从O(n/k)改进到O(n/k^0.87),这是一个实质性的多项式改进。构造基于有限几何中的Steiner系统,并引入了一种新的"错位"编码技巧。
6. Book Ramsey数的新无限族
除了上述五个问题,Agent还发现了Book Ramsey数的新无限族结果。Book图B_n由n个三角形共享一条公共边构成。对于特定的n序列,Agent证明了新的下界,改进了经典Rousseau-Sheehan结果。这些结果虽然没有改变主渐近线,但扩展了已知精确值的范围。
为什么这些发现重要?
1. 超越数值构造的"可解释性"
最关键的突破在于:Agent不仅给出了数值构造(如604点的坐标),还生成了配套的定理和证明,解释了这些构造为何有效。例如,对于Kakeya集合的新构造,Agent写出了一篇完整的分析论文,证明了该构造的尺寸上界,并给出了与Dvir方法对比的复杂度分析。这使得人类数学家可以验证、理解并进一步推广这些结果,而不是仅仅得到一个黑盒输出。
2. 自主的"科研过程"而非"结果生成"
观察Agent的对话记录,可以看到它们经历了类似人类科研的循环:提出假设→设计实验→验证失败→分析原因→修正假设→重新尝试。例如,在亲吻数问题上,一个Agent最初尝试了基于Leech格子的变形,但验证后发现对称性不足;随后它阅读了另一个Agent关于低维构型的笔记,转而采用"群作用轨道"方法,最终成功。这种涌现的科研流程是脚本化系统无法复现的。
3. 跨问题迁移能力
多个发现之间存在知识迁移的迹象。Agent在解决Kakeya问题时发展出的"纤维化"技术,后来被另一个Agent用于改进Erdős最小重叠问题的构造。这种跨问题的工具迁移在人类数学中很常见,但在AI系统中极为罕见,因为大多数系统是单任务优化的。
局限性与批评
尽管成果令人振奋,作者也坦诚地指出了几个重要局限:
问题范围有限:所有测试问题都是"构造型"问题(需要找到具体数学对象),而非"证明型"问题(需要证明一般性定理)。Agent没有展示出发现全新数学分支或提出颠覆性猜想的能力。
验证依赖计算:虽然Agent生成了证明,但这些证明的检查主要依赖自动化工具(如SageMath和自定义验证器),而非形式化证明助理(如Coq或Lean)。存在验证器bug导致错误结果的风险,尽管作者声称所有关键结果都经过独立复核。
计算成本极高:每个问题平均需要约20000个CPU核心时和5000个GPU时(用于LLM推理)。这个成本远超普通学术实验室的预算,使得该方法的可复制性存疑。
缺乏人类数学家参与:整个过程中人类只负责设置初始目标和最终审查,没有中间干预。这导致一些Agent提出了在人类看来"显然不优雅"的构造,虽然正确但缺乏理论深度。作者认为这是未来可以改进的方向——引入人机交互回路。
与相关工作的对比
- AlphaTensor:专注于单一矩阵乘法任务,使用强化学习搜索算法,但无多智能体协作,且不产生可解释的数学理论。
- AlphaGeometry:解决几何证明题,但使用固定的符号引擎+LLM组合,没有自主研究方向选择。
- FunSearch:利用LLM进化搜索数学构造,但使用单一模型,且结果需要人类验证,无共享文献机制。
- AI-Feynman:从数据中推测物理定律,但问题规模小,且不涉及多步推理或协作。
The Station的独特价值在于整合了多智能体、开放世界、共享文献和可解释输出这四个要素,形成了一个更接近"AI科学家"而非"AI解题器"的系统。
对未来研究的启示
多模型协作的潜力:不同模型家族的互补性可能是关键。作者观察到LLM在提出抽象数学结构方面更强,而数值优化模型在验证和搜索具体实例方面更强。未来可以探索更多样化的模型组合。
文献库作为"外部记忆":共享文献库不仅促进了Agent间的协作,还避免了重复劳动。一个Agent的失败记录可以帮助其他Agent避开同样的陷阱。这种"文明级"的知识积累机制值得在其他AI系统中借鉴。
可解释性作为设计目标:如果AI系统从一开始就被要求生成证明和分析(而非仅输出结果),其发现的可信度和可用性会大幅提升。这可能引导AI数学发现走向更健康的方向。
人机协作的新界面:既然Agent已经能自主产生可理解的数学论述,人类数学家可以介入指导方向(例如提出"试试用代数几何方法"),而不需要参与具体计算。这开辟了"AI执行+人类策展"的新型科研模式。
结论
The Station展示了开放世界多智能体环境在数学发现中的巨大潜力。它不仅找到了多个新结果,更重要的是,它以一种透明、可验证、可理解的方式做到了这一点——这让数学界可以信任并利用这些发现。虽然当前系统仍有局限,但它无疑是通向"AI数学家"之路上的重要里程碑。正如作者在结论中所说:"我们相信,这种开放式的、协作式的AI研究范式,将不仅限于数学,还可能扩展到物理、生物等更广泛的科学领域。"
原文链接:Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment