笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
KDD'26美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读
先说个背景,KDD(ACM SIGKDD)在数据挖掘领域什么地位应该不用我多说了,CCF-A类,录用率常年压在15%-20%之间,能中一篇都够吃几年老本了。今年美团技术团队一口气中了8篇,覆盖了推荐大模型、奖励建模、智能体搜索、广告拍卖机制这些方向,另外大众点评那边还在KDD Cup 2026的DataAgents赛道上拿了冠军和季军。我把这些论文的核心思路和比赛打法整理了一下,尽量把技术细节讲透,方便大家参考。
01 MTFM:无对齐的工业推荐基础模型
背景与动机
先聊聊推荐系统这边。工业级的推荐系统,尤其是美团这种覆盖外卖、到店、酒旅等多个业务场景的平台,一个很现实的问题就是:每个场景一个模型,维护成本高,而且场景之间的数据无法共享。跨域推荐(CDR)和多场景推荐(MSR)是解决这个问题的常见思路,但现有方法普遍有个硬约束——要求不同场景的输入特征严格对齐。这在实际中很难做到,因为不同场景的用户行为、物品属性、上下文信息差异很大,强行对齐要么丢失信息,要么需要大量人工特征工程。
MTFM的核心设计
MTFM(Meituan Foundation Model for Recommendation)的思路是干脆不做对齐。它基于Transformer架构,把不同场景的原始数据直接转换成异构Token序列。每个场景的数据有自己独特的特征空间,MTFM通过一个统一的Embedding层把这些异构Token映射到同一个语义空间,然后让Transformer自己去学习跨场景的知识关联。这个“无对齐”的设计,好处是显而易见的——你不需要为每个新场景重新设计特征对齐方案,模型的可扩展性大幅提升。
训练效率优化
但无对齐也带来一个问题:异构Token序列的长度和数量会非常庞大,直接训练Transformer的代价太高。MTFM在这里做了一个关键优化——多场景用户级样本聚合。具体来说,就是把同一个用户在多个场景下的行为序列合并成一个训练样本,而不是每个场景单独生成样本。这样做的效果是训练实例数量大幅减少,吞吐量显著提升。举个例子,假设一个用户在外卖、到店、酒旅三个场景各有10条行为记录,传统做法是生成3个样本,每个样本包含10条记录;MTFM的做法是生成1个样本,包含30条跨场景记录。训练数据的规模直接降了一个量级。
注意力机制优化
在模型结构上,MTFM用了Grouped-Query Attention(GQA)来替代标准的Multi-Head Attention。GQA的核心思想是让多个Query头共享一组Key和Value,这样能显著减少KV Cache的内存占用。对于推荐场景这种需要处理超长用户行为序列的任务,内存省下来就意味着可以处理更长的序列,或者用更大的batch size。另外,MTFM还设计了一个定制化的Hybrid Target Attention,专门用来捕捉目标物品与用户历史行为之间的相关性,比标准的交叉注意力计算更高效。
系统级优化
除了模型结构,MTFM还在系统层面做了不少工作。一个是Kernel融合,把多个小算子合并成一个大算子,减少Kernel启动开销和显存读写次数。另一个是消除CPU-GPU之间的阻塞,通过异步数据加载和预取,保证GPU在训练过程中不会因为等数据而空闲。这些优化加起来,训练和推理的吞吐量都有明显提升。
实验结果
离线实验和线上实验都验证了MTFM的有效性。团队基于MTFM构建了统一基座推荐大模型,替换了多个业务主场景的独立精排模型,并且已经全量上线。这里有个值得注意的点:论文强调“通过扩展模型容量和多场景训练数据可以实现显著的性能提升”,也就是说MTFM的收益是scaling出来的,模型越大、数据越多,效果越好,这跟LLM的训练规律是一致的。
02 CDRRM:对比驱动的可解释奖励建模
问题定义
奖励模型(Reward Model)在LLM对齐中的重要性不用多说,RLHF(基于人类反馈的强化学习)里那个“奖励模型”直接决定了模型对齐的质量。但传统奖励模型有两个痛点:一是黑箱,你不知道它为什么给这个分数;二是数据效率低,需要大量人工标注的偏好数据。
现有的一些改进方法尝试用评分准则(Rubric)来指导奖励模型,但生成的准则往往存在冗余和偏见,反而干扰判断。
CDRRM的方法
CDRRM(Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling)的做法是“对比-聚合”两阶段流程:
- 对比阶段:输入一对好/差回答,让模型定位两者之间的关键差异点。这个步骤的目的是找出真正影响回答质量的因素,而不是泛泛而谈的“好的回答应该逻辑清晰”这种废话。
- 聚合阶段:把对比阶段发现的差异点聚合成简洁、任务相关的评分准则。这些准则不是通用的,而是针对具体任务定制的,能直接指导评判模型打分。
这个流程有点像是先让模型“找不同”,再从“不同”中提炼出“标准”。好处是准则的生成是有依据的,不是凭空编造,而且因为是从具体样本中对比出来的,所以跟任务的相关性更强。
实验效果
实验在三个基准上达到了SOTA水平,同时缓解了话痨(verbosity)和位置(position)等常见偏见。最亮眼的一个结果是:只用3千个样本,就让未微调的模型超过了全量微调的基线。这说明CDRRM的数据效率非常高,对于标注资源有限的场景特别有价值。而且因为生成的准则是可解释的,你还能看到模型打分依据是什么,这在需要审计或调试的场景下非常实用。
03 LocalSearchBench:本地生活服务智能体搜索基准
研究空白
智能体搜索(Agentic Search)是最近的热门方向,但现有评测基准大多集中在通用领域,比如网页搜索、知识问答。本地生活服务(Local Life Services)这个细分领域——找餐厅、订酒店、查营业时间、比较价格——几乎没人做过系统性的评测。但这类任务恰恰是Agent落地的关键场景,因为用户的需求往往是多跳的,比如“找一家适合带小孩去的、人均100左右的、评分4.5以上的川菜馆”,这需要Agent同时处理地理位置、价格、评分、用户评价等多维度信息。
基准构建
LocalSearchBench覆盖了国内9座城市、6大服务品类(餐饮、酒店、娱乐等),包含900道多跳问答任务。配套还提供了两个工具:
- LocalPlayground:一个交互环境,Agent可以在这个环境里调用搜索工具、查看结果、做多轮决策。
- LocalRAG:一个商户检索工具,Agent可以通过它获取商户的详细信息。
这个基准的设计思路是让Agent面对真实世界的复杂性——多模态输入(文本、图片、地图)、非结构化数据(用户评论、商户描述)、干扰信息(不相关的搜索结果)。
评测发现
团队评测了16款主流大语言推理模型,结果不太乐观:当前模型在这类任务上表现普遍不佳,主要问题集中在信息完整性不足和可信度不高。具体来说,很多模型在回答时只给出部分信息,比如找到了餐厅但没说价格;或者引用了不存在的商户信息,编造数据。论文还剖析了模型在工具调用和多跳推理方面的典型缺陷,比如不知道什么时候该调用搜索工具、调用了之后不会正确解析结果、多跳推理时中间步骤出错导致最终答案错误等。
这个基准的价值在于:它为本地生活服务场景下的Agent训练和评测提供了一个标准化的测试平台,而且暴露的问题非常具体,可以直接指导后续的模型优化方向。
04 JTransNet:联合广告拍卖的可学习机制设计
问题背景
在线广告拍卖中,有一个很实际的问题:多个广告主可能联合出资竞拍一个广告位,比如品牌方和代理商各出一部分钱。这种情况下,拍卖机制需要同时满足两个性质:
- 匿名性:拍卖结果只依赖于竞标价值,与参与者身份和顺序无关。
- 确定性分配:同样的输入下,分配结果是唯一的,不能随机。
现有算法很难同时满足这两个性质,导致实际应用中存在分配不公平和激励不兼容的问题。比如,如果拍卖结果依赖于参与者的身份,那广告主可能会通过改变身份来操纵结果;如果分配是随机的,那广告主无法预测自己能否拿到流量,影响投放策略。
JTransNet方案
JTransNet的核心思路是把拍卖机制设计问题转化为一个可微分的端到端学习问题。具体来说:
- 引入匿名性和确定性分配机制作为约束条件,确保学习出来的拍卖算法满足这两个性质。
- 结合可微分的NeuralSort排序方法,让排序过程可微分,从而可以用梯度下降来优化拍卖机制。
NeuralSort的关键在于它提供了一种平滑的、可微分的排序近似方法。传统的排序操作(比如argsort)是不可微的,没法直接用梯度下降优化。NeuralSort通过softmax松弛和置换矩阵的连续近似,让排序变得可微,从而可以把拍卖机制嵌入到神经网络里端到端训练。
效果与落地
离线和在线实验都显著提升了平台广告收益。JTransNet已经在美团零售核心业务场景全量上线,促进了广告流量售卖的公平性和收益提升。这个工作的意义在于,它为工业界大规模自动化模型拍卖机制设计提供了一个有效的解决方案——以前拍卖机制靠人工设计规则,现在可以靠数据驱动自动学习。
05 UME:跨域ETA的统一元泛化框架
业务背景
ETA(Estimated Time of Arrival,预估到达时间)在即时物流场景中非常关键,尤其是在提单页面(checkout page),用户在下单前会看到预计送达时间。这个时间预估的准确性直接影响用户满意度和订单转化率。美团Keeta等国际化即时配送平台面临一个特殊挑战:跨域异质性。不同国家、不同城市的配送场景差异很大,比如东南亚的交通状况、配送距离、商家分布跟国内完全不同。
三大挑战
论文总结了现有方法的三个核心问题:
- 无法泛化到完全未见过的新市场域:如果模型只在成熟市场训练,到了新市场(比如刚开城的地方)完全无法做零样本预测。
- 跨域特征空间不一致:新市场缺乏历史数据积累,导致一些离线统计特征(比如“该区域平均配送时长”)结构性缺失。这种缺失不是随机的噪声,而是系统性的空白。
- 成熟域与冷启动域需要分别建模:传统做法是成熟市场一个模型、新市场一个模型,中间没有知识共享,阻碍了知识迁移,还增加了维护成本。
UME方案
UME(Unified Meta-generalization framework for ETA)设计了一个统一双分支网络,配合基于超网络的元学习机制。具体来说:
- 域级知识:超网络根据当前市场域的信息(比如城市、区域、时段)生成参数调制信号。
- 实例级上下文:每个样本的上下文特征(比如具体订单的配送距离、天气、路况)动态调制特征门控、专家注意力和最终预测。
这样做的效果是:模型既能利用成熟域学到的通用知识,又能根据新市场的具体情况进行自适应调整。对于特征缺失的问题,UME引入了知识蒸馏策略——用成熟域模型的知识来“补全”新市场缺失的特征信息,弥合信息差距。
实验结果
离线实验和线上实验都优于现有方法。这个工作的价值在于:它让ETA模型在冷启动阶段就能工作,不需要等新市场积累大量数据后再训练,这对于业务快速扩张非常重要。
06 GRAD:自动竞价生成式基础模型
问题背景
自动竞价(Auto Bidding)系统是现代广告平台的核心组件,广告主设定目标(比如ROI、预算),系统自动出价来优化投放效果。传统方法基于马尔可夫决策过程(MDP),需要设计状态、动作、奖励函数,而且很难平衡整体效果、广告主多样化目标和现实约束(比如CPM、ROI的硬性要求)。
近年来,条件生成模型(比如Transformer和扩散模型)提供了一种新思路:直接根据广告主偏好生成竞价轨迹,而不是显式地做决策。但生成方法也有问题:
- 分布偏移:离线训练时模型看到的分布跟在线实际运行时的分布不一致,导致生成轨迹不靠谱。
- 动作空间探索有限:生成模型倾向于生成“安全”的竞价轨迹,缺乏多样性,可能错过更好的竞价策略。
- 约束满足:CPM和ROI等约束是硬性的,生成模型很难保证不违反。
GRAD方案
GRAD(Generative model for Automated ad Bidding)的核心设计是:
- 动作混合专家(Action MoE):用多个专家网络来生成不同的竞价行为,每个专家擅长一种竞价策略(比如激进型、保守型、均衡型),然后根据上下文动态组合专家的输出。这样既保证了探索的多样性,又不会偏离有效策略太远。
- 因果Transformer进行约束优化:把约束(CPM、ROI)作为条件输入到Transformer中,让生成过程直接考虑约束满足。因果Transformer保证生成的竞价轨迹是时序一致的——当前出价只依赖于历史信息,不会“偷看”未来。
这个工作的亮点在于把生成模型应用到了竞价场景,而且通过MoE和约束条件解决了生成方法在工业应用中的关键问题。
07 HMAF:分层多坑位GD-RTB分配框架
问题背景
在线广告平台中,两种广告售卖模式经常共存:
- GD(Guaranteed Delivery)合约:广告主和平台签订合约,平台保证在一定时间内交付一定量的曝光。
- RTB(Real-Time Bidding)实时竞价:每次曝光都通过实时拍卖决定归属。
这两种模式在同一个平台上会互相竞争流量。现有方法的处理方式要么是把GD和RTB分开优化,互不干扰;要么用启发式的优先级规则(比如“GD优先”或“RTB优先”)。但问题在于,实际场景是多坑位的——一个页面有多个广告位,而且GD合约有曝光约束(比如“这个月必须曝光1000万次”),简单的优先级规则无法在短期收入最大化和长期交付目标之间找到平衡。
HMAF方案
HMAF(Hierarchical Multi-slot GD-RTB Allocation Framework)采用“规划-校准-执行”三阶段范式:
- 规划(Planning):离线阶段,用约束优化方法规划GD合约的曝光分配,确定每个时间窗口内需要交付的曝光量。
- 校准(Calibration):在线阶段,根据实时流量情况动态调整GD和RTB的竞争强度。比如流量低峰时,GD可以更激进地抢量;流量高峰时,GD可以让出部分流量给RTB,因为RTB的单价更高。
- 执行(Execution):在多坑位环境中做实时的列表级排序决策。这里不是对单个广告位做独立决策,而是把整个页面的多个广告位作为一个整体来优化。
这个框架的核心优势是把离线规划(长期目标)和在线决策(短期优化)结合起来,而且考虑了多坑位的联动效应。
08 MTGenRec:生成式推荐模型的分布式训练系统
背景与动机
生成式推荐(Generative Recommendation)是最近的热门方向,在搜索、推荐、广告领域都有显著效果提升。随着模型规模越来越大(Scaling Dense),业界越来越倾向于基于PyTorch生态构建训练引擎——毕竟LLM的训练工具链已经非常成熟,能复用就复用。
但PyTorch生态有个短板:对大规模稀疏Embedding训练的支持不够好。推荐模型的特点是大量稀疏ID特征(用户ID、物品ID、类目ID等),Embedding表非常大(几百GB甚至几TB),而且ID会动态上下线(新用户、新物品不断出现)。PyTorch原生的静态Embedding表无法处理这种情况。
MTGenRec的核心设计
MTGenRec针对这些问题做了几个关键优化:
动态Hashtable替换静态表:用动态Hashtable替代静态Embedding表,支持ID的动态上下线。新ID出现时,动态分配Embedding向量;ID下线时,回收存储空间。这样用户不需要手动管理Embedding表的大小和生命周期。
自动合表:推荐模型通常有多个特征字段,每个字段一个Embedding表。合表(将多个小表合并成一个大表)可以减少内存碎片、提升访存效率。MTGenRec自动识别哪些表可以合并,并生成高效的合并方案。
ID去重:一个训练batch内,同一个ID可能出现在多个样本中。如果在Embedding lookup时对每个样本都做一次查询,会浪费大量计算。ID去重就是先收集batch内所有唯一ID,做一次查询,然后通过索引映射回每个样本。这个优化在batch size很大的时候效果非常显著。
变长序列负载均衡:用户行为序列长度差异很大,有的用户只有几条记录,有的用户有几百条。在分布式训练中,如果按序列长度切分数据,会导致某些worker负载过重、某些worker空闲。MTGenRec通过变长序列的负载均衡策略,让每个worker处理的数据量大致相当。
配套技术
除了上述核心优化,MTGenRec还实现了断点续训(训练中断后从最近检查点恢复,不浪费之前的计算)、混合精度训练(FP16/BF16)、梯度累积(模拟更大batch size)、算子融合等配套技术。
实验结果
相比TorchRec baseline,MTGenRec取得了1.6倍到2.4倍的训练加速比,训练精度不变。从8卡扩展到128卡,实现了近似线性的扩展效率——这在大规模分布式训练中很难得,说明系统没有明显的通信瓶颈或负载不均问题。目前MTGenRec已经在美团内部多个核心场景落地。
KDD Cup 2026 DataAgents赛道冠军思路
最后聊聊比赛。KDD Cup在数据挖掘领域的地位不用多说,2026赛季的DataAgents赛道考察的是模型在真实复杂数据场景下的理解与推理能力。比赛的任务设定很有挑战性:给Agent一个异构的多模态数据包(包含数据库、PDF报告、JSON数据、图表、视频等),然后提出一个高层次的自然语言问题,Agent需要自主完成:
- 任务拆解与规划
- 工具选择与调用
- 异构数据推理
- 结果综合
整个推理链路包含并行分支、迭代循环和结果汇聚,非常考验Agent的自主性和稳定性。
技术方案
大众点评团队把“问点仔”(大众点评的智能助手)建设过程中积累的Agent Harness能力迁移到了赛题上,构建了一套完整的Agent运行时。核心设计包括:
多类型数据文件的自主探索:Agent能够自动识别数据文件的类型(数据库、PDF、JSON、视频等),选择合适的解析工具,提取关键信息。
分析工具的选择与执行:支持SQL和Python两种分析工具,Agent根据任务需求决定用哪种。比如需要做聚合查询时用SQL,需要做复杂计算或可视化时用Python。
稳定性与容错机制:这是长链路Agent任务最容易翻车的地方。团队实现了错误反馈(执行出错时把错误信息反馈给Agent,让它自己调整策略)、超时控制(防止某个子任务卡死拖垮整个流程)、自动重试(对于偶发性的执行失败自动重试)。
多模态子智能体:针对视频和非结构化文档这两种最难处理的数据类型,分别构建了多模态视频理解子智能体和文档ETL子智能体。视频理解子智能体负责抽取视频中的关键信息(比如字幕、场景、物体识别);文档ETL子智能体负责把PDF等非结构化文档转换成结构化数据,供主智能体后续分析使用。
经验总结
这次获奖验证了Agent Harness能力在复杂异构数据分析场景中的有效性。所谓Agent Harness,通俗讲就是“Agent的脚手架”——包括工具调用规范、错误处理机制、上下文管理、任务规划策略等。这些能力在真实业务中打磨过,迁移到比赛场景中依然能打。
目前相关代码已经开源在GitHub上,后续团队还会通过技术博客分享更多技术细节。
以上就是8篇论文和KDD Cup冠军方案的详细解读。整体来看,美团今年的工作有几个明显的趋势:一是推荐系统在往基础模型方向走,试图用一套架构统一多个场景;二是生成模型在广告和推荐中的应用越来越深入;三是Agent在复杂数据分析场景的落地越来越成熟。如果对哪篇论文的具体实现细节感兴趣,可以下载原文细读。