“种下一棵树最好的时间是十年前,其次是现在”
🙋 个人简介
你好!我是 丁一帆,目前于美团 LongCat Team 担任后训练算法实习生。
这个博客用来记录我的学习笔记 / 技术探索 / 项目经验,希望对你有所帮助。
✨ 研究兴趣
我当前的主要研究大语言模型(LLM),关注 强化学习(RL/RLVR),OPD,数据合成,Agent 以及 Agentic RL 等方向。
我也关注大模型的下游应用,例如 deep research 和 vibe coding。
⭐ 科研经历
强化学习
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation AAAI2027 在投 · 2026年05月 – 至今 · 美团 LongCat Team
- 研究背景:RLVR(如GRPO)广播响应级奖励,OPD给出 token级优势但受限于teacher水平。固定系数融合二者存在幅值失配与时序失配,且训练初期出现熵坍缩。
- 稳定优势融合框架SAF:针对OPD优势设计四阶段轻量级流水线:top-k%稀疏化剔除低显著性token,有界tanh压缩解决幅值失配;基于KL散度触发的预热/退火机制动态调节OPD系数,解决时序失配,各阶段可独立开关且几乎不增加计算开销。
- 性能突破:在Qwen3-1.7B/4B/8B上覆盖七个数学推理与代码生成基准评测,SAF在全部六个”模型-领域”设置上均超越固定系数融合GRPO+OPD基线,综合得分提升 0.51%-2.70%,同时避免熵坍缩、提升表现上限。
DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory ACL2027 在投 · 2026年03月 – 至今
- 研究背景:自博弈(Self-Play)训练出题模型与解题模型交替进化,但出题模型无法”看到”解题模型错因,易导致生成多样性塌缩与伪标签失真,已有工作依赖外部任务资源缓解,但成本高、收益有限。
- 诊断引导的分层错误记忆库:提出轻量级诊断器(Diagnostician),比较解题模型”答对/答错”轨迹提炼可迁移错因,构建 Active/Mastered 双状态分层记忆库,设计频率驱动的自由探索与针对性生成混合策略,让出题模型聚焦解题模型当前能力边界。
- 双置信度伪标签过滤:在多数投票构造伪标签场景下,同时施加绝对置信度(保留中等难度问题)与相对置信度(剔除高冲突问题)约束,提升 GRPO 训练数据质量。
- 性能突破:在 Qwen3-4B/8B-Base 与 OctoThinker-8B 三基座、9 个基准评测,不依赖外部任务资源,数学推理平均分较 R-Zero 提升 4.6 个百分点,超越最强外部监督基线 DARC;在 OctoThinker-8B 上数学推理提升 16.9%,域外泛化零样本迁移提升 17.8%。
DPO-Δ: Direct Preference Optimization with Residual Layer Duplication 2025年07月 – 2025年12月
- 研究背景:现有dpo训练方法难以提供准确的奖励信号,且需对所有原始参数训练,成本较高。
- 更加精准的奖励信号:冻结主干网络参数并复制关键层,仅训练复制层实现高效偏好优化,设计残差学习机制,以原始层与复制层logits差值作为残差叠加,在保持原模型能力的同时实现精准对齐,在小模型指导大模型生成场景下尤其有效。
- 显存消耗降低:仅需训练部分参数,显著降低训练显存与计算开销,为大模型轻量化对齐提供新范式。
- 性能突破:在AlpacaEval上相比原始dpo性能提升 9.67%,可训练参数仅为原始模型的 3/4。
数据合成
Fanno: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Only ACL2025 · 2024年09月 – 2025年02月 论文地址: https://aclanthology.org/2025.findings-acl.906/
- 研究背景:高质量指令数据通常依赖人工标注或昂贵的闭源模型(GPT-4)蒸馏,成本高、可扩展性差,现有开源自动化方案仍依赖人工种子指令,难以兼顾多样性与复杂性。
- 无需种子数据的三阶段全自动标注框架:仅用 7B开源模型设计”文档预筛—指令生成—回复生成”全流程,预筛阶段结合规则过滤与社区发现算法去重降噪,指令生成阶段以标签池驱动生成,并设计 Think Different prompt 做指令增强,摆脱对人工种子的依赖。
- UCB驱动的高质量示例筛选:用 UCB算法动态挑选高质量种子指令作为小样本示例,平衡”利用”与”探索”,随迭代提升生成指令复杂性与多样性,并引入 RAG + 教师模型自评筛选更正确回复。
- 性能突破:仅用 16k 条零人工、零闭源模型生成的数据微调,在 Open LLM Leaderboard 上取得 58.23%(LLaMA-2),逼近 3 倍数据量的 Alpaca-GPT4-Cleaned(58.53%),并在 Mistral-7B 上以 65.55% 反超 Alpaca-Cleaned 的 64.99%,相较同类框架 WizardLM(54.32%)、Muffin(55.42%)、Humpback(58.13%)均实现显著超越。
大模型隐私与数据安全
Layer-Adaptive Membership Inference: Dynamic Perplexity Calibration for Training Data Detection 2025年03月 – 2025年07月
- 研究背景:面向大模型训练数据隐私泄露风险评估,成员推理攻击(Membership Inference Attack, MIA)通过分析模型输出的统计特征,精准推断特定数据样本是否被用于模型训练,是模型安全领域的核心研究方向之一。
- 层重要性自适应选择机制:提出层重要性自适应选择机制,通过轻量级可训练参数层量化各层对成员推断的敏感程度,并动态校准困惑度(Perplexity)差异,构建高区分度的成员身份判别指标。
- 性能突破:在WikiMIA和MIMIR数据集上进行验证,显著增强了成员推理攻击的有效性与鲁棒性。
💼 实习经历
美团 LongCat Team · 算法实习生 · 北京 2026年05月 – 至今
vivo上海研发中心 · 影像算法研究员 · 上海 2025年07月 – 2025年10月
🚀 项目经历
OpenClaw-RL: 基于下一状态信号驱动的通用智能体在线强化学习 2026年02月 – 2026年05月
- 背景:现有智能体(Agent)训练依赖人工标注或离线合成数据,模型上线后无法实时更新,未能利用每次真实交互产生的下一状态信号作为学习源,导致训练效率低、个性化适配与泛化能力差。
- 下一状态信号驱动的Token级奖励构建:以交互完成后产生的下一状态(用户重新提问、修正、显式反馈等)反向构建增强 teacher 上下文,通过在线策略蒸馏(OPD)对比 teacher 与 student 在原始响应上的概率差值,将稀疏的标量反馈转化为稠密的token-level 奖励信号,为强化学习提供更细粒度、更贴合真实用户意图的监督。
- 异步共线训练架构:设计三进程异步流水线——模型服务在线请求、下一状态信号评估、训练器策略更新三者并行解耦互不阻塞,使智能体在持续被使用的过程中同步完成经验采集与参数更新,实现”边交互、边进化”的在线闭环。
- 性能突破:基于 OpenClaw 交互模式验证该框架,线上部署模型无需额外人工标注,仅通过用户日常交互中的几轮反馈即可完成对用户个性化需求的对齐与适配,验证了下一状态信号作为自我进化学习源的有效性。
🛠 技能
编程语言
python, C++
框架 & 工具
llamafactory,trl,verl claude code,openclaw
📬 联系我
- GitHub:github.com/kissshhot
- 谷歌学术:Google Scholar
- 小红书:我的小红书主页
- Email:dingyii2002@gmail.com
- 个人网站:kissshhot.github.io