论文速读|MetaClaw:让 AI 智能体在生产环境中持续进化 原论文:MetaClaw: Just Talk – An Agent That Meta-Learns and Evolves in the Wild 作者:Peng Xia, Jianwen Chen, Xinyu Yang 等 2026-04-14 持续学习与自进化 #AI Agent #LLM #强化学习 #Meta-Learning #Continual Learning
论文速读|Youtu-Agent:自动化构建 + 混合策略优化的 LLM 智能体框架 原论文:Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization 作者:Yuchen Shi, Yuzheng Cai, Siqi Cai, Zihan Xu 等(腾讯优图实验室、复旦大学、厦门大学) 发表时间:2025 年 12 月 2026-04-14 Agentic RL #AI Agent #LLM #强化学习 #GRPO #自动化
论文速读|OpenClaw-RL:用对话训练任意 AI 智能体 原论文:OpenClaw-RL: Train Any Agent Simply by Talking 作者:Yinjie Wang, Xuyang Chen, Xiaolong Jin, Mengdi Wang, Ling Yang 代码:Gen-Verse/OpenClaw-RL 2026-04-01 Agentic RL #AI Agent #LLM #强化学习 #Agentic RL
Claude Code 国内使用指南 本文整理自腾讯云开发者社区,介绍如何在国内顺畅使用 Claude Code 进行 AI 编程。 2026-02-08 Agent 工程与工具 #AI工具 #Claude Code #开发工具
GRPO 去掉 Critic Model 会带来哪些问题? GRPO(Group Relative Policy Optimization)相比 PPO 最显眼的改动,就是去掉了 Critic Model(价值网络)。这一简化让训练流程干净了很多,但也带来了一系列不容忽视的问题。本文系统梳理这些问题,以及后续是如何应对的。 2026-01-22 强化学习 #LLM #强化学习 #PPO #GRPO #RLHF
DAPO 与 GSPO 相对于 GRPO 的改进 GRPO:强化学习的”上一代方法” DeepSeek 开创性地使用了一种叫 GRPO(Group Relative Policy Optimization,组相对策略优化) 的算法。 用大白话解释它的逻辑: 对同一道题,让 AI 生成一组(比如 8 个)不同的回答,然后比较这组回答里谁得分高、谁得分低,以此作为”相对好坏”的信号来更新 AI。 这比之前的方法(PPO)简单很多——PPO 需要额 2026-01-20 强化学习 #强化学习 #DAPO #GSPO