AI情报2026年8月19日AI情报
文章
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs: Group-relative policy optimization has emerged as a...
Key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successe...
Frontier 编辑部来源: arXiv
01
来源简报
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs: Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successe...