Skip to content
AI情报2026年8月19日AI情报
文章

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs: Group-relative policy optimization has emerged as a...

Key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successe...

Frontier 编辑部来源: arXiv
01

来源简报

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs: Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successe...