Skip to content
AI IntelligenceAug 20, 2026AI Intelligence
Article

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs: Group-relative policy optimization has emerged as a...

Key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successe...

Frontier EditorialSource: arXiv
01

Source Brief

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs: Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successe...