Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
飞行中的思考:通过潜在思维策略优化提升测试时推理
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 LTPO通过在测试时优化潜在思维向量,提升LLM在复杂推理任务中的鲁棒性和准确性。
Comments Accepted to ICLR 2026