DEPO: Dual-Efficiency Preference Optimization for LLM Agents
DEPO:用于LLM代理的双效偏好优化
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 DEPO通过双效偏好优化方法提升LLM代理的效率和性能,减少token和步骤消耗,同时在多个基准测试中表现优异。
Comments Accepted to AAAI 2026