LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models
LLMdoctor: 基于令牌级流引导的偏好优化用于大语言模型高效测试时间对齐
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)
AI总结 LLMdoctor通过令牌级流引导偏好优化,实现高效的大语言模型测试时间对齐,提升对齐精度并保留生成多样性。
Comments Accepted by AAAI26