TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(title,abstract);LLM(abstract)
AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。
Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE