Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention
文本自注意力网络:通过基于文本的梯度注意力进行测试时偏好优化
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出TSAN,一种无需参数更新的测试时偏好优化方法,通过文本梯度空间实现多候选响应的系统分析与综合,提升输出质量。
Comments AAAI2026