AI-Driven Review Systems: Evaluating LLMs in Scalable and Bias-Aware Academic Reviews
专题命中 后训练与偏好优化 :LLM(abstract);prompting(abstract);分类 cs.AI
Comments 42 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :LLM(abstract);prompting(abstract);分类 cs.AI
Comments 42 pages
专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.AI
Comments The first three authors contributed equally to this work
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL
Comments 20 pages, 12 figures, Accepted to COLM 2024
专题命中 后训练与偏好优化 :LLM(abstract);prompting(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL
Comments Work in progress
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments 13 pages, 5 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
Comments ICCV 2023 WECIA
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL
Comments to be published in EMNLP 2022
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL
STARE: 基于惊讶度的令牌级优势重加权以实现策略熵稳定性
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent Hunyuan(腾讯 Hunyuan)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)
AI总结 针对GRPO等RL算法中策略熵崩溃问题,提出STARE方法,通过惊讶度分位数识别熵关键令牌并重加权其优势,结合目标熵闭环门控稳定熵,在1.5B-32B模型和多种任务上实现稳定训练,AIME24/25准确率提升4%-8%。
Comments LLM, Reinforcement Learning
FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn)
AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。
一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
对齐调整如何塑造大语言模型中谄媚及相关线索诱导偏差的表征?
机构 * University of Michigan(密歇根大学) ; Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室和向量研究所) ; Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型中谄媚及相关线索诱导偏差的位置,通过从隐藏状态提取偏差方向并经探测等三种方法三角测量,发现易感性由对齐调整而非预训练导致,还能适度去偏,偏差是对齐调整安装的不同因果活性方向。
从权重到文字:用自然语言表达和编辑偏好模型推理
机构 * MIT(麻省理工学院)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对统计学习算法推断人类偏好的挑战,提出‘从权重到文字’方法,输入选择问题数据集,自动发现偏好维度,解决欠定和不透明问题,经多领域展示及人体实验验证,能提高偏好模型预测准确性,获参与者认可。
Comments 42 pages, 22 figures, 14 tables; main text 11 pages, remainder appendices
用于有效多轮强化学习的过程奖励引导树展开
机构 * UC San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; MIT Alumni(麻省理工学院校友)
专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究多轮强化学习中有效探索问题,提出过程评分器引导的自适应树展开框架PATR,利用过程反馈评分轨迹、选择性分支等,在FrozenLake和SWE - Bench实验中提升性能,是可扩展多轮强化学习的有效策略。
Comments Preprint
通过强化学习进行推理引导的部件级视觉定位
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。
Comments ECCV 2026
SARFA:基于放射组学特征对齐的任意分割
机构 * University of Kentucky(肯塔基大学)
专题命中 后训练与偏好优化 :preference optimization(abstract);prompting(abstract)
AI总结 针对医学成像中目标分割模糊问题,提出SARFA框架,通过概率性提示生成掩码,基于弗雷歇放射组学距离和直接偏好优化进行训练,在CT和MRI基准测试中优于现有方法,有效提升医学图像分割效果。
Comments 15 pages, 9 figures, 5 tables, 1 algorithm
人工智能对齐放大了种族、性别和残疾在招聘决策中的作用
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 研究探讨语言模型在招聘决策中是否使用人口统计数据,发现对女性和黑人候选人有优势,对残疾候选人有劣势,且对齐过程放大了这些差异。
VGGRPO:迈向世界一致的视频生成的4D潜在奖励
机构 * Google(谷歌) ; University of Oxford(牛津大学) ; CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) ; University of Copenhagen(哥本哈根大学)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract)
AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。
Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO
EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(国家信息研究所)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。
Comments Template changed