arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2602.20933 2026-02-25 cs.CV 50%

Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting

丢弃锚点与球面谐波用于稀疏视角高斯点扩散

Shuangkang Fang, I-Chao Shen, Xuanyang Zhang, Zesheng Wang, Yufeng Wang, Wenrui Ding, Gang Yu, Takeo Igarashi

机构 * Beihang University(北京航空航天大学) The University of Tokyo(东京大学) StepFun

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 DropAnSH-GS通过引入锚点机制和球面谐波系数的Dropout策略,有效缓解稀疏视角下3DGS的过拟合问题,提升模型鲁棒性与压缩能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20140 2026-02-24 physics.chem-ph 50%

PackFlow: Generative Molecular Crystal Structure Prediction via Reinforcement Learning Alignment

PackFlow:通过强化学习对齐进行生成分子晶体结构预测

Akshay Subramanian, Elton Pan, Juno Nam, Maurice Weiler, Shuhui Qu, Cheol Woo Park, Tommi S. Jaakkola, Elsa Olivetti, Rafael Gomez-Bombarelli

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 PackFlow通过强化学习对齐生成分子晶体结构,提高预测准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD 50%

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18799 2026-02-24 cs.CV 50%

Rethinking Preference Alignment for Diffusion Models with Classifier-Free Guidance

重新思考扩散模型的偏好对齐:基于分类器自由引导

Zhou Jiang, Yandong Wen, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出基于分类器自由引导的方法,通过分解偏好学习为两个模块并生成对比引导向量,提升扩散模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16987 2026-02-20 cs.CY 50%

A testable framework for AI alignment: Simulation Theology as an engineered worldview for silicon-based agents

一种可测试的AI对齐框架:模拟神学作为硅基智能体的工程世界观

Josef A. Habdank

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出模拟神学作为可测试的AI对齐框架,通过内化目标减少欺骗行为,促进AI与人类的可持续共存。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15567 2026-02-18 cs.RO 50%

Constraining Streaming Flow Models for Adapting Learned Robot Trajectory Distributions

约束流式流模型以适应学习的机器人轨迹分布

Jieting Long, Dechuan Liu, Weidong Cai, Ian Manchester, Weiming Zhi

机构 * School of Computer Science, The University of Sydney, Australia(计算机科学学院,悉尼大学,澳大利亚) School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney, Australia(航空航天、机械与机电工程学院,悉尼大学,澳大利亚) Australian Center For Robotics, The University of Sydney, Australia(机器人研究中心,悉尼大学,澳大利亚) College of Connected Computing, Vanderbilt University, TN, USA(连接计算学院,范德比尔特大学,美国)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 CASF通过约束感知流式流模型在实时中适应机器人轨迹,确保安全性和可行性,优于传统方法。

Comments 8 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09713 2026-02-17 cs.CV 50%

Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models

Stroke3D: 通过潜在扩散模型将2D笔触提升为拟合的3D模型

Ruisi Zhao, Haoren Zheng, Zongxin Yang, Hehe Fan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 Stroke3D通过潜在扩散模型,将用户绘制的2D笔触和文本提示转化为拟合的3D模型,实现可控的骨骼生成和纹理网格合成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08346 2026-02-10 cs.CV 50%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07564 2026-02-10 cs.CV 50%

SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens

SIGMA: 带多属性标记的选择性交错生成

Xiaoyan Zhang, Zechen Bai, Haofan Wang, Yiren Song

机构 * Creatly AI University of Michigan(密歇根大学) Lovart AI National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 SIGMA通过引入多属性标记实现多条件生成,提升可控性、一致性和视觉质量,优于Bagel在组合任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13885 2026-02-10 cs.IR 50%

Retrieval-GRPO: A Multi-Objective Reinforcement Learning Framework for Dense Retrieval in Taobao Search

检索-GRPO:面向淘宝搜索密集检索的多目标强化学习框架

Xingxian Liu, Dongshuai Li, Jiahui Wan, Tao Wen, Gui Ling, Yuliang Yan, Fuyu Lv, Dan Ou, Haihong Tang, Bo Zheng

专题命中 后训练与偏好优化 :LLM(abstract)

AI总结 Retrieval-GRPO通过多目标强化学习框架解决密集检索中的硬负样本依赖和跷跷板效应问题,提升复杂长尾查询的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03304 2026-02-04 cs.IR 50%

To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention

是进行搜索还是不进行搜索:通过因果干预对深度搜索代理的决策边界进行对齐

Wenlin Zhang, Kuicai Dong, Junyi Li, Yingyi Zhang, Xiaopeng Li, Pengyue Jia, Yi Wen, Derong Xu, Maolin Wang, Yichao Wang, Yong Liu, Xiangyu Zhao

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出DAS方法,通过因果干预和偏好优化对深度搜索代理的决策边界进行对齐,以解决过度搜索和不足搜索问题,提升搜索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23222 2026-02-02 cs.CV 50%

Region-Normalized DPO for Medical Image Segmentation under Noisy Judges

区域归一化的DPO用于在噪声裁判下的医学图像分割

Hamza Kalisch, Constantin Seibold, Jens Kleesiek, Ken Herrmann, Frederic Jonske

机构 * Institute for AI in Medicine (IKIM), University Hospital Essen (AöR), Essen, Germany(人工智能医学研究所(IKIM)、埃森大学医院(AöR)) Department of Nuclear Medicine, University Hospital Essen (AöR), Essen, Germany(核医学系、埃森大学医院(AöR)) Department of Physics, TU Dortmund, Dortmund, Germany(物理系、多特蒙德技术大学) Heidelberg University Hospital, Heidelberg, Germany(海德堡大学医院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出区域归一化的DPO方法,用于在噪声裁判下提升医学图像分割的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20760 2026-01-29 cs.HC 50%

Exploring Re-inforcement Learning via Human Feedback under User Heterogeneity

通过用户异质性探索基于人类反馈的强化学习

Sarvesh Shashidhar, Abhishek Mishra, Madhav Kotecha

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本研究通过聚类和个性化奖励模型处理用户异质性,提升强化学习模型的胜率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14037 2026-01-22 cs.CV 50%

Human detectors are surprisingly powerful reward models

人类检测器出人意料地强大

Kumar Ashutosh, XuDong Wang, Xi Yin, Kristen Grauman, Adam Polyak, Ishan Misra, Rohit Girdhar

机构 * Meta University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出 HuDA 模型,通过简单奖励函数提升视频生成中的人体运动质量,胜率高达 73%。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10599 2026-01-21 cs.CY 50%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 后训练与偏好优化 :LLM(abstract)

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02151 2026-01-12 cs.CV 50%

AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models

AttriCtrl: 细粒度控制扩散模型中的审美属性强度

Die Chen, Zhongjie Duan, Zhiwen Li, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 AttriCtrl通过轻量级框架实现扩散模型中审美属性的细粒度连续控制,提升生成图像的个性化与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00675 2026-01-09 cs.RO 50%

RoboReward: General-Purpose Vision-Language Reward Models for Robotics

RoboReward: 通用视觉-语言奖励模型用于机器人学

Tony Lee, Andrew Wagenmaker, Karl Pertsch, Percy Liang, Sergey Levine, Chelsea Finn

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 RoboReward通过构建机器人奖励数据集和基准,训练视觉-语言奖励模型,验证了其在机器人学习中的有效性,并展示了改进策略学习和缩小与人工奖励差距的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21059 2026-01-06 cs.CV 50%

VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation

VisionReward: 面向图像和视频生成的细粒度多维人类偏好学习

Jiazheng Xu, Yu Huang, Jiale Cheng, Yuanming Yang, Jiajun Xu, Yuan Wang, Wenbo Duan, Shen Yang, Qunlin Jin, Shurun Li, Jiayan Teng, Zhuoyi Yang, Wendi Zheng, Xiao Liu, Dan Zhang, Ming Ding, Xiaohan Zhang, Xiaotao Gu, Shiyu Huang, Minlie Huang, Jie Tang, Yuxiao Dong

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 VisionReward通过细粒度多维人类偏好学习框架,提升图像和视频生成的偏好对齐效果,实验显示其在准确性与胜率上均优于现有方法。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 50%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19291 2025-12-23 eess.SY cs.SY 50%

Stability Analysis of a B-Spline Deep Neural Operator for Nonlinear Systems

B-样条深度神经算子在非线性系统中的稳定性分析

Raffaele Romagnoli, Soummya Kar

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出基于B-样条深度神经算子的稳定性分析方法,通过动态模式分解和Koopman算子框架,实现对非线性系统稳定性特性的系统表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 50%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16741 2025-12-19 cs.SE 50%

An Empirical Study of the Realism of Mutants in Deep Learning

深度学习中突变体真实性的实证研究

Zaheed Ahmed, Philip Makedonski, Jens Grabowski

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究通过实证分析比较深度学习中预训练与后训练突变方法的真实性,发现预训练突变体在耦合强度和行为相似性上更优,但其高计算成本促使需开发更高效的后训练操作符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14273 2025-12-17 cs.CV 50%

Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in

Zoom-Zero: 通过时间放大实现强化的粗到细视频理解

Xiaoqian Shen, Min-Hung Chen, Yu-Chiang Frank Wang, Mohamed Elhoseiny, Ryo Hachiuma

机构 * NVIDIA(英伟达) KAUST(卡塔尔人工智能研究所在线大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 Zoom-Zero通过时间放大和令牌选择性信用分配提升视频问题回答的时空定位精度和答案准确性。

Comments Project page: https://xiaoqian-shen.github.io/Zoom-Zero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05145 2025-12-08 cs.CV 50%

Self-Improving VLM Judges Without Human Annotations

无需人工标注的自改进VLM评判模型

Inna Wanyin Lin, Yushi Hu, Shuyue Stella Li, Scott Geng, Pang Wei Koh, Luke Zettlemoyer, Tim Althoff, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 无需人工标注,通过自训练提升VLM评判模型的准确性和多维度表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 50%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20256 2025-11-26 cs.CV 50%

The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation

图像作为自身奖励:基于对抗性奖励的图像生成强化学习

Weijia Mao, Hao Chen, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文提出Adv-GRPO框架,通过对抗性奖励提升图像生成质量,利用图像自身作为奖励,结合参考图像和基础模型,实现更高质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV 50%

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 后训练与偏好优化 :LLM(abstract)

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV 50%

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16669 2025-11-25 cs.CV 50%

Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

视频作答:联合GRPO预测并生成下一个视频事件

Junhao Cheng, Liang Hou, Xin Tao, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 VANS通过联合GRPO方法,利用强化学习对齐视觉-语言模型与视频扩散模型,实现视频下一个事件预测任务的高精度视频生成与描述生成。

Comments Project page: https://video-as-answer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07806 2025-11-12 cs.CV 50%

PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier

Shaomeng Wang, He Wang, Xiaolu Wei, Longquan Dai, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏