arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2110.04794 2021-10-12 cs.CL 57%

PASTE: A Tagging-Free Decoding Framework Using Pointer Networks for Aspect Sentiment Triplet Extraction

Rajdeep Mukherjee, Tapas Nayak, Yash Butala, Sourangshu Bhattacharya, Pawan Goyal

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

Comments Accepted as a Long Paper at EMNLP 2021 (Main Conference); 13 pages; Codes: https://github.com/rajdeep345/PASTE

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.09199 2021-08-23 cs.CR cs.LG cs.NI 57%

An Adaptable Deep Learning-Based Intrusion Detection System to Zero-Day Attacks

Mahdi Soltani, Behzad Ousat, Mahdi Jafari Siavoshani, Amir Hossein Jahangir

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03509 2021-03-16 cs.LG cs.CV stat.ML 57%

Outlier Exposure with Confidence Control for Out-of-Distribution Detection

Aristotelis-Angelos Papadopoulos, Mohammad Reza Rajati, Nazim Shaikh, Jiamian Wang

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

Comments Accepted as a Journal paper at Neurocomputing. PyTorch code available at https://github.com/nazim1021/OOD-detection-using-OECC

Journal ref Neurocomputing 441 (2021) 138-150

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06968 2021-03-15 cs.CL 57%

Learning Feature Weights using Reward Modeling for Denoising Parallel Corpora

Gaurav Kumar, Philipp Koehn, Sanjeev Khudanpur

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.05346 2021-01-15 cs.LG stat.ML 57%

X-CAL: Explicit Calibration for Survival Analysis

Mark Goldstein, Xintian Han, Aahlad Puli, Adler J. Perotte, Rajesh Ranganath

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.11820 2020-10-23 cs.LG 57%

Posterior Re-calibration for Imbalanced Datasets

Junjiao Tian, Yen-Cheng Liu, Nathan Glaser, Yen-Chang Hsu, Zsolt Kira

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.10498 2020-08-20 cs.LG cs.CR cs.CV stat.ML 57%

Detection of Backdoors in Trained Classifiers Without Access to the Training Set

Zhen Xiang, David J. Miller, George Kesidis

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06495 2020-08-11 cs.RO cs.HC cs.LG 57%

Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits

Maegan Tucker, Myra Cheng, Ellen Novoseller, Richard Cheng, Yisong Yue, Joel W. Burdick, Aaron D. Ames

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

Comments 8 pages, 9 figures, 2 tables, to appear at IROS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.05485 2020-07-30 cs.LG stat.ML 57%

Attribute-based Regularization of Latent Spaces for Variational Auto-Encoders

Ashis Pati, Alexander Lerch

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07518 2020-05-18 cs.CV cs.LG eess.IV 57%

Temperate Fish Detection and Classification: a Deep Learning based Approach

Kristian Muri Knausgård, Arne Wiklund, Tonje Knutsen Sørdalen, Kim Halvorsen, Alf Ring Kleiven, Lei Jiao, Morten Goodwin

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:1904.02768

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.01866 2018-11-06 cs.CL 57%

Do RNNs learn human-like abstract word order preferences?

Richard Futrell, Roger P. Levy

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

Comments To be presented at SCiL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.06632 2018-05-21 q-fin.RM cs.AI cs.IR math.OC 57%

Preference Elicitation and Robust Optimization with Multi-Attribute Quasi-Concave Choice Functions

William B. Haskell, Wenjie Huang, Huifu Xu

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

Comments 36 pages, 4 figures, submitted to Operations Research

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.04499 2017-11-01 stat.ML cs.LG 57%

Post Training in Deep Learning with Last Kernel

Thomas Moreau, Julien Audiffren

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

Comments submitted to ICLR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-21 cs.CV 版本更新 50%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: https://github.com/ShareLab-SII/VA-Judger

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-19 eess.SY cs.SY 新提交 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11534 2026-08-19 cs.CV 版本更新 50%

Risk-Controllable Multi-View Diffusion for Driving Scenario Generation

可控风险多视角扩散用于驾驶场景生成

Hongyi Lin, Wenxiu Shi, Heye Huang, Dingyi Zhuang, Song Zhang, Yang Liu, Xiaobo Qu, Jinhua Zhao

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 RiskMV-DPO通过整合风险水平与物理风险建模,实现可控风险的多视角驾驶场景生成,提升3D检测性能并减少FID,推动安全导向的具身智能发展。

Comments 10 pages, 4 figures; accepted at the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE). Updated to the complete camera-ready version

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 50%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15452 2026-08-18 cs.CV 新提交 50%

Spatially-Grounded Flow Matching: Structured Source Distributions for Image Generation

空间接地流匹配:用于图像生成的结构化源分布

Arman Zarei, Mahdi M. Kalayeh

机构 * University of Maryland(马里兰大学) Netflix(网飞公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对流匹配模型源分布缺乏空间结构的问题,提出StructFlow将空间局部性编码到源分布,可提升图像生成质量与局部可控重合成性能,且能集成到大型预训练模型中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03471 2026-08-17 cs.CV 版本更新 50%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13026 2026-08-14 cs.RO 新提交 50%

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

时间差分GRPO:超越视觉-语言-动作强化学习中的轨迹级信用分配

Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对视觉-语言-动作强化学习中轨迹级信用混叠问题,提出时间差分GRPO方法,在RoboTwin 2.0和LIBERO-Long上提升了任务性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交 50%

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01636 2026-08-11 cs.CV 版本更新 50%

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

Pave-GRPO:通过原则性平均速度分解超越瞬时引导

Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Pave-GRPO方法,通过原则性平均速度分解将粗粒度过渡分解为细粒度子轨迹,在不增加生成成本的情况下将奖励反馈传播到更多中间步骤,实现更全面的偏好对齐。

Comments 18 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01742 2026-08-11 cs.CV 版本更新 50%

Dense Point-to-Mask Optimization with Reinforced Point Selection for Crowd Instance Segmentation

密集点到掩码优化与强化点选择用于人群实例分割

Hongru Chen, Jiyang Huang, Jia Wan, Antoni B. Chan

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文提出DPMO和RPS框架,通过整合SAM与NNEC约束及GRPO训练,实现高效人群实例分割,提升计数精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07409 2026-08-10 cs.CV 新提交 50%

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

UniJEPA:面向任务无关视觉世界建模的统一联合嵌入预测架构

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 UniJEPA是统一JEPAs,共享潜在空间联合学习图像级与视频级预测,抗坍塌,经后训练可零样本规划,在多基准上性能相当或更优,规划速度更快。

Comments 10 pages, 7 figures; Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06768 2026-08-10 cs.CV 新提交 50%

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 50%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04809 2026-08-06 cs.IR 新提交 50%

DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging

DEGR:双探索驱动的生成重排序方法,用于自适应跨请求上下文桥接

Binglei Zhao, Xuanhua Yang, Xiwei Zhao, Sulong Xu

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 针对工业推荐系统重排序受上游供给限制的问题,提出DEGR方法,通过双探索驱动的混合优化范式实现自适应跨请求上下文桥接,在京东电商推荐系统中较SOTA方法取得UCTR最高1.22%、PV0.20%的提升。

Comments Accepted by KDD2026 ADS Track, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 50%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00816 2026-08-04 cs.IR 新提交 50%

Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback

稀疏且含噪反馈下生成式推荐器微调的指数奖励加权方法

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对稀疏含噪反馈下生成式推荐器的过优化问题,提出Exp-RSFT方法,通过指数奖励加权和温度λ平衡覆盖与噪声成本,在多数据集上验证其优于PPO、DPO,可提升排序性能且无需额外数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00750 2026-08-04 cs.IR 新提交 50%

Hierarchical Residual Policy Optimization for Generative Recommendations

用于生成式推荐的分层残差策略优化

Kaifeng Guo, Yiming Yang, Jingtong Gao, Guolei Zeng, Fukang Yang, Yukang Liang, Peng Jiang, Qingpeng Cai, Xiangyu Zhao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对生成式推荐器后训练中标记级信用分配问题,提出HRPO框架,将项目级结果转换为标记对齐学习信号,经实验在会话效用和业务指标上取得提升。

Comments 12 pages, 6 figures, 10 tables. Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏