arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2607.09042 2026-07-13 cs.LG 新提交 70%

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 70%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 70%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00860 2026-07-08 cs.LG 版本更新 70%

Policy Improvement Reinforcement Learning

策略改进强化学习

Huaiyang Wang, Xiaojie Li, Xiaohan Wang, Zhixia Zhang, Xiaodong Lu, Zixuan Huang, Jiajun Chai, Guojun Yin, Deqing Wang, Haoyi Zhou, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.LG

AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04590 2026-07-07 cs.AI 新提交 70%

Attention Limited Reward Learning

注意力受限奖励学习

Wenqian Xing

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过基于理性注意力不集中的简化模型,探讨标准奖励建模中遗漏的内容,分离两种模糊性,指出有限注意力会扭曲成对比较结果,学习受标签携带的关注信息量而非数量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 70%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 70%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30789 2026-07-02 cs.LG stat.ML 新提交 70%

Predictable GRPO: A Closed-Form Model of Training Dynamics

可预测的GRPO:训练动力学的闭式模型

Rajat Ghosh, Datta Nimmaturi, Aryan Singhal, Vaishnavi Bhargava, Henry Wong, Johnu George, Debojyoti Dutta

机构 * Nutanix Unsloth

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GRPO训练动力学的第一性原理降阶模型,揭示其指数饱和律的物理含义,预测群大小不变性、稳定性阈值和过阻尼-振荡转变,并在多个模型和基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28707 2026-06-30 cs.AI 70%

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

BV-Blend: 不确定性加权历史基线用于稳定无评论家可验证奖励强化学习

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对GRPO在零方差组中学习停滞的问题,提出BV-Blend框架,通过语义聚类历史时刻与置信权重混合基线,稳定优势估计,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27739 2026-06-29 cs.LG 新提交 70%

The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

最薄弱的环节说明一切:通过可学习信用分配的结果监督过程奖励建模

Tianyu Jia, Yue Fang, Hongxin Ding, Rihong Qiu, Zhibang Yang, Zhijing Wu, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LCA框架,通过可学习信用分配解决结果监督过程奖励模型中的信用分配问题,在多个任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27291 2026-06-26 cs.LG 新提交 70%

Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

设计便携查询生成的奖励信号:工业语义职位搜索案例研究

Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出RLAIF框架生成便携职位搜索查询,通过奖励塑造解决策略优化中的奖励黑客问题,实验表明稳健奖励设计比优化器选择更关键。

Comments Accepted to KDD 2026 Workshop on AI Agent for Information Retrieval (Agent4IR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10913 2026-06-25 cs.AI cs.PL cs.SE 版本更新 70%

Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces

Shepherd: 一个为元代理提供形式化执行迹的运行时基座

Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。

Comments 50 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23595 2026-06-23 cs.AI 新提交 70%

SPIRAL: Learning to Search and Aggregate

SPIRAL: 学习搜索与聚合

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21830 2026-06-23 cs.LG 新提交 70%

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Mat-Pref: 可验证奖励训练提升无机材料中的组合推理能力

Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

机构 * University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出Mat-Pref基准,通过可验证奖励强化学习(GRPO)提升无机材料组合推理,在结构泛化和属性迁移上超越大模型。

Comments 10 pages, 4 figures, Accepted at ICML AI4Physics 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20008 2026-06-19 cs.LG 新提交 70%

VIMPO: Value-Implicit Policy Optimization for LLMs

VIMPO: 值隐式策略优化用于大语言模型

Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14510 2026-06-19 cs.LG q-bio.BM 新提交 70%

PepALD: Macrocyclic Peptide Generation via Autoregressive Latent Diffusion

PepALD: 通过自回归潜在扩散生成大环肽

Junming Zhang, Siyu Yi, Wei Ju, Zhonghui Gu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Mathematics, Sichuan University(四川大学数学学院) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院) Lingang Laboratory(临港实验室)

专题命中 后训练与偏好优化 :foundation model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 提出PepALD模型,结合自回归潜在扩散与化学嵌入,实现从头设计大环肽,并利用偏好优化提升亲和力,在生成质量和奖励优化上优于基线。

Comments 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18988 2026-06-18 cs.AI 新提交 70%

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架

Jinhao Song, Shan Liang, Yiqun Yue, Zhuhuayang Zhang, Tianqi Gao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。

Comments 10pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交 70%

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13795 2026-06-18 cs.LG 新提交 70%

DiPOD: Diffusion Policy Optimization without Drifting Apart

无漂移扩散策略优化

Haozhe Jiang, Haiwen Feng, Pieter Abbeel, Jiantao Jiao, Angjoo Kanazawa, Nika Haghtalab

机构 * University of California, Berkeley(加州大学伯克利分校) Simons Institute for the Theory of Computing(西蒙斯计算理论研究所) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 针对扩散策略梯度方法的不稳定性,提出DiPOD框架,通过自蒸馏与策略改进梯度更新交替进行,维持紧界行为,实现稳定且高效的策略优化。

Comments Project page: astro-eric.github.io/blogs/dipod/ Code: https://github.com/Astro-Eric/DiPOD-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17053 2026-06-16 cs.CL cs.CV 新提交 70%

Context-Aware RL for Agentic and Multimodal LLMs

上下文感知强化学习用于智能体与多模态大语言模型

Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

机构 * Princeton University(普林斯顿大学) UC Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16771 2026-06-16 cs.LG 新提交 70%

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng, Jiajun Song, Ruijin Ding, Junfeng Li, Zhechao Yu, Mengyu Zhou, Hongteng Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Renmin University of China(中国人民大学) Peking University(北京大学) ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.LG

AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15540 2026-06-16 cs.SD cs.AI cs.MM eess.AS 新提交 70%

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

AP-GRPO: 基于锚定门控语音对齐与策略优化的病理语音重建

Pengfei Zhang, Hoang H Nguyen, Yutong Song, Wenjun Huang, Tahmid Imtiaz Imu, Henry Peng Zou, Jiang Wu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 后训练与偏好优化 :language model(abstract);SLM(abstract_cn);分类 cs.AI

AI总结 针对神经退行性和神经运动障碍患者的病理语音,提出AP-GRPO框架,通过锚定门控奖励和语音对齐奖励优化语音语言模型,实现忠实重建,并揭示疾病特异性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12578 2026-06-12 cs.CL 新提交 70%

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

MARD: 镜像增强推理蒸馏用于机制级药物-药物相互作用预测

Mohammadreza Riyazat, Vian Lelo, Rameen Jafri, Yumna Khan, Abeer Badawi

机构 * University of Guelph(圭尔夫大学) York University(约克大学) Vector Institute(向量研究所)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MARD-7B模型,通过镜像增强推理蒸馏、单token KL散度、PRM加权DPO和机制感知检索通道,在机制级DDI预测中准确率超越GPT-4o 6.7个百分点,且成本仅为1%。

Comments 29 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21396 2026-06-11 cs.LG 版本更新 70%

Mechanisms of Introspective Awareness

内省意识的机制

Uzay Macar, Li Yang, Atticus Wang, Peter Wallich, Emmanuel Ameisen, Jack Lindsey

机构 * Anthropic Fellows Program(Anthropic Fellow项目) MIT(麻省理工学院) Constellation Anthropic

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.LG

AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10709 2026-06-10 cs.IR cs.AI 新提交 70%

Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

通过训练期间回收零方差查询实现智能体搜索的有效强化学习

João Coelho, João Magalhães, Bruno Martins, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07845 2026-06-09 cs.MA cs.LG 新提交 70%

GRPO Does Not Close the Multi-Agent Coordination Gap

GRPO 并未缩小多智能体协调差距

Najmul Hasan, Prashanth BusiReddyGari

机构 * Department of Mathematics and Computer Science University of North Carolina at Pembroke(数学与计算机科学系北卡罗来纳大学帕克维尔分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过哲学家就餐问题测试大语言模型的多智能体协调能力,发现GRPO训练无法显著提升性能,瓶颈在于训练方法而非计算量。

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24181 2026-06-09 cs.CV cs.AI 版本更新 70%

A Mixed Diet Makes DINO An Omnivorous Vision Encoder

混合饮食使DINO成为杂食视觉编码器

Rishabh Kabra, Maks Ovsjanikov, Drew A. Hudson, Ye Xia, Skanda Koppula, Andre Araujo, Joao Carreira, Niloy J. Mitra

机构 * Google DeepMind(谷歌DeepMind) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对DINOv2等预训练视觉编码器在不同视觉模态间特征对齐差的问题,提出杂食视觉编码器,通过后训练框架学习模态无关特征空间,实现跨模态鲁棒理解。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 70%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06828 2026-06-08 cs.CV cs.LG 新提交 70%

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) CPII under InnoHK(InnoHK下的CPII) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。

Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03189 2026-06-05 cs.CL 70%

SenseJudge: Human-Centric Preference-Driven Judgment Framework

SenseJudge: 以人为中心的偏好驱动判断框架

Rui Li, Junfeng Liu, Xiangwen Kong, Linhai Xu, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) StepFun Xi’an Jiaotong University(西安交通大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SenseJudge框架和SenseBench基准,通过融入用户偏好实现个性化判断和模型排名,实验证明其优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏