arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2607.11689 2026-07-14 cs.RO cs.AI 新提交 57%

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence

从世界行动模型到具身大脑:开放世界物理智能路线图

Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li

机构 * IEEE

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 研究针对通用人工智能中物理世界推理行动的进展零散问题,提出以具身大脑为中心的物理智能协同进化路线图,利用世界行动模型等,通过物理框架、共享契约和闭环训练等构建模块化智能栈,推动物理智能发展。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11122 2026-07-14 eess.SY cs.LG cs.SY 新提交 57%

Implicit Neural Networks as Static Controllers: Certificates and Performance Separation

作为静态控制器的隐式神经网络:证书与性能分离

Giuseppe C. Calafiore, Laurent El Ghaoui

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 研究将隐式神经网络用作静态控制器,提出其隐式表示,为有限维线性时不变系统开发分析理论及综合方法,经训练和检查得到控制器,还建立约束控制分离结果,显示INC在特定系统中成本更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19311 2026-07-14 cs.CV cs.AI 版本更新 57%

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

MixFlow训练:用慢插值混合减轻曝光偏差

Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 研究扩散模型训练-测试差异问题,提出MixFlow方法,利用慢流现象的慢插值混合对预测网络后处理,在类条件图像生成和文本到图像生成实验中验证有效,在RAE模型的ImageNet生成任务上取得好结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07937 2026-07-10 cs.CL 新提交 57%

When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

当去偏措施适得其反:基于预处理的刻板印象缓解的反直觉副作用

Yahan Zheng, John Guerrerio, Soroush Vosoughi, Weicheng Ma

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 研究基于预处理的刻板印象缓解方法的副作用,通过两个模型家族、多种策略及不同数据规模验证副作用存在,标准基准常忽略,注意力分析显示副作用与注意力流变化无关,还讨论评估意义并提供诊断方法及主张透明缓解措施。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05471 2026-07-08 cs.SE cs.AI 新提交 57%

KAT-Coder-V2.5 Technical Report

KAT-Coder-V2.5技术报告

Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai

机构 * KwaiKAT Team(快手KwaiKAT团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04517 2026-07-07 cs.AI 新提交 57%

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

VLA 接地器:用于黑盒 VLA 模型的语言条件空间优化

Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRAI(未来人工智能研究机构) MISIS(俄罗斯国立科技大学莫斯科钢铁合金学院)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI

AI总结 研究能否通过优化语言空间而非更新动作权重来改进冻结的 VLA 策略,提出语言条件空间策略,用强化学习优化,实验表明该优化能提升特定任务成功率,证明语言可作为机器人基础模型的可优化变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12046 2026-07-07 cs.CV cs.AI 版本更新 57%

Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking

通过结构化掩码的布局条件自回归文本到图像生成

Zirui Zheng, Takashi Isobe, Tong Shen, Xu Jia, Jianbin Zhao, Xiaomin Li, Mengmeng Ge, Baolu Li, Qinghe Wang, Haiwen Diao, Dong Li, Dong Zhou, Yunzhi Zhuge, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices Inc.(超威半导体公司) Dalian University of Technology(大连理工大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出SMARLI框架,通过结构化掩码策略将布局约束注入自回归生成过程,并采用GRPO后训练缓解曝光偏差,实现高质量布局控制图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02431 2026-07-03 cs.RO cs.AI 新提交 57%

WorldSample: Closed-loop Real-robot RL with World Modelling

WorldSample:基于世界建模的闭环真实机器人强化学习

Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang

机构 * PINE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院PINE实验室) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) School of Automation, Central South University, Changsha, China(中南大学自动化学院) School of Automation, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学自动化学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出WorldSample框架,通过物理 rollout、世界模型生成与策略改进的闭环,结合策略节奏学习(PPL)调节训练,在接触性精密操作任务中成功率提升28%,训练步数减少59%。

Comments 16 pages, 9 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29436 2026-06-30 math.NA cs.LG cs.NA 57%

Fourier Neural Operators with Least-Squares Readout Refit for Learning Random Obstacle-to-Solution Maps

具有最小二乘读出重拟合的傅里叶神经算子用于学习随机障碍到解的映射

Chenhui Zhu, Fei Wang

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对随机障碍问题,提出一种后训练最小二乘读出重拟合方法增强傅里叶神经算子,在保持非线性特征不变下优化线性读出,显著提升复杂接触几何下的解精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12784 2026-06-30 cs.CV cs.CL 57%

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM:细粒度自奖励用于统一多模态模型

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) The University of Hong Kong(香港大学) Peking University(北京大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 SRUM通过内部评估模块对生成模块进行自奖励,提升统一多模态模型的视觉生成能力,实验证明在T2I-CompBench和T2I-ReasonBench上性能显著提升。

Comments Accepted to ECCV 2026. 20 pages, 8 figures, webpage can be seen in https://waynejin0918.github.io/srum_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23264 2026-06-29 cs.CV cs.AI 版本更新 57%

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution

着色噪声:用于忠实图像超分辨率的对抗性Sobolev对齐

Hongbo Wang, Huaibo Huang, Pin Wang, Jinhua Hao, Chao Zhou, Ran He

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 提出ASASR框架,通过将生成流重铸为Sobolev诱导的黎曼几何并引入基于Riesz表示定理的参数化对抗器,解决图像超分辨率中生成先验导致的光谱失配问题,实现忠实重建。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07533 2026-06-29 cs.AI 版本更新 57%

Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

联合奖励建模:将思维链内化以实现高效的视觉奖励模型

Yankai Yang, Yancheng Long, Hongyang Wei, Wei Chen, Tianke Zhang, Kaiyu Jiang, Haonan Fan, Changyi Liu, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26904 2026-06-26 cs.CV cs.AI 新提交 57%

Confidence-Aware Tool Orchestration for Robust Video Understanding

置信度感知的工具编排用于鲁棒视频理解

Yangfan He, Yujin Choi, Jaehong Yoon

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。

Comments Project page: https://rova-v2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26534 2026-06-26 cs.SD cs.AI 新提交 57%

VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation

VoiceTTA: 通过基于强化学习的测试时自适应增强零样本文本到语音

Tianxin Xie, Chenxing Li, Dong Yu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 提出VoiceTTA,一种基于强化学习的测试时自适应方法,通过优化可学习前缀和风格奖励,提升预训练零样本TTS模型对罕见语音风格的模仿能力。

Comments 5 pages, accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-06-25 cs.RO cs.AI cs.CV 版本更新 57%

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21045 2026-06-23 cs.CR cs.LG 新提交 57%

OVIG: Optimistic Verification of AI Training Integrity via Gradient Signals

OVIG: 通过梯度信号乐观验证AI训练完整性

Hongxu Su, Jianzhu Yao, Huan Zhang, Xuechao Wang, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出OVIG框架,利用异构重放校准的梯度差异经验边界,通过乐观采样和步长参数审计外包训练完整性,在多种攻击下保持0%攻击成功率,存储和传输开销降低1996倍。

Comments 18 pages, 7 figures, 11 tables. Submitted to IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20244 2026-06-23 cs.CV cs.AI 新提交 57%

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑工业大学) Sagenic Tech Zhejiang University(浙江大学) vivo Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13214 2026-06-23 cs.CR cs.LG 版本更新 57%

Backdoor Channels Hidden in Latent Space: Cryptographic Undetectability in Modern Neural Networks

潜伏空间中的后门通道:现代神经网络中的密码学不可检测性

Marte Eggen, Eirik Reiestad, Kristian Gjøsteen, Inga Strümke

机构 * Department of Computer Science, Norwegian University of Science and Technology(挪威科学技术大学计算机科学系) Department of Mathematical Sciences, Norwegian University of Science and Technology(挪威科学技术大学数学科学系)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文研究了现代神经网络中潜伏空间内的后门通道,通过识别学习的潜伏方向,证明不可检测性可转化为两个未知分布的假设检验,并展示在ResNet和Vision Transformer架构上实现了高成功率的攻击,且能抵御多种后训练防御措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19388 2026-06-19 cs.SE cs.CL cs.HC 新提交 57%

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

超越GUI范式:移动代理是否需要手机屏幕?

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19162 2026-06-18 cs.LG cs.CV 新提交 57%

The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL

奖励一直就在你的数据中:用判别器引导的强化学习纠正流匹配

Nicolas Beltran-Velez, Felix Friedrich, Zhang Xiaofeng, Reyhane Askari-Hemmat, Xiaochuang Han, Adriana Romero-Soriano, Michal Drozdzal

机构 * FAIR at Meta Columbia University Mila -- Qu\' e bec AI Institute McGill University Canada CIFAR AI Chair

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对流匹配模型因损失函数与样本质量不匹配导致的视觉缺陷,提出判别器引导的强化学习(DRL),利用预训练空间中判别器的logit作为奖励,显著提升无引导FID和语义FD,并改善偏好对齐。

Comments 84 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21583 2026-06-17 cs.CV cs.AI 版本更新 57%

Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization

基于流匹配的原理化强化学习从片段级策略优化中涌现

Yifu Luo, Haoyuan Sun, Xinhao Hu, Penghui Du, Keyu Fan, Bo Li, Sinan Du, Xu Wan, Zhiyu Chen, Bo Xia, Yongzhe Chang, Changqian Yu, Kun Gai, Tiantian Zhang, Xueqian Wang

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出了一种基于片段级策略优化的流匹配强化学习方法GCPO,通过将连续步骤聚合为相干片段并改变策略优化层级,有效缓解了优势归因不准确的问题,实验表明其在文本到图像生成任务中表现优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交 57%

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14629 2026-06-15 cs.CR cs.AI 新提交 57%

When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks

当好的验证器变坏:自我改进的视觉语言模型可能在新任务上退步

Jianzhe Lin

机构 * MetaAI(Meta)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文发现验证器驱动的自我DPO中,验证器质量具有任务特异性,在低准确率任务上会导致学生模型性能退步,并给出机制解释和部署建议。

Comments 12 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12002 2026-06-12 cs.CL 版本更新 57%

Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision

自蒸馏零:自我修订将二元奖励转化为密集监督

Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu, Narutatsu Ri, Liam Fowl, Abhishek Panigrahi, Danqi Chen, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) University of Toronto(多伦多大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 提出SD-Zero方法,通过让模型同时扮演生成器和修订者,利用二元奖励生成密集的token级自监督信号,显著提升训练样本效率,在数学和代码推理任务上超越RFT、GRPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12050 2026-06-11 cs.LG math.DS 新提交 57%

Reliable Error Estimation for PINNs: Lower and Upper A Posteriori Bounds

PINNs的可靠误差估计:后验下界与上界

Ismail Huseynov, Arzu Ahmadova, Agamirza Bashirov

机构 * Physikalisch-Technische Bundesanstalt (PTB)(德国联邦物理技术研究院) Technical University of Berlin(柏林工业大学) Weierstrass Institute for Applied Analysis and Stochastics(魏尔斯特拉斯应用分析与随机研究所) Eastern Mediterranean University(东地中海大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出PINNs求解常微分方程的可计算后验误差下界,结合局部单侧Lipschitz条件得到更紧的上界,实现双侧误差包络,并讨论初始条件处理对下界的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08414 2026-06-09 cs.RO cs.AI 新提交 57%

PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation

PACT: 具身操作中扩散策略的自我演化物理安全对齐

Lingxuan Wu, Zijian Zhu, Lizhong Wang, Chengyang Ying, Huayu Chen, Xiao Yang, Fangming Liu, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China(计算机科学与技术系,人工智能研究院,清华-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,100084,中国) Peng Cheng Laboratory, 518108, China(鹏城实验室,518108,中国)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出PACT框架,通过自演化后训练将预训练扩散策略投影到约束可行区域,无需演示数据或任务奖励,在降低31.0%安全违规的同时提升30.7%任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30226 2026-06-09 cs.RO cs.AI 版本更新 57%

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

BORA: 弥合离线强化学习与在线残差适应以实现真实世界灵巧VLA模型

Zhongxi Chen, Yifan Han, Yanming Shao, Huanming Liu, Congsheng Xu, Xiaoyu Chen, Yao Mu, Wenzhao Lian

机构 * Shanghai Jiao Tong University(上海交通大学) CASIA(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) USTC(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出BORA框架,通过离线构建动作条件价值引导的评论家,并结合在线冻结VLA基础、引入人类在环的分块残差适应机制,解决灵巧操作中高维探索导致的时间不一致、样本低效和硬件风险问题,在五个真实灵巧任务上平均成功率提升33%。

Comments 24 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02439 2026-06-09 cs.CV cs.LG 版本更新 57%

Anomaly-Preference Image Generation

异常偏好图像生成

Fuyun Wang, Yuanzhi Wang, Xu Guo, Sujia Huang, Tong Zhang, Dan Wang, Hui Yan, Xin Liu, Zhen Cui

机构 * Nanjing University of Science(南京理工大学) Beijing Normal University, Beijing, China(北京师范大学) China Academy of Space Technology, Beijing, China(中国航天科技集团)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出了一种新的异常生成方法,通过隐式偏好对齐机制和时间感知能力分配模块,提升生成图像的真实性和多样性,实验表明其在真实性和多样性上均优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21172 2026-06-09 cs.AI cs.CV 版本更新 57%

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

NoRD: 一种无需推理的高数据效率视觉-语言-动作模型

Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan

机构 * Applied Intuition Texas A&M University(德克萨斯大学A&M分校) UC Berkeley(伯克利加州大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI

AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。

Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28742 2026-06-08 cs.AI 版本更新 57%

CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

CORE: 对比反思实现推理能力的快速提升

Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出对比反思(CORE)非参数学习算法,通过对比成功与失败的推理轨迹生成自然语言洞察,在少量样本和 rollout 下实现比参数方法(GRPO)和非参数方法(GEPA、情景RAG、MemRL)更快的推理性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏