arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 30 篇

2603.02229 2026-08-25 cs.LG cs.CL 版本更新 91%

Safety Training May Persist Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14643 2026-08-25 cs.CL 版本更新 89%

Length-Controlled Margin-Based Preference Optimization without Reference Model

无参考模型的长度可控基于间隔的偏好优化

Gengxu Li, Tingyu Xia, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对DPO的局限提出LMPO,引入统一参考模型与平均对数概率优化策略,通过长度可控间隔损失调控响应长度并缓解概率退化,在Mistral和LLaMA3上的6个基准中性能优于现有方法。

Comments 17 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21501 2026-08-25 cs.AI 新提交 88%

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

让信用跟随计算:面向大语言模型强化学习的架构感知信用传输

Qifan Shi, Zhaolu Kang, Chenghua Zhu

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对大语言模型强化学习的信用传输算子与架构无关的问题,提出计算条件信用传输框架及 CompPO 算法,在 Qwen3-4B 等模型上较 GRPO 取得更优的保留准确率与贪心评估表现。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23149 2026-08-25 cs.CL cs.AI 新提交 88%

Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization

对齐中的语言链:跨语言排序偏好优化

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

机构 * Korea University(高丽大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-08-25 cs.LG cs.AI 版本更新 88%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V2, 20 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-25 cs.CL 新提交 85%

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21376 2026-08-25 cs.CL cs.AI 新提交 85%

On the Role of Citations in Preference Data

引用在偏好数据中的作用

Yu Hou, Hal Daumé III, Rachel Rudinger, William Walden

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21993 2026-08-25 cs.LG 新提交 81%

Gated Decoupled Compositional Bandits: A Unified Theory of Contextual Bandits with Supervised-Calibrated Action Scaling and Pre-Execution Gating

门控解耦组合多臂老虎机:带监督校准动作缩放与预执行门控的上下文多臂老虎机统一理论

Oleg Miroshnichenko

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出门控解耦组合多臂老虎机(GDCB),证明其可统一多个工业系统,核心定理可将非平稳问题转化为近似平稳问题,还推广了相关结果,配套论文已验证短期租赁动态定价实例。

Comments 30 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-08-25 cs.LG cs.AI 版本更新 81%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Discrete Diffusion Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Si Wu, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

Comments Extended Version of ICML 2026 Fogen (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23020 2026-08-25 cs.CL cs.AI 新提交 79%

Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality

遗忘学习不只是擦除:通过生成不平等实现时间解耦

Xunlei Chen, Qirui Ye, Yuang Li, Yi Gong, Zhaokun Wang, Wenyi Li, Shiyao Guo, Jinyu Guo

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型遗忘学习的挑战,提出基于训练的细粒度框架ADU,通过解耦上下文注意力路径实现精准遗忘,在TOFU和WMDP基准上表现最优,同时保留高模型效用并减少副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21864 2026-08-25 cs.LG cs.AI cs.CV 新提交 79%

BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications

BioMed-Agent-RL:元学习,生物医学应用的一切所需

Md Asaduzzaman Jabin, Zihao Wu, Tianming Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对临床视觉大语言模型的缺陷,提出BioMed-Agent-RL医学智能体,整合多模态元学习与强化学习等技术,在多基准实验中准确率达约73%,较现有模型提升约5%,为临床智能体系统建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12969 2026-08-25 cs.LG cs.AI 版本更新 79%

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

从对比视角重新审视基于可验证奖励的强化学习

Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Beijing Institute of Technology(北京理工大学) Qwen Business Unit of Alibaba(阿里巴巴Qwen业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ConSPO方法,通过对比序列级策略优化,解决GRPO在目标函数上的似然错配和信用分配不敏感问题,在推理任务上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21595 2026-08-25 cs.CV 新提交 78%

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化

Michael Jerge, Joseph Pelczar, Justin Downes

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 77%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23566 2026-08-25 cs.LG cs.AI cs.CL 新提交 75%

How to Train a Critic Stably and Efficiently

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22772 2026-08-25 cs.CL 新提交 74%

SPOC-SQL: Stage-wise Preference Optimization for Controllable Text-to-SQL

SPOC-SQL:用于可控文本到SQL的分阶段偏好优化

Yingnan Chen, Chun Ding, Tianshi Xu, Xu Yang, Si Wu

机构 * South China University of Technology(华南理工大学)

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.CL

AI总结 该研究针对现有文本到SQL方法缺乏关键决策反馈和中间过程控制的问题,提出SPOC-SQL,通过分阶段偏好优化与结构化分解策略实现可控SQL生成,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21898 2026-08-25 cs.AI 新提交 70%

Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning

训练需要可信的世界:用于智能体学习的经过验证的合成Web环境

Chenghao Zhang, Canran Xiao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Pace University(佩斯大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建可执行、可审计的合成Web环境,修复缺陷后用于训练Web智能体,提升了可行任务率与PPO策略性能,增强了向多个基准的迁移能力,为智能体学习提供了可靠训练基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21830 2026-08-25 cs.AI 新提交 70%

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

超越成功与失败:面向GUI智能体的长度感知对比学习

Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Baidu Inc.(百度公司) University of Alberta(阿尔伯塔大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对GUI智能体现有对比RLVR方法无法捕获轨迹细粒度质量差异的问题,提出LACL-GUI框架,引入轨迹级质量信号,在基准测试中实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01160 2026-08-25 cs.AI 版本更新 70%

Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification

形式数学验证中生成式奖励建模的期望值对齐

Shihao Ji, Haotao Tan, Zihui Song, Mingyu Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16615 2026-08-25 cs.LG 版本更新 70%

Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences

学习评估者所重视的内容:一种可靠建模评估者偏好的方法

Madeline Celi Kitch, Nihar B. Shah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了如何学习评估者偏好,提出了一种鲁棒算法,能够在模型不匹配的情况下有效学习偏好,通过合成数据和实际数据验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-08-25 cs.HC 版本更新 67%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Kuofei Fang, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21919 2026-08-25 cs.LG 新提交 57%

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

超越固定方向:大语言模型中推理与记忆的自适应表示分析

Shaheen Nabi

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 该研究以Qwen3-0.6B为对象,通过实验验证了推理与记忆可通过单一方向分离,但经GRPO后该方向几何结构显著重组,不过任务组的AUROC仍保持1.00,挑战了固定方向稳定性的假设。

Comments Preprint. Code and experimental resources are available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-25 cs.LG cs.CV 版本更新 57%

Continuous Adversarial MeanFlow Transfer

连续对抗平均流迁移

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本研究提出MeanFlow-Transfer与Continuous Adversarial MeanFlow,解决有限数据下新域生成器训练的适配与加速问题,在四个源模型适配五个目标域时,FID等指标相当或更优且NFEs最多减125倍,少步FID平均提29%。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18237 2026-08-25 stat.ML cs.LG math.OC 版本更新 57%

Sobolev Regularized Score Difference Estimation in Diffusion Models

扩散模型中的Sobolev正则化得分差估计

Chenghan Xie, Jose Blanchet, Renyuan Xu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文针对扩散模型得分差估计存在的统计一致性或可扩展性问题,提出Sobolev正则化的一致可扩展估计器,在小样本场景稳定性提升,真实任务性能优于非正则化方法。

Comments Accpeted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16473 2026-08-25 cs.LG math.NA 版本更新 57%

Reference-free logged energy-oracle recovery for neural approximations of symmetric coercive variational problems: conforming Riesz reconstruction and archive-level selection

对称强制变分问题神经近似的无参考记录能量-神谕恢复:符合里泽重构与存档级选择

Karim Bounja, Lahcen Laayouni, Boujemaa Achchab, Abdeljalil Sakat

机构 * Laboratory for Analysis and Modeling of Systems and Decision Support (LAMSAD), Hassan 1st University of Settat(塞塔特哈桑一世大学系统与决策支持分析建模实验室) Al Akhawayn University in Ifrane(伊夫兰阿赫拉万大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对对称强制变分问题的神经近似,提出无参考的记录能量神谕恢复准则,通过符合里泽监测器实现存档级选择,在扩散、弹性等问题上验证了其有效性。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-08-25 cs.LG 版本更新 57%

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

Comments Accepted as an extended abstract at Geometric Intelligence @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-08-25 cs.CV cs.LG 版本更新 57%

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23549 2026-08-25 cs.CV 新提交 50%

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything:基于视频生成先验的3D一致性渲染优化

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。

Comments Appearing in ECCV 2026. Project page: this https URL (https://fix-anything.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-25 eess.SY 版本更新 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 50%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏