arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 555 篇

2607.17935 2026-07-21 cs.CL cs.AI 新提交 79%

DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration

DeLIVeR:通过强化知识图谱探索进行基于信息的真实性识别的分解学习

Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong, Long Nguyen

机构 * University of Louisville(路易斯维尔大学) Denison University(丹尼森大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自动事实核查难题,DeLIVeR框架将证据检索设为强化探索任务,利用规划器大语言模型分解声明获问题集遍历知识图谱找证据,经GRPO优化策略,实验表明其显著优于基线,有效弥合推理差距,提供检测路径。

Comments Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17281 2026-07-21 cs.LG cs.AI 新提交 79%

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价

Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交 79%

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08409 2026-07-10 cs.CL cs.AI 新提交 79%

When Synthetic Speech Is All You Have: Better Call GRPO

当你只有合成语音时:最好调用GRPO

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交 79%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17250 2026-06-17 cs.LG cs.CL 新提交 79%

Rethinking Groups in Critic-Free RLVR

重新思考无评论强化学习中的分组

Yihong Wu, Liheng Ma, Lingfeng Xiao, Muzhi Li, Xinyu Wang, Yingxue Zhang, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 针对无评论强化学习分组策略的数据低效和同步问题,提出负令牌过滤方法,实现单次 rollout 稳定训练,在推理和代理任务上表现相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13209 2026-06-12 cs.LG cs.CL 新提交 79%

Understanding helpfulness and harmless tension in reward models

理解奖励模型中的有用性与无害性张力

Eshaan Tanwar, Pepa Atanasova

机构 * University of Copenhagen(哥本哈根大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过激活分析和消融实验,发现奖励模型中有用性和无害性目标存在干扰,共享神经元对模型行为影响不成比例,导致对齐张力。

Comments The source code used in this study is publicly available at: https://github.com/EshaanT/RM-alignment\_tension

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09883 2026-06-10 cs.LG cs.AI 新提交 79%

TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

TD-Grokking:通过训练时分解从零奖励问题中学习

Ningyuan Xi, Hao Xu, Hongsheng Xin, Ning Miao

机构 * Ningyuan Xi 1,2(西宁元 1,2) Hao Xu 3(许浩 3) Hongsheng Xin 3(辛红生 3) Ning Miao 1,2, †(苗宁 1,2, †)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习在零奖励问题上无法提供优化信号的问题,提出训练时分解框架TD-Grokking,将难解问题递归分解为可验证子问题,在数学和医疗任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09871 2026-06-10 cs.CV cs.AI cs.LG 新提交 79%

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

SD-GRPO:面向长格式视觉-语言生成的可验证片段分解

Hyunwoong Kim, Seongeun Lee, Hannah Yun, Junhyun Park, Jonggwon Park

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SD-GRPO方法,通过将长格式输出分解为片段并计算逐片段优势,解决GRPO在视觉-语言任务中粗粒度信用分配不足的问题,实验证明其在多种长格式生成任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09138 2026-06-09 cs.LG cs.CL 新提交 79%

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1:面向智能体强化学习的步骤级数据中间件系统

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出Claw-R1系统,通过网关服务器和数据池组件,将智能体交互步骤转化为结构化数据资产,支持实时检查、质量筛选和训练批次配置,解决智能体强化学习中数据生命周期管理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08346 2026-06-09 cs.CL cs.LG 新提交 79%

CATPO: Critique-Augmented Tree Policy Optimization

CATPO: 批评增强的树策略优化

Ayush Singh, Umang Goyal, Ankur Dahiya

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Vision and Language Group(视觉与语言组)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CATPO方法,通过树信息性评分和批评引导修复,解决树结构强化学习中低效树浪费计算的问题,在数学推理任务上提升准确率。

Comments 14 pages, 1 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24525 2026-08-26 cs.RO 新提交 78%

RoG-DAgger: Rollout-Guided Post-Training for End-to-End Driving

RoG-DAgger:面向端到端驾驶的基于回滚的后训练方法

Liangyu Zhong, Joachim Sicking, Fabian Hueger, Hanno Gottschalk

机构 * CARIAD SE, Volkswagen Group(大众集团旗下CARIAD SE) Institute of Mathematics, Technical University of Berlin(柏林工业大学数学研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本研究针对端到端驾驶系统训练与推理不匹配的问题,提出 RoG-DAgger 后训练框架,通过回滚优化专家演示与监督,在多个驾驶基准上显著提升了模型的驾驶性能与成功率。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21595 2026-08-25 cs.CV 新提交 78%

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化

Michael Jerge, Joseph Pelczar, Justin Downes

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19982 2026-08-21 cs.CR 新提交 78%

COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense

COPA:用于自适应提示注入防御的持续偏好优化

Roshan Sood, Onat Gungor, Tajana Rosing

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 该研究提出COPA框架,将提示注入防御视为终身学习问题,通过GRPO优化和边际加权经验回放实现持续防御,使攻击成功率最高降低6.3倍、平均降低4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06125 2026-08-07 cs.CV 新提交 78%

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

面向不确定性引导的扩散模型后训练的样本自适应潜在奖励

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00562 2026-08-04 cs.CV 新提交 78%

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation

超越 token 级交叉熵:用于自回归图像生成的 Fréchet 分布后训练

Jinhua Zhang, Yisong Lin, Wei Long, Shuhang Gu

机构 * UESTC(电子科技大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 该研究针对自回归图像生成器预训练与评估的目标及上下文不匹配问题,提出 FD-loss 后训练方法,在 ImageNet 256×256 任务上大幅降低 FID 与 FD_r6,提升生成质量且无额外参数或推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16947 2026-07-21 cs.CV 新提交 78%

When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation

当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化

Siwei Meng, Yawei Luo, Shu Zhang, Ping Liu

机构 * University of Nevada, Reno(内华达大学雷诺分校) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。

Comments This work is accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10421 2026-07-14 eess.AS cs.SD 新提交 78%

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

FdAudio:用于一步文本到音频生成的均值流锚定弗雷歇距离训练后处理

Kuan-Po Huang, Bo-Ru Lu, Ho-Lam Chung, Shih-Hsin Wang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 研究针对几步采样文本到音频生成模型一步生成质量落后的问题,提出FdAudio方法,通过多表示弗雷歇距离损失优化分布,并引入均值流一致性目标防止多步退化,在几步系统中提升了一步生成质量且解决了多步退化问题。

Comments Project website: https://fdoneaudio.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02840 2026-07-07 cs.RO 新提交 78%

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

TACO:作为可扩展VLA训练后自校正器的触觉世界模型

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) AI 2 Robotics(人工智能与机器人研究所) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 78%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19836 2026-06-19 cs.RO cs.CV 新提交 78%

World Engine: Towards the Era of Post-Training for Autonomous Driving

World Engine:迈向自动驾驶后训练时代

Tianyu Li, Li Chen, Caojun Wang, Haochen Liu, Kashyap Chitta, Zhenjie Yang, Yuhang Lu, Naisheng Ye, Yihang Qiu, Yufei Wang, Luoxi Zou, Jiaxin Peng, Jin Pan, Zhaoyu Su, Andrei Bursuc, Shengbo Eben Li, Andreas Geiger, Peng Su, Hongyang Li

机构 * The University of Hong Kong(香港大学) Huawei(华为) Shanghai Innovation Institute(上海创新研究院) Archon Robotics(Archon机器人) KE:SAI NVIDIA Research(NVIDIA研究) NTU(南洋理工大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 提出World Engine生成式框架,通过从真实日志重建高保真交互环境并外推安全关键变体,利用强化后训练对齐策略与安全约束,显著减少罕见安全关键场景故障,提升自动驾驶安全性。

Comments Technical Report. Project Page: https://opendrivelab.com/WorldEngine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15651 2026-06-16 cs.CV 新提交 78%

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

自问式视觉语言模型:用于组合视觉推理的强化学习

Saraswathy Amjith

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10275 2026-06-10 cs.CV 新提交 78%

FoA-SR: Faithful or Aesthetic? Profile-Aware Preference Optimization for Real-World Image Super-Resolution

FoA-SR: 忠实还是美观?面向真实世界图像超分辨率的轮廓感知偏好优化

Amjad Mahdi Alqarni, Peizhong Ju

机构 * Department of Computer Science(计算机科学系) University of Kentucky(肯塔基大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 提出FoA-SR,基于偏好优化实现真实世界图像超分辨率,通过忠实和美观两种轮廓分别优化适配器,在RealSR和DIV2K上验证了可分离的恢复策略。

Comments 17 pages, 6 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09701 2026-06-09 cs.CL cs.AI cs.LG 新提交 78%

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

学习攻击与防御:通过GRPO对语言模型进行自适应红队测试

Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

机构 * Microsoft AI Red Team(微软AI红队) Microsoft Azure(微软Azure)

专题命中 后训练与偏好优化 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27448 2026-08-28 cs.CL 新提交 77%

TTPO: Test-Time Policy Optimization

TTPO:测试时策略优化

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。

Comments Project Page: https://zju-real.github.io/TTPO Code: https://github.com/ZJU-REAL/TTPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27161 2026-08-28 cs.CL 新提交 77%

STAR : Sentence Translation Alignment Rate for Document-to-Document Machine Translation

STAR:面向文档到文档机器翻译的句子翻译对齐率

Yichen Dong, Hao Wang, Junhui Li, Linlong Xu, Longyue Wang, Weihua Luo

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27032 2026-08-28 cs.LG 新提交 77%

Disentangling Optimization Scale from Preference Scale in DPO

在DPO中解耦优化尺度与偏好尺度

Ivan Kruzhilov

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26544 2026-08-28 cs.LG 新提交 77%

Chart2SVG: Editable SVG Generation from Raster Chart Images

Chart2SVG:从栅格图表图像生成可编辑的SVG

Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang

机构 * Renmin University of China(中国人民大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shandong University(山东大学) Microsoft Research(微软研究院) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) University of Technology Sydney(悉尼科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25350 2026-08-27 cs.LG cs.RO 新提交 77%

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

超越成对反馈:用于基于偏好的奖励学习的列表式视觉-语言监督

Srivalli Katkuri, Maxwell Kawada, Juan Wachs

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究提出首个结合视觉-语言模型生成偏好与普拉科特-卢斯模型的列表式奖励学习框架,在Meta-World操纵任务中,其表现与基线相当且更灵活,最佳配置达86%平均成功率。

Comments 13 pages, 10 figures. Srivalli Katkuri and Maxwell Kawada contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20611 2026-08-24 cs.AI 新提交 77%

Difficulty-Aware Semantic-ID Optimization for Generative Recommendation

面向生成式推荐的难度感知语义-ID优化

Xin Yu, Stephen Li, Sina Aghaei, Zifan Zhu, Jiamu Bai, Guanjie Huang, Bo Peng, Yiyao Liu, Lingzhou Xue

机构 * Meta The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 针对生成式推荐中标准GRPO与树结构任务适配差的问题,提出DASO方法,通过前缀匹配深度分配部署组,在公开及内部推荐任务上均取得优于对比方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏