arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2601.12186 2026-08-18 cs.SE cs.AI 版本更新 57%

Aletheia: What Makes RLVR For Code Verifiers Tick?

Aletheia: 什么使得代码验证器的RLVR有效?

Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych

机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(保加利亚索菲亚大学INSAIT实验室) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity(德累斯顿技术大学计算机科学系及应用网络安全国家研究中心通用知识处理实验室) ATHENE, Germany(德国ATHENE研究院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 通过消融实验研究RLVR训练代码验证器时,中间思考轨迹、负样本学习和策略内训练三个因素在不同规模下的性能-成本权衡,发现最优配方依赖于模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14430 2026-08-17 cs.LG cs.CV stat.ML 新提交 57%

Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

为扩散模型设计强化学习:统一的路径空间视角

Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ByteDance(字节跳动)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文从路径空间视角统一了扩散模型RL算法的原理,推导得到降方差值梯度形式,提出多样本KDE估计器和尺度受限权重族,在SD3.5-M等模型上验证了方法有效性并优于基线。

Comments 29 pages, 9 figures, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12330 2026-08-14 cs.CL 新提交 57%

Reliability-Aware Sexism Detection: Combining DPO with Annotator Agreement and Token-Level Confidence Scoring

感知可靠性的性别歧视检测:将DPO与标注者一致性及词元级置信度评分相结合

Hadi Mohammadi, Shihan Wang, Masoume M. Raeissi, Anastasia Giachanou

机构 * Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL

AI总结 该研究针对在线性别歧视检测的主观性问题,提出RA-DPO方法,结合标注者一致性等信号,在EXIST 2023数据集上验证其可降低训练成本并提升推理准确率。

Comments 11 pages, 4 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01615 2026-08-14 cs.ET cs.LG 版本更新 57%

Thermalizing Stochastic Programs

热化随机程序

Mirko Amico, Andraž Jelinčič, Colin Oscar Nancarrow, Leo Tyrpak, David Roberts, Seth Morton, Dalton Sakthivadivel, Ashwin Gopal, Guillaume Verdon

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出一套工具,将通用随机程序映射到热力学硬件,通过thermalizers框架编译随机程序并优化误差,在市场模拟器等多个应用中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08984 2026-08-11 cs.LG 新提交 57%

SoftMCC: An MCC-Brier Calibration Bridge for Threshold-Free Model Selection under Class Imbalance

SoftMCC:用于类别不平衡下无阈值模型选择的MCC-Brier校准桥梁

Özkan Canay

机构 * Sakarya University(萨卡里亚大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 SoftMCC是一种用于类别不平衡二分类的无阈值模型选择框架,耦合MCC校准恒等式与共享池选择协议,在18种设置中稳定性排名最优,为校准敏感的MCC家族选择器。

Comments 28 pages, 4 figures. Submitted to the Journal of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10286 2026-08-11 cs.LG 版本更新 57%

What Does Preference Learning Recover from Pairwise Comparison Data?

成对比较数据中的偏好学习恢复了什么?

Rattana Pukdee, Maria-Florina Balcan, Pradeep Ravikumar

机构 * Machine Learning Department, Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学机器学习系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文通过条件偏好分布(CPRD)形式化成对比较数据中的偏好信息,分析了Bradley-Terry模型在数据违反假设时的恢复能力,并揭示了影响样本效率的关键因素(边界和连通性)。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06582 2026-08-10 cs.LG 新提交 57%

CrystalGRPO: Target-Aligned and Coverage-Preserving Reinforcement Learning for Flow-Based Crystal Structure Prediction

CrystalGRPO:面向基于流模型的晶体结构预测的目标对齐且保持覆盖率的强化学习

Kaixiang Su, Hongfei Xue, Qiang Zhu

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) North Carolina Battery Complexity, Autonomous Vehicle and Electrification (BATT CAVE) Research Center(北卡罗来纳州电池复杂性、自动驾驶与电气化(BATT CAVE)研究中心)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出CrystalGRPO框架,通过强化学习后训练优化基于流模型的晶体结构预测,两种模式在多数据集骨干组合中提升了恢复性能与覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27771 2026-08-07 cs.LG cs.CV 版本更新 57%

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

NormGuard: 流匹配强化学习中保持奖励的范数约束

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。

Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02721 2026-08-07 cs.AI 版本更新 57%

GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning

GrandCode: 通过代理强化学习实现竞技编程的Grandmaster级别

Ornith Team, Xiaoya Li, Guoyin Wang, Songqiao Su, Chris Shum, Jiwei Li

机构 * DeepReinforce Team(DeepReinforce 团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出GrandCode,一种用于竞技编程的多代理强化学习系统,通过代理模块协同训练和代理GRPO算法,实现了在竞技编程比赛中超越人类选手的突破。

Comments Tech Report; Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 57%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 57%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00482 2026-08-05 cs.CL 版本更新 57%

Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

知止:用于减少过度思考的片段级信用分配

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01593 2026-08-04 cs.AI 新提交 57%

Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

潜思维信用:面向潜推理的多答案信用分配

Xuyang Zhao, Liting Zhang, Zichen Xu, Yong Chen, Wenjia Zeng, Shiwan Zhao, Qicheng Li

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25498 2026-08-04 cs.SD cs.AI 版本更新 57%

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

SymphonyGen:具有可控和声骨架的3D分层交响乐生成

Xuzheng He, Nan Nan, Zhilin Wang, Ziyue Kang, Zhuoru Mo, Ao Li, Yu Pan, Xiaobing Li, Feng Yu, Xiaohong Guan

机构 * Department of AI Music and Music Information Technology, Central Conservatory of Music(中央音乐学院人工智能音乐与音乐信息科技系) Frontier Institute of Science and Technology, and Interdisciplinary Research Center of Frontier Science and Technology, Xi’an Jiaotong University(西安交通大学前沿科学与技术研究院及交叉科学与技术 interdisciplinary research center) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 SymphonyGen通过3D分层框架实现当代电影交响乐生成,采用分层解码器架构提升效率,引入短谱条件和GRPO优化,增强和声纯净度与音乐表现力。

Comments Accepted at ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29613 2026-08-03 cs.RO cs.CL cs.CV 新提交 57%

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

WCM:用于视觉-语言-动作强化学习的世界评论者模型

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26873 2026-08-03 cs.CL 版本更新 57%

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

SERPO:面向开放式测试时强化学习的自进化规则策略优化

Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 SERPO通过协同进化响应证据、查询规则和策略参数的闭环机制,在开放式测试时强化学习任务中显著提升了HealthBench等基准的性能,支持分布外迁移与跨基准进化。

Comments 20 pages, including the appendix. Code is available at https://github.com/chiefovoavicii/SERPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27756 2026-07-31 cs.SD cs.CL cs.MM eess.AS 新提交 57%

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

Cocktail-Talker:基于Turn Action GRPO的嘈杂社交环境下多说话人对话建模

Xilin Jiang, Riki Shimizu, Sukru Samet Dindar, Junkai Wu, Zhongweiyang Xu, Nima Mesgarani

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本文提出Cocktail-Talker框架,结合Turn Action GRPO,通过动作令牌建模助手行为,利用Cocktail-DialogGen生成数据,实现嘈杂社交环境下的多说话人口语对话建模,推动更自然的对话系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 57%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20253 2026-07-30 cs.SD cs.AI eess.AS 版本更新 57%

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

推动全曲生成的前沿:分层自回归规划与流匹配渲染

Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu

机构 * Alibaba(阿里巴巴)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 该研究提出统一歌曲生成框架,支持多项任务,由四个组件构成。通过特定编码、建模、匹配及模块实现歌曲生成,还研究多种后训练策略,实验表明该框架在评估中性能具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09229 2026-07-30 cs.NE cs.AI q-bio.NC 版本更新 57%

The Fast Lane Hypothesis: Von Economo Neurons Implement a Biological Speed-Accuracy Tradeoff

快速通道假说:von Economo神经元实现一种生物速度-准确性权衡

Esila Keskin

机构 * School of Computing and Creative Technologies, University of the West of England, Bristol, UK(西英格兰大学计算与创意技术学院,布里斯托尔,英国)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出von Economo神经元通过稀疏快速投射路径实现生物速度-准确性权衡,通过模拟社会辨别任务验证其在不同病理条件下对决策速度的影响。

Comments 7 pages, 5 figures. Code available at https://github.com/esila-keskin/fast-lane-hypothesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25659 2026-07-29 cs.AI 新提交 57%

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

CoRT:用于令牌级评分标准引导策略优化的反事实重放

Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo

机构 * ByteDance(字节跳动)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 研究基于评分标准的强化学习中响应内信用分配问题,提出CoRT方法,利用反事实重放对响应重新评分,将对比映射为权重来重新分配优势,实验表明该方法能有效提升训练效果,兼具简单性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09733 2026-07-29 cs.CL cs.CV 版本更新 57%

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉

Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24651 2026-07-28 cs.CV cs.CL cs.IR 新提交 57%

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

无坐标或区域标签的视觉文档理解中的证据归因

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22643 2026-07-28 cs.AI cs.CV 新提交 57%

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

检索前先思考:多模态检索增强生成的智能体规划

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

机构 * Bosch AI Research Center(博世人工智能研究中心) University of Notre Dame(圣母大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 研究多模态检索增强生成问题,提出MM-R2框架,通过建模检索内容和位置在检索前推理,构建意图基础检索状态,在结构化知识图谱检索,还构建相关数据集并采用两阶段后训练策略,实验证明其在答案准确性等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14952 2026-07-28 cs.LG cs.DC 版本更新 57%

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

LongStraw:在固定GPU预算下超越200万个令牌的长上下文强化学习

Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 研究针对推理上下文长度与强化学习后训练的差距问题,提出LongStraw架构感知执行堆栈,用GRPO优化,在固定GPU预算下实现百万令牌强化学习后训练,通过实验验证了其执行能力。

Comments 44 pages, 10 figures, 11 tables. Code: https://github.com/MindLab-Research/longstraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 57%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-07-23 cs.LG 新提交 57%

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 57%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04346 2026-07-21 eess.SY cs.AI cs.SY 57%

Temporally smoothed incremental model-based heuristic dynamic programming for command-filtered cascaded online learning flight control

改进 cascaded 在线学习飞行控制系统中的动作平滑性

Yifei Li, Erik-Jan van Kampen

机构 * Section Control and Simulation, Faculty of Aerospace Engineering, Delft University of Technology(控制与仿真部门,航空航天工程学院,代尔夫特理工大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出在线时间平滑技术与低通滤波器以提升飞行控制系统动作平滑性,通过FFT分析策略性能,验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03066 2026-07-21 cs.LG stat.ML 版本更新 57%

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function

Sign-SZPO:具有未知链接函数的基于可证明偏好的强化学习

Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 研究具有未知链接函数的基于偏好的强化学习问题,提出Sign-SZPO零阶策略优化算法,该算法仅估计价值函数差的符号来构建更新方向,可证明收敛到平稳策略,实证显示其在链接函数错误指定下具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏