arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-08-25 至 2026-08-25 共收录 16
2608.23256 2026-08-25 cs.AI 新提交

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

下一块推理强化学习(RL)真的比监督微调(SFT)更好?——在无思维链(CoT)数据下重新审视训练策略

Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本研究对比下一块推理RL与混合SFT,发现混合SFT在更少计算量下性能上限更高,且需在完整后训练 pipeline 中评估无CoT训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23189 2026-08-25 cs.CV 新提交

EchoWM: Open and Enterable Omnimodal World Models

EchoWM:开放且可进入的全模态世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

机构 * HKUST(香港科技大学) PKU(北京大学) Joy Future Academy, JD(京东探索研究院) HKU(香港大学) THU(清华大学) USTC(中国科学技术大学) FDU(复旦大学) Beihang University(北京航空航天大学) Stanford University(斯坦福大学)

AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。

Comments 42 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22795 2026-08-25 cs.CV 新提交

VersaDB: A High-Performance AI Storage Database for Unifying Mutimodal Datasets

VersaDB:用于统一多模态数据集的高性能AI存储数据库

Cong Wang, Zelin Liu, Yang Luo Ran Zhang, Zhijian Guo, Hui Zhang, Fan Yu, Yanfei Cao, Naijie Gu, Jun Yu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei(华为) South China University of Technology(华南理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对多模态AI数据集处理速度不足的问题,推出专为AI数据集设计的VersaDB,通过页式存储、B+树索引等技术实现高效数据处理,可最高5.35倍加速且并行度适配性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22788 2026-08-25 cs.AI cs.LG 新提交

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由

Tianqi Xu, Lu Lv, Haoyang Huang, Wenjie Huang, Zhanming Shen, Yuhao Shen, Baolin Zhang, Xinyi Hu, Shuang Ge, Jun Dai, Tianyu Liu, Suorong Yang, Zhikai Li, Ye Bai, Jun Zhang, Lei Chen, Yue Li, Mingchen Wan

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22419 2026-08-25 cs.RO cs.CV 新提交

Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking

基于极其简单的模态掩码机制的鲁棒双臂视觉-语言-动作模型

Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Southeast University(东南大学)

AI总结 该研究针对双臂操作中查询式VLA模型的动作不连续问题,提出仅训练用的模态掩码机制(M3),在RoboTwin 2.0等任务上使平均成功率提升超11.4%至30%以上,有效增强了模型鲁棒性。

Comments 35 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22244 2026-08-25 cs.CL cs.AI cs.LG 新提交

Improving Few-Step Language Flows with Untied Self-Conditioning

通过非绑定自条件化改进少步长语言流模型

Bocheng Li, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

AI总结 该研究针对少步长流匹配语言模型的训练-推理不匹配问题,提出非绑定自条件化采样器,无需重训即可在多数据集上显著降低生成困惑度、提升生成偏好度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22230 2026-08-25 cs.CL 新提交

Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation

洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击

Junyu Lu, Kaiyuan Liu, Jingyi Kang, Deyi Ji, Hailong Zhang, Lanyun Zhu, Qi Zhu, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Tongji University(同济大学)

AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16647 2026-08-25 cs.CL 版本更新

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-25 cs.AI cs.RO 版本更新

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15224 2026-08-25 cs.LG 版本更新

Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach

用于原则评估的语义嵌入结构化:一种原型引导的对比学习方法

Che Shen, Junwei Su, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文针对通用文本嵌入在任务区分上的不足,提出PGCL方法,通过多流结合的正则化模块生成任务适配表示,在三个代理任务数据集上均优于原始冻结嵌入,明确了方法适用边界并修订了理论分析。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR). 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-08-25 cs.CV cs.LG 版本更新

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09887 2026-08-25 cs.LG cs.AI cs.CL 版本更新

SocraticPO: Policy Optimization via Interactive Guidance

SocraticPO: 通过交互式指导进行策略优化

Zirui Liu, Tingyue Pan, Jie Ouyang, Qi Liu, Xianquan Wang, Jiayu Liu, Qingchuan Li, Jing Sha, Zhenya Huang, Shijin Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) iFLYTEK AI Research (Central China), iFLYTEK Co., Ltd(iFLYTEK中央中国AI研究院,iFLYTEK公司)

AI总结 提出SocraticPO框架,在强化学习中使用自然语言指导辅助推理,并通过奖励衰减防止模型依赖教师帮助,提升科学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00869 2026-08-25 cs.LG 版本更新

Enhancing LLM Metacognition via Cognitive Pairwise Training

通过认知成对训练增强LLM元认知

Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu

机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) University of Science and Technology of China(中国科学技术大学)

AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14232 2026-08-25 cs.RO 版本更新

Reactive Planning based Control for Mobile Robots in Obstacle-Cluttered Environments

基于反应规划的移动机器人在障碍物密集环境中的控制

Li Tan, Junlin Xiong, Yan Wang, Wei Ren

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen(智能科学与工程学院,哈尔滨工业大学深圳) School of Control Science and Engineering, Dalian University of Technology(控制科学与工程学院,大连理工大学)

AI总结 本文提出基于反应规划的控制策略,用于移动机器人在障碍物密集环境中避障和导航,通过局部修改参考轨迹实现安全运动。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10630 2026-08-25 cs.LG cs.AI 版本更新

Time Series Forecasting via Reasoning: A Slow-Thinking Approach with Reinforcement Fine-Tuned LLMs

时间序列预测作为推理:一种基于强化LLM的慢思考方法

Yitong Zhou, Yucong Luo, Mingyue Cheng, Qi Liu, Jiahao Wang, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

AI总结 提出Time-R1框架,通过两阶段强化微调(监督微调+强化学习)训练LLM进行多步推理,以提升时间序列预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏