arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-12 至 2026-01-12 共收录 9
2601.06021 2026-01-12 cs.CL

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习

Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05607 2026-01-12 cs.LG

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05593 2026-01-12 cs.LG

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning

PaCoRe: 通过并行协调推理学习扩展测试时间计算

Jingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Daxin Jiang, Xiangyu Zhang, Heung-Yeung Shum

机构 * StepFun Tsinghua University(清华大学) Peking University(北京大学)

AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05590 2026-01-12 cs.AI

A Causal Information-Flow Framework for Unbiased Learning-to-Rank

一种用于无偏学习排序的因果信息流框架

Haoming Gong, Qingyao Ai, Zhihao Tao, Yongfeng Zhang

机构 * Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

AI总结 本文提出一种基于因果学习的排序框架,通过结合结构因果模型和信息论工具,有效减少多源偏差,提升排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04992 2026-01-12 cs.CL

Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization

从错误中学习:负推理样本增强领域外泛化

Xueyun Tian, Minghua Ma, Bingbing Xu, Nuoyan Lyu, Wei Li, Heng Dong, Zheng Chu, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

AI总结 通过引入负例推理样本,GLOW方法有效提升了大语言模型在领域外任务中的泛化能力,通过调节损失下降和提升策略熵来减少过拟合并促进探索。

Comments Code and data are available at https://github.com/Eureka-Maggie/GLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23243 2026-01-12 cs.CV

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制

Siyu Zhang, Lianlei Shan, Runhe Qiu

机构 * Tsinghua University(清华大学)

AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22042 2026-01-12 cs.RO

Volume-Consistent Kneading-Based Deformation Manufacturing for Material-Efficient Shaping

体积一致的 kneading 基础变形制造用于材料高效成形

Lei Li, Jiale Gong, Ziyang Li, Hong Wang

机构 * School of Mechanical Engineering and Automation, Northeastern University(机械工程与自动化学院,东北大学) Future Laboratory, Tsinghua University(清华大学未来实验室)

AI总结 本文提出了一种基于 kneading 的体积一致成形方法,通过闭环工作流程实现高保真度和高材料利用率的三维变形制造。

Comments 39 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03811 2026-01-12 cs.AI

Rethinking Supply Chain Planning: A Generative Paradigm

重新思考供应链规划:一种生成范式

Jiaheng Yin, Yongzhi Qi, Jianshen Zhang, Dongyang Geng, Zhengyu Chen, Hao Hu, Wei Qi, Zuo-Jun Max Shen

机构 * Tsinghua University, Beijing, China(清华大学) JD.com, Beijing, China(京东) Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong, China(香港大学工程学院和商学院) College of Engineering, University of California, Berkeley, CA, USA(加州大学伯克利分校工程学院)

AI总结 本文提出一种基于生成式人工智能的供应链规划范式,通过智能代理框架提升规划准确性与库存率,实现动态需求下的适应性协调。

详情

展开后加载摘要…

URL PDF HTML 收藏