arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-09-01 至 2026-09-01 共收录 40
2606.00510 2026-09-01 cs.CL cs.AI 版本更新

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用

Chishui Chen, Jiaye Lin, Te Sun, Yi Yang, Junxi Wang, Cong Qin, Yangen Hu, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06387 2026-09-01 cs.LG cs.AI 版本更新

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

非对称在线策略蒸馏:在令牌层面弥合利用与模仿

Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Meituan(美团)

AI总结 本文提出非对称在线策略蒸馏,通过局部散度最小化改进传统策略蒸馏,提升数学推理任务表现,实现更稳定的策略熵和持续工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07593 2026-09-01 cs.CV 版本更新

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26380 2026-09-01 cs.CL 版本更新

Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers

切换注意力:面向动态和细粒度的混合变换器

Yusheng Zhao, Hourun Li, Bohan Wu, Yichun Yin, Lifeng Shang, Jingyang Yuan, Meng Zhang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, PKU-Anker LLM Lab, Peking University(计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出Switch Attention,一种动态路由全注意力与滑动窗口注意力的混合变换器,通过自适应正则化和持续预训练提升长上下文语言模型的效率与性能。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04823 2026-09-01 cs.AI cs.CL

DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

DR-LoRA:动态秩LoRA用于混合专家模型的微调

Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Peking University(北京大学) University of Michigan(密歇根大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 DR-LoRA通过动态分配不同秩的LoRA模块,提升混合专家模型微调效果,实验表明其优于传统方法。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24595 2026-09-01 cs.PL cs.AI 版本更新

M2K: Making the Model-Kernel Interface Explicit for Reliable CUDA Kernel Verification

Model2Kernel: 用于安全CUDA内核的模型感知符号执行

Mengting He, Shihao Xia, Haomin Jia, Wenfei Wu, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器实验室) Peking University(北京大学)

AI总结 本文提出Model2Kernel,通过模型感知动态分析验证LLM推理中CUDA内核的内存安全,利用专门的符号执行技术发现353个未知bug,仅产生9个误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-09-01 cs.GR cs.AI cs.CV cs.LG cs.MM 版本更新

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-09-01 cs.CL 版本更新

An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Jian Liu, Yixin Zhang, Lingming Hu, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Yi Zhang, Fangting Lu, Shuo Wu, Jun Zhao, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Yumei Wang, Lejin Yang, Yanqiu Xing, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-09-01 cs.CL 版本更新

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13387 2026-09-01 cs.CL cs.GT 版本更新

Make an Offer They Can't Refuse: Grounding Bayesian Persuasion in Real-World Dialogues without Pre-Commitment

提出无法拒绝的方案:在无预承诺的真实对话中建立贝叶斯说服

Buwei He, Yang Liu, Zhaowei Zhang, Zixia Jia, Yang Yu, Huijia Wu, Zhaofeng He, Zilong Zheng, Yipeng Kang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

AI总结 该研究针对LLM策略性说服的不足,提出无预承诺的贝叶斯说服机制,实现两种变体并经多LLM与人类评估,验证其性能提升源于贝叶斯推理,且微调可缩小模型性能差距。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏