arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-01-09 至 2026-01-09 共收录 8
2601.05163 2026-01-09 cs.CL

DocDancer: Towards Agentic Document-Grounded Information Seeking

DocDancer:迈向基于文档的信息检索代理

Qintong Zhang, Xinjie Lv, Jialong Wu, Baixuan Li, Zhengwei Tao, Guochen Yan, Huanyao Zhang, Bin Wang, Jiahao Xu, Haitao Mi, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) Tencent AI Lab(腾讯人工智能实验室)

AI总结 DocDancer是一种开源文档问答代理,通过工具驱动框架和数据合成管道提升文档理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04516 2026-01-09 cs.CL

LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue Generation

LinguaGame: 一种基于语言的多智能体对话生成博弈论范式

Yuxiao Ye, Yiming Zhang, Yiran Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) East China University of Political Science and Law(中国政法大学)

AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04300 2026-01-09 cs.CV

Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes

超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准

Chenye Meng, Zejian Li, Zhongni Liu, Yize Li, Changle Xie, Kaixin Jia, Ling Yang, Huanghuang Deng, Shiying Ding, Shengyuan Zhang, Jiayi Li, Lingyun Sun

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04262 2026-01-09 cs.LG cs.AI

Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis

安全与效用冲突并非全球性:通过头部层面诊断的手术对齐

Wang Cai, Yilin Wen, Jinchang Hou, Du Su, Guoqiu Wang, Zhonghou Lv, Chenfu Bao, Yunfang Wu

机构 * Baidu Inc.(百度公司) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全重点实验室)

AI总结 本文提出CAST框架,通过头部层面诊断与稀疏微调相结合,解决LLMs中安全与效用冲突问题,减少训练损失并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04260 2026-01-09 cs.AI cs.LG

Towards a Mechanistic Understanding of Propositional Logical Reasoning in Large Language Models

迈向大型语言模型命题逻辑推理的机理理解

Danchun Chen, Qiyao Yan, Liangming Pan

机构 * MOE Key Lab of Computational Linguistics, Peking University(教育部计算语言学重点实验室,北京大学)

AI总结 本文通过分析Qwen3在PropLogic-MI数据集上的表现,揭示了大型语言模型在命题逻辑推理中采用的结构化计算机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12730 2026-01-09 cs.CL

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

机构 * Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21830 2026-01-09 cs.LG cs.AI

GAPO: Robust Advantage Estimation for Real-World Code LLMs

GAPO:面向现实世界代码LLM的鲁棒优势估计

Jianqing Zhang, Zhezheng Hao, Wei Xia, Hande Dong, Hong Wang, Chenxing Wei, Yuyan Zhou, Yubin Qi, Qiang Lin, Jian Cao

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Zhejiang University(浙江大学) Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏