DocDancer: Towards Agentic Document-Grounded Information Seeking
DocDancer:迈向基于文档的信息检索代理
机构 * Peking University(北京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Tencent AI Lab(腾讯人工智能实验室)
AI总结 DocDancer是一种开源文档问答代理,通过工具驱动框架和数据合成管道提升文档理解能力。
高校专区
DocDancer:迈向基于文档的信息检索代理
机构 * Peking University(北京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Tencent AI Lab(腾讯人工智能实验室)
AI总结 DocDancer是一种开源文档问答代理,通过工具驱动框架和数据合成管道提升文档理解能力。
DVD:一种检测大规模语言模型评估中变体污染的稳健方法
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。
LinguaGame: 一种基于语言的多智能体对话生成博弈论范式
机构 * Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校) ; Peking University(北京大学) ; East China University of Political Science and Law(中国政法大学)
AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。
超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准
机构 * Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学) ; University of Nottingham Ningbo China(诺丁汉大学宁波分校)
AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。
安全与效用冲突并非全球性:通过头部层面诊断的手术对齐
机构 * Baidu Inc.(百度公司) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全重点实验室)
AI总结 本文提出CAST框架,通过头部层面诊断与稀疏微调相结合,解决LLMs中安全与效用冲突问题,减少训练损失并提升安全性。
迈向大型语言模型命题逻辑推理的机理理解
机构 * MOE Key Lab of Computational Linguistics, Peking University(教育部计算语言学重点实验室,北京大学)
AI总结 本文通过分析Qwen3在PropLogic-MI数据集上的表现,揭示了大型语言模型在命题逻辑推理中采用的结构化计算机制。
NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进
机构 * Nanjing University(南京大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北航)
AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。
GAPO:面向现实世界代码LLM的鲁棒优势估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯) ; Zhejiang University(浙江大学) ; Shenzhen University(深圳大学) ; Peking University(北京大学)
AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。