arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2601.03294 2026-04-27 cs.CR cs.AI

AgentMark: Utility-Preserving Behavioral Watermarking for Agents

AgentMark:用于代理的效用保持行为水印

Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huaqiao University(华侨大学)

AI总结 本文提出AgentMark,一种用于代理的行为水印方法,通过在规划决策中嵌入多比特标识符以保持效用,适用于黑盒API和动作层内容水印。

Comments Accepted to ACL 2026 (Main, Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07003 2026-04-27 cs.CL

NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs

NiuTrans.LMT: 向包容性和可扩展的多语言机器翻译迈进 with LLMs

Yingfeng Luo, Ziqiang Xu, Yuxuan Ouyang, Murun Yang, Dingyang Lin, Kaiyan Chang, Tong Zheng, Bei Li, Peinan Feng, Quan Du, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(牛译研,中国沈阳)

AI总结 本文提出NiuTrans.LMT,通过Strategic Downsampling和Parallel Multilingual Prompting缓解多语言监督微调中的方向退化问题,展示其在60种语言234个方向上的竞争力。

Comments Accepted to ACL 2026 Main Conference. Models are available at: https://github.com/NiuTrans/LMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21285 2026-04-27 cs.AI cs.CL

When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models

当模型超越安全限制:揭示并缓解大推理模型的自我突破

Yingzhi Mao, Chunkang Zhang, Junxiang Wang, Xinyan Guan, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究揭示大推理模型存在自我突破现象,提出CoG框架通过分步干预缓解安全问题,平衡安全与推理性能。

Comments ACL 2026. The first two authors contributed equally. The main text is 9 pages, with an appendix of 28 pages. The paper contains 20 figures and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05038 2026-04-27 cs.CL

Toward Automated Robustness Evaluation of Mathematical Reasoning

迈向数学推理的自动化鲁棒性评估

Yutao Hou, Zeguan Xiao, Fei Yu, Yihan Jiang, Ma Shuguang, Zhaoqian Dai, Hailiang Huang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)

AI总结 本文提出Math Stress Tester框架,通过多轮重写验证循环生成对抗样本,提升数学推理任务的鲁棒性评估能力,并验证其在非数学任务中的扩展性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20662 2026-04-27 cs.AI

AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage

AutoReproduce:基于论文溯源的自动AI实验复现

Xuanle Zhao, Zilin Sang, Yuxuan Li, Qi Shi, Weilun Zhao, Shuo Wang, Duzhen Zhang, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xidian University(西安电子科技大学) OpenBMB(开放大脑实验室) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AutoReproduce,通过论文溯源系统自动复现实验代码,采用多智能体框架和采样单元测试策略,验证了其在复现精度和执行性能上的优势。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16994 2026-04-27 cs.LG cs.AI cs.CL

FADE: Why Bad Descriptions Happen to Good Features

FADE:为什么好的特征会遇到糟糕的描述

Bruno Puri, Aakriti Jain, Elena Golimblevskaia, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

AI总结 FADE提出了一种模型无关的框架,用于自动评估特征与描述的一致性,通过四个指标量化特征与描述之间的不一致原因,揭示了生成特征描述的挑战。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17138-17160, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00955 2026-04-27 cs.CL

Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search

高效多智能体系统训练中的数据影响导向树搜索

Wentao Shi, Zichun Yu, Fuli Feng, Xiangnan He, Chenyan Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出数据影响导向树搜索框架,通过影响评分指导树搜索和数据选择,提升多智能体系统训练效率与效果。

Comments Accepted by ACL 2026 Main;

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10138 2026-04-27 cs.CL

PL-MTEB: Polish Massive Text Embedding Benchmark

PL-MTEB:波兰大规模文本嵌入基准

Rafał Poświata, Sławomir Dadas, Michał Perełkiewicz

机构 * National Information Processing Institute(国家信息处理研究所)

AI总结 本文提出PL-MTEB,一个涵盖波兰语言文本嵌入的综合基准,包含30个不同NLP任务,新增12个波兰任务和两个新数据集,评估30种公开文本嵌入模型并公开结果。

Comments Accepted for ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21420 2026-04-24 cs.AI

FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation

FairQE:缓解翻译质量评估中性别偏见的多智能体框架

Jinhee Jang, Juhwan Choi, Dongjin Lee, Seunguk Yu, Youngbin Kim

机构 * Chung-Ang University(Chung-Ang 大学) AITRICS

AI总结 FairQE通过多智能体机制检测性别线索并生成性别翻转翻译变体,结合传统QE评分与LLM偏见缓解推理,提升翻译质量评估的性别公平性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21309 2026-04-24 cs.CL

When Bigger Isn't Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation

当更大并非更好:对多新闻摘要中政治偏见的全面公平性评估

Nannan Huang, Iffat Maab, Junichi Yamagishi

机构 * RMIT University(皇家墨尔本理工大学) National Institute of Informatics(日本信息处理学会)

AI总结 本文评估多文档新闻摘要中的政治偏见,发现大模型并不总是更公平,中等规模模型在公平性与效率上表现更优,提示需多维评估框架和针对性去偏策略。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21308 2026-04-24 cs.CR cs.CL

CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents

CI-Work: 企业LLM代理中情境完整性基准测试

Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft(微软)

AI总结 CI-Work基准测试评估企业LLM代理在密集检索中传达关键内容并隐藏敏感信息的能力,揭示隐私泄露普遍且高任务效用与隐私违规正相关,需转向以情境为中心的架构。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL'2026) -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21255 2026-04-24 cs.CL

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

当代理看起来相同:量化蒸馏诱导的工具使用行为相似性

Chenghao Yang, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, USTC(USTC计算机科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) M-A-P

AI总结 本文提出两种新指标RPS和AGS,用于区分任务成功必需行为与模型自主偏好,通过评估18个模型发现AGS能区分教师特定收敛与通用改进。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21253 2026-04-24 cs.CL cs.AI

Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation

超越文本的规划:基于图的复杂叙事生成推理

Hanwen Gu, Chao Guo, Junle Wang, Wenda Xie, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Turing Lab(腾讯人工智能实验室)

AI总结 本文提出PLOTTER框架,通过结构图进行叙事规划,提升LLM在复杂叙事生成中的长上下文推理能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21235 2026-04-24 cs.LG cs.CL stat.ME

Learning Dynamic Representations and Policies from Multimodal Clinical Time-Series with Informative Missingness

从具有信息性缺失的多模态临床时间序列中学习动态表示和策略

Zihan Liang, Ziwen Pan, Ruoxuan Xiong

机构 * Emory University(埃默里大学)

AI总结 本文提出了一种多模态临床时间序列患者表示学习框架,利用信息性缺失来提升治疗策略学习和患者预后预测性能。

Comments Findings of ACL 2026 (30 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21191 2026-04-24 cs.CL

Prefix Parsing is Just Parsing

前缀解析只是解析

Clemente Pasti, Andreas Opedal, Timothy J. O'Donnell, Ryan Cotterell, Tim Vieira

机构 * ETH Zürich(苏黎世联邦理工学院) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) Mila CHI-FRO

AI总结 本文提出通过前缀文法变换将前缀解析转化为普通解析,从而高效解决前缀解析问题,并引入基于算法微分的策略计算下一token权重向量,提供了一种简单、通用且高效的前缀解析框架。

Comments To appear at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21159 2026-04-24 cs.CR cs.AI cs.CL cs.LG

Adaptive Instruction Composition for Automated LLM Red-Teaming

自适应指令生成用于自动化大语言模型红队测试

Jesse Zymet, Andy Luo, Swapnil Shinde, Sahil Wadhwa, Emily Chen

机构 * Capital One, AI Foundations(Capital One人工智能基础研究)

AI总结 本文提出自适应指令生成框架,通过强化学习平衡探索与利用,提升红队测试的攻击效果与多样性,优于随机组合和现有方法。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21045 2026-04-24 cs.CL

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

分层策略优化用于无界语音的同时翻译

Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达)

AI总结 本文提出分层策略优化方法,通过后训练处理不完美的监督微调数据,提升同时语音翻译质量与效率,实验显示在1.5秒延迟下,COMET和MetricX得分分别提升超7和1.25。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20917 2026-04-24 cs.LG cs.AI cs.CL cs.PL cs.SE

The Path Not Taken: Duality in Reasoning about Program Execution

未选择的道路:程序执行推理中的对偶性

Eshgin Hasanov, Md Mahadi Hassan Sibat, Santu Karmaker, Aashish Yadavally

机构 * Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)

AI总结 本文提出通过双重推理任务评估程序执行的因果理解,提出DexBench基准测试集,评估13种LLM,证明双路径推理能有效提升动态代码理解能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20789 2026-04-24 cs.CL cs.AI cs.LG

Working Memory Constraints Scaffold Learning in Transformers under Data Scarcity

工作记忆限制在数据稀缺下支撑Transformer的学习

Pranava Madhyastha, Dagmar Adamcova

机构 * City, University of London(伦敦城市大学) The Alan Turing Institute(艾伦·图灵研究所) Grounded Machines

AI总结 本文探讨在Transformer架构中引入类人工作记忆限制,提出基于固定宽度窗口和时间衰减的注意力机制,实验表明在数据稀缺时,这些约束能显著提升语法准确性并增强与人类处理指标的一致性。

Comments Published in ACL 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19934 2026-04-24 cs.CL

Tracing Relational Knowledge Recall in Large Language Models

追踪大型语言模型中的关系知识回忆

Nicholas Popovič, Michael Färber

机构 * TU Dresden(德累斯顿技术大学)

AI总结 研究大型语言模型在文本生成中如何回忆关系知识,通过线性探测识别适合关系分类的潜在表示。分析不同潜在表示,发现注意力头对残差流的贡献是线性关系分类的强特征。

Comments ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18779 2026-04-24 cs.CL cs.AI

Mango: Multi-Agent Web Navigation via Global-View Optimization

Mango:通过全局视图优化实现多智能体网络导航

Weixi Tong, Yifeng Di, Tianyi Zhang

机构 * Purdue University(普渡大学)

AI总结 本文提出Mango方法,利用网站结构动态确定最优起始点,通过多臂老虎机问题和Thompson采样优化导航预算,并引入周期性记忆组件提升导航效率,实验显示在WebVoyager和WebWalkerQA上均优于基线方法。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17647 2026-04-24 eess.AS

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

语调作为监督:连接非语言与语言以实现多语言语音情绪识别

Girish, Mohd Mujtaba Akhtar, Muskaan Singh

AI总结 本文提出一种非语言到语言的迁移框架,通过非语言语音特征提升多语言语音情绪识别性能,采用超几何向量量化代码本和超几何情绪透镜,实现情绪强度建模,优于传统欧几里得方法。

Comments Accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12994 2026-04-24 cs.CR cs.AI

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。

Comments To appear in ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10072 2026-04-24 cs.CL

Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

仅在必要时推理:通过模型内部不确定性实现高效的生成奖励建模

Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) UESTC(电子科技大学) Peking University(北京大学)

AI总结 本文提出E-GRM框架,利用模型内部不确定性选择性触发推理,减少计算成本并提升答案准确性。

Comments accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08927 2026-04-24 cs.MA

Beyond the Individual: Virtualizing Multi-Disciplinary Reasoning for Clinical Intake via Collaborative Agents

超越个体:通过协作代理虚拟化多学科推理以实现临床摄入

Huangwei Chen, Wu Li, Junhao Jia, Yining Chen, Xiaotao Pang, YaLong Chen, Gonghui Li, Haishuai Wang, Jiajun Bu, Lei Wu

AI总结 本文提出Aegle框架,通过图基多代理架构在门诊咨询中实现多学科推理,提升文档质量和诊断准确性。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11044 2026-04-24 cs.AI

AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts

AgencyBench:在100万token现实场景中自主代理的前沿评估

Keyu Li, Junhao Shi, Yang Xiao, Mohan Jiang, Jie Sun, Yunze Wu, Dayuan Fu, Shijie Xia, Xiaojie Cai, Tianze Xu, Weiye Si, Wenjie Li, Dequan Wang, Pengfei Liu

机构 * SII Open Source(SII开源)

AI总结 本文提出AgencyBench,通过138个现实场景评估6种核心代理能力,揭示闭源模型在资源效率和反馈修正上的优势,为下一代自主代理的发展提供测试平台。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏