arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-24 至 2026-04-24 共收录 34
2604.21461 2026-04-24 cs.CV cs.HC

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21420 2026-04-24 cs.AI

FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation

FairQE:缓解翻译质量评估中性别偏见的多智能体框架

Jinhee Jang, Juhwan Choi, Dongjin Lee, Seunguk Yu, Youngbin Kim

机构 * Chung-Ang University(Chung-Ang 大学) AITRICS

AI总结 FairQE通过多智能体机制检测性别线索并生成性别翻转翻译变体,结合传统QE评分与LLM偏见缓解推理,提升翻译质量评估的性别公平性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21309 2026-04-24 cs.CL

When Bigger Isn't Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation

当更大并非更好:对多新闻摘要中政治偏见的全面公平性评估

Nannan Huang, Iffat Maab, Junichi Yamagishi

机构 * RMIT University(皇家墨尔本理工大学) National Institute of Informatics(日本信息处理学会)

AI总结 本文评估多文档新闻摘要中的政治偏见,发现大模型并不总是更公平,中等规模模型在公平性与效率上表现更优,提示需多维评估框架和针对性去偏策略。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21308 2026-04-24 cs.CR cs.CL

CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents

CI-Work: 企业LLM代理中情境完整性基准测试

Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft(微软)

AI总结 CI-Work基准测试评估企业LLM代理在密集检索中传达关键内容并隐藏敏感信息的能力,揭示隐私泄露普遍且高任务效用与隐私违规正相关,需转向以情境为中心的架构。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL'2026) -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21255 2026-04-24 cs.CL

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

当代理看起来相同:量化蒸馏诱导的工具使用行为相似性

Chenghao Yang, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, USTC(USTC计算机科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) M-A-P

AI总结 本文提出两种新指标RPS和AGS,用于区分任务成功必需行为与模型自主偏好,通过评估18个模型发现AGS能区分教师特定收敛与通用改进。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21253 2026-04-24 cs.CL cs.AI

Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation

超越文本的规划:基于图的复杂叙事生成推理

Hanwen Gu, Chao Guo, Junle Wang, Wenda Xie, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Turing Lab(腾讯人工智能实验室)

AI总结 本文提出PLOTTER框架,通过结构图进行叙事规划,提升LLM在复杂叙事生成中的长上下文推理能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21235 2026-04-24 cs.LG cs.CL stat.ME

Learning Dynamic Representations and Policies from Multimodal Clinical Time-Series with Informative Missingness

从具有信息性缺失的多模态临床时间序列中学习动态表示和策略

Zihan Liang, Ziwen Pan, Ruoxuan Xiong

机构 * Emory University(埃默里大学)

AI总结 本文提出了一种多模态临床时间序列患者表示学习框架,利用信息性缺失来提升治疗策略学习和患者预后预测性能。

Comments Findings of ACL 2026 (30 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21191 2026-04-24 cs.CL

Prefix Parsing is Just Parsing

前缀解析只是解析

Clemente Pasti, Andreas Opedal, Timothy J. O'Donnell, Ryan Cotterell, Tim Vieira

机构 * ETH Zürich(苏黎世联邦理工学院) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) Mila CHI-FRO

AI总结 本文提出通过前缀文法变换将前缀解析转化为普通解析,从而高效解决前缀解析问题,并引入基于算法微分的策略计算下一token权重向量,提供了一种简单、通用且高效的前缀解析框架。

Comments To appear at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21159 2026-04-24 cs.CR cs.AI cs.CL cs.LG

Adaptive Instruction Composition for Automated LLM Red-Teaming

自适应指令生成用于自动化大语言模型红队测试

Jesse Zymet, Andy Luo, Swapnil Shinde, Sahil Wadhwa, Emily Chen

机构 * Capital One, AI Foundations(Capital One人工智能基础研究)

AI总结 本文提出自适应指令生成框架,通过强化学习平衡探索与利用,提升红队测试的攻击效果与多样性,优于随机组合和现有方法。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21045 2026-04-24 cs.CL

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

分层策略优化用于无界语音的同时翻译

Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达)

AI总结 本文提出分层策略优化方法,通过后训练处理不完美的监督微调数据,提升同时语音翻译质量与效率,实验显示在1.5秒延迟下,COMET和MetricX得分分别提升超7和1.25。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20917 2026-04-24 cs.LG cs.AI cs.CL cs.PL cs.SE

The Path Not Taken: Duality in Reasoning about Program Execution

未选择的道路:程序执行推理中的对偶性

Eshgin Hasanov, Md Mahadi Hassan Sibat, Santu Karmaker, Aashish Yadavally

机构 * Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)

AI总结 本文提出通过双重推理任务评估程序执行的因果理解,提出DexBench基准测试集,评估13种LLM,证明双路径推理能有效提升动态代码理解能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20789 2026-04-24 cs.CL cs.AI cs.LG

Working Memory Constraints Scaffold Learning in Transformers under Data Scarcity

工作记忆限制在数据稀缺下支撑Transformer的学习

Pranava Madhyastha, Dagmar Adamcova

机构 * City, University of London(伦敦城市大学) The Alan Turing Institute(艾伦·图灵研究所) Grounded Machines

AI总结 本文探讨在Transformer架构中引入类人工作记忆限制,提出基于固定宽度窗口和时间衰减的注意力机制,实验表明在数据稀缺时,这些约束能显著提升语法准确性并增强与人类处理指标的一致性。

Comments Published in ACL 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19934 2026-04-24 cs.CL

Tracing Relational Knowledge Recall in Large Language Models

追踪大型语言模型中的关系知识回忆

Nicholas Popovič, Michael Färber

机构 * TU Dresden(德累斯顿技术大学)

AI总结 研究大型语言模型在文本生成中如何回忆关系知识,通过线性探测识别适合关系分类的潜在表示。分析不同潜在表示,发现注意力头对残差流的贡献是线性关系分类的强特征。

Comments ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18779 2026-04-24 cs.CL cs.AI

Mango: Multi-Agent Web Navigation via Global-View Optimization

Mango:通过全局视图优化实现多智能体网络导航

Weixi Tong, Yifeng Di, Tianyi Zhang

机构 * Purdue University(普渡大学)

AI总结 本文提出Mango方法,利用网站结构动态确定最优起始点,通过多臂老虎机问题和Thompson采样优化导航预算,并引入周期性记忆组件提升导航效率,实验显示在WebVoyager和WebWalkerQA上均优于基线方法。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17647 2026-04-24 eess.AS

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

语调作为监督:连接非语言与语言以实现多语言语音情绪识别

Girish, Mohd Mujtaba Akhtar, Muskaan Singh

AI总结 本文提出一种非语言到语言的迁移框架,通过非语言语音特征提升多语言语音情绪识别性能,采用超几何向量量化代码本和超几何情绪透镜,实现情绪强度建模,优于传统欧几里得方法。

Comments Accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12994 2026-04-24 cs.CR cs.AI

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。

Comments To appear in ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10072 2026-04-24 cs.CL

Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

仅在必要时推理:通过模型内部不确定性实现高效的生成奖励建模

Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) UESTC(电子科技大学) Peking University(北京大学)

AI总结 本文提出E-GRM框架,利用模型内部不确定性选择性触发推理,减少计算成本并提升答案准确性。

Comments accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08927 2026-04-24 cs.MA

Beyond the Individual: Virtualizing Multi-Disciplinary Reasoning for Clinical Intake via Collaborative Agents

超越个体:通过协作代理虚拟化多学科推理以实现临床摄入

Huangwei Chen, Wu Li, Junhao Jia, Yining Chen, Xiaotao Pang, YaLong Chen, Gonghui Li, Haishuai Wang, Jiajun Bu, Lei Wu

AI总结 本文提出Aegle框架,通过图基多代理架构在门诊咨询中实现多学科推理,提升文档质量和诊断准确性。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11044 2026-04-24 cs.AI

AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts

AgencyBench:在100万token现实场景中自主代理的前沿评估

Keyu Li, Junhao Shi, Yang Xiao, Mohan Jiang, Jie Sun, Yunze Wu, Dayuan Fu, Shijie Xia, Xiaojie Cai, Tianze Xu, Weiye Si, Wenjie Li, Dequan Wang, Pengfei Liu

机构 * SII Open Source(SII开源)

AI总结 本文提出AgencyBench,通过138个现实场景评估6种核心代理能力,揭示闭源模型在资源效率和反馈修正上的优势,为下一代自主代理的发展提供测试平台。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03248 2026-04-24 cs.CL

STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning

STReasoner: 通过空间感知强化学习赋能LLMs进行时间序列的时空推理

Juntong Ni, Shiyu Wang, Qi He, Ming Jin, Wei Jin

机构 * Emory University(埃默里大学) Microsoft(微软) Griffith University(格里菲斯大学)

AI总结 本文提出STReasoner,通过整合时间序列、图结构和文本,提升LLMs的时空推理能力,采用S-GRPO算法增强空间逻辑,实验显示在低成本下取得显著准确率提升。

Comments ACL 2026 Main, we release our code publicly at https://github.com/LingFengGold/STReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05591 2026-04-24 cs.LG cs.CL

Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning

熵比裁剪作为稳定强化学习的软全局约束

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Tiehua Mei, Zijia Lin, Yuntao Li, Wenping Hu, Ruiming Tang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) Independent(独立)

AI总结 本文提出熵比裁剪机制,通过量化策略探索的相对变化,缓解强化学习中的分布偏移问题,提升训练稳定性。

Comments This paper has been accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20697 2026-04-24 cs.SD cs.AI

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06209 2026-04-24 cs.AI cs.CL

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18914 2026-04-24 cs.CL cs.AI

Fairness Evaluation and Inference Level Mitigation in LLMs

在大型语言模型中公平性评估与推断层面缓解

Afrozah Nadeem, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚)

AI总结 本文提出动态可逆剪枝框架,通过检测上下文感知的神经元激活并应用自适应遮蔽,实现细粒度内存感知的公平性缓解,提升多语言单轮和多轮对话的连贯性与公平性控制。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics San Diego, California, United, States July 2 to 7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15313 2026-04-24 cs.CL

Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry

大型语言模型在古典汉语诗歌生成中的能力与评估偏差:以唐诗为例

Bolei Ma, Yina Yao, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学College Park分校)

AI总结 本文通过三步评估框架,分析了六个先进LLM在唐诗生成中的表现,揭示了LLM在模仿统计模式时对机器生成诗歌的系统性高估问题,强调了需要混合人类-模型验证框架的重要性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10971 2026-04-24 cs.CL cs.AI

RV-HATE: Reinforced Multi-Module Voting for Implicit Hate Speech Detection

RV-HATE:强化多模块投票用于隐性仇恨言论检测

Yejin Lee, Hyeseon Ahn, Yo-Sub Han

机构 * Yonsei University(延世大学)

AI总结 RV-HATE通过多模块投票机制和强化学习优化,针对不同数据集特性提升隐性仇恨言论检测准确率并提供可解释性分析。

Comments 20 pages, 9 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23649 2026-04-24 cs.IR cs.CL

From Past To Path: Masked History Learning for Next-Item Prediction in Generative Recommendation

从过去到路径:用于生成推荐中下一项预测的掩码历史学习

KaiWen Wei, Kejun He, Xiaomian Kang, Jie Zhang, Yuming Yang, Li Jin, Zhenyang Li, Jiang Zhong, He Bai, Junnan Zhu

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Independent Researcher(独立研究员) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

AI总结 本文提出Masked History Learning框架,通过重建掩码的历史项目增强对用户行为的理解,从而提升推荐准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏