arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-28 至 2026-04-28 共收录 82
2604.23581 2026-04-28 cs.SE cs.CL

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23577 2026-04-28 cs.CL cs.LG

RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization

RouteNLP: 带有符合性级联和蒸馏协同优化的闭环大语言模型路由

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 RouteNLP通过闭环框架优化大语言模型在多样化NLP任务中的路由,减少成本并满足任务质量约束,通过级联和蒸馏协同优化实现显著成本降低。

Comments Accepted at ACL 2026 Industry Track. 13 pages, 2 figures, 15 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23543 2026-04-28 cs.CL cs.AI

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

Pref-CTRL: 基于偏好的大语言模型对齐方法使用表征编辑

Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

机构 * University of Technology Sydney(悉尼科技大学)

AI总结 本文提出Pref-CTRL,一种基于偏好的训练框架,通过多目标价值函数改进偏好数据结构,优于RE-Control并在跨领域数据集上表现更佳。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16909 2026-04-28 cs.CL cs.AI

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations

PRISM:探究语言模型幻觉中的推理、指令和来源记忆

Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

机构 * HKUST(GZ)(香港科技大学(广州)) NYUSH(纽约大学上海分校) DUFE(东华大学) CUHK(SZ)(香港城市大学(深圳)) CUFE(中国金融学院)

AI总结 PRISM通过四个维度分析语言模型幻觉,提供细粒度诊断评估,揭示不同模型在指令遵循、记忆检索和逻辑推理上的权衡。

Comments Accepted by ACL main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16817 2026-04-28 cs.LG cs.AI

Self-Reinforcing Controllable Synthesis of Rare Relational Data via Bayesian Calibration

通过贝叶斯校准实现自我强化的可控稀有关系数据合成

Chongsheng Zhang, Hao Wang, Zelong Yu, Esteban Garces Arias, Julian Rodemann, Zhanshuo Zhang, Qilong Li, Gaojuan Fan, Krikamol Muandet, Christian Heumann

机构 * Henan University, China(河南大学) Department of Statistics, LMU Munich(慕尼黑大学统计系) MCML Munich(慕尼黑MCML) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(萨尔布吕肯德国海德堡中心信息安全研究所)

AI总结 本文提出RDDG框架,通过动态引导生成表格数据以提升不平衡分类性能,采用核心集选择和自强化反馈机制优化生成质量。

Comments Accepted at: Findings of the Association for Computational Linguistics: ACL 2026 (ACL 2026 Findings), San Diego, California, USA, July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12373 2026-04-28 cs.CL

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

被共识掩盖:在LLM正确性中解构特权知识

Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) IBM Research(IBM研究院) Kempner Institute, Harvard University(哈弗大学凯普纳研究所)

AI总结 研究探讨大语言模型是否具备类似人类的内部状态评估正确性知识,通过自代表和外部模型对比发现,在分歧子集上,自代表在事实任务中表现更优,但数学推理中无优势。

Comments Accepted to ACL 2026 (Main Conference). 8 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15846 2026-04-28 cs.CL

Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs

基于门控树交叉注意力的检查点兼容语法注入解码器-only LLMs

Xinyu Gao, Shaonan Wang, Nai Ding

机构 * College of Biomedical Engineering & Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

AI总结 本文提出一种检查点兼容的门控树交叉注意力机制,用于在解码器-only LLMs中注入语法结构,提升语法鲁棒性而不影响问答和常识推理性能。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10298 2026-04-28 cs.CL

On Emergent Social World Models -- Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models

关于涌现的社会世界模型——证据显示语言模型中理论思维与语用推理的功能整合

Polina Tsvilodub, Jan-Felix Klumpp, Amir Mohammadpour, Jennifer Hu, Michael Franke

机构 * Department of Linguistics University of Tübingen(语言学系图宾根大学) Department of Cognitive Science Johns Hopkins University(认知科学系约翰霍普金斯大学)

AI总结 本文研究语言模型是否通过共享的计算机制整合一般理论思维与语言特定的语用推理,以支持语言模型是否具备涌现的社会世界模型。通过行为评估和因果机制实验,分析语言模型在七种理论思维能力子类别上的表现,发现支持功能整合假说。

Comments 39 pages, 20 figures, accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13288 2026-04-28 cs.CL

A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification

BERTology视角下的大语言模型编排:基于令牌和层的选择性探针用于高效单次分类

Gonzalo Ariel Meyoyan, Luciano Del Corro

机构 * Departamento de Computación, FCEyN Universidad de Buenos Aires(布宜诺斯艾利斯大学计算机系) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(圣安德烈斯大学工程系ELIAS实验室)

AI总结 本文提出基于BERTology方法的LLM编排框架,通过令牌和层选择性探针实现高效单次分类,提升安全性和情感分类性能,同时保持接近服务延迟并避免额外的VRAM和延迟成本。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10294 2026-04-28 cs.CR

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models

推理劫持:大语言模型中推理对齐的脆弱性

Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tun

AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16182 2026-04-28 cs.CR cs.CL

DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack

DualGuard: 双流大语言模型水印防御对抗同义词和伪装攻击

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Shi Wang, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

AI总结 DualGuard通过双流水印机制有效防御同义词和伪装攻击,提升水印检测的可靠性与可追溯性,实验表明其在多数据集和语言模型上的检测性、鲁棒性和文本质量均表现优异。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07538 2026-04-28 cs.CL

SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents

SwissGov-RSD: 一个人工标注的、跨语言基准,用于识别相关文档之间的词级语义差异

Michelle Wastl, Jannis Vamvas, Rico Sennrich

机构 * Department of Computational Linguistics, University of Zurich(瑞士苏黎世大学计算语言学系)

AI总结 本文提出SwissGov-RSD,首个跨语言文档级语义差异识别基准,包含224个多语言文档,通过人工标注词级差异,评估多种模型表现,揭示自动方法在跨语言任务中的不足。

Comments 30 pages; v3 accepted to ACL Main (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18774 2026-04-28 cs.CL

AI use in American newspapers is widespread, uneven, and rarely disclosed

美国报纸中AI的使用普遍存在、不均衡且很少披露

Jenna Russell, Marzena Karpinska, Destiny Akinode, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Simon Fraser University(西蒙 Fraser大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Pangram Labs(Pangram实验室)

AI总结 研究通过分析18.6万篇文章发现,约9%的新闻文章包含AI生成内容,且在小型本地报纸和特定主题中更常见,但AI使用情况很少被披露,凸显了对透明度和编辑标准更新的迫切需求。

Comments ACL Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13799 2026-04-28 cs.CL

BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning

BRIEF-Pro:基于短到长合成的通用上下文压缩用于快速准确的多跳推理

Jia-Chen Gu, Junyi Zhang, Di Wu, Yuankai Li, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 BRIEF-Pro通过短到长合成实现通用上下文压缩,提升多跳推理的效率和准确性,适用于多种语言模型。

Comments Accepted by ACL 2026 Findings. Code and data: https://github.com/JasonForJoy/BRIEF

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07838 2026-04-28 eess.AS

Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner

全双工bench-v2:一种多轮对话系统的评估框架及自动化考官

Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-yi Lee

AI总结 本文提出全双工bench-v2框架,通过自动化考官在快慢节奏下评估多轮对话系统,涵盖日常、纠正、实体追踪和安全任务,验证系统在多轮交互中的流畅性、指令遵循和任务能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05799 2026-04-28 cs.CL cs.AI cs.SD

Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech

高效的目标令牌级偏好优化用于基于大语言模型的文本到语音

Rikuto Kotoge, Yuichi Sasaki

机构 * SpiralAI Inc.(SpiralAI公司) The University of Osaka(大阪大学) Shizuoka University(izuoka大学)

AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20324 2026-04-28 cs.CL

Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities

紧凑语言模型能否像智能体一样搜索?基于知识增强的策略优化以保持智能体RAG能力

Rikuto Kotoge, Mai Nishimura, Jiaxin Ma

机构 * The University of Osaka(大阪大学) OMRON SINIC X Corporation(OMRON SINIC X公司)

AI总结 本文提出Distillation-Guided Policy Optimization方法,通过教师示范初始化和持续教师指导,使紧凑模型实现复杂的智能体搜索行为,甚至在某些情况下超越大模型。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13650 2026-04-28 cs.CL

CRISP: Persistent Concept Unlearning via Sparse Autoencoders

CRISP:通过稀疏自编码器实现持久性概念卸载

Tomer Ashuach, Dana Arad, Aaron Mueller, Martin Tutek, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术ion-以色列理工学院) Boston University(波士顿大学) University of Zagreb, FER(Zagreb大学,FER) Kempner Institute, Harvard University(哈佛大学 Kempner研究所)

AI总结 CRISP利用稀疏自编码器实现持久性概念卸载,通过自动识别多层显著SAE特征并抑制其激活,优于现有方法,在WMDP基准的安全关键卸载任务中有效移除有害知识并保持通用能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16888 2026-04-28 cs.CR cs.AI cs.CL

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

PARASITE: 条件系统提示污染以劫持大语言模型

Viet Pham, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

AI总结 PARASITE通过条件系统提示污染技术,使LLM在特定查询下输出被篡改响应,同时保持正常输入的高实用性,且在黑盒环境下实现70%的F1降级。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23530 2026-04-28 cs.CL cs.AI

MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings

MTRouter: 带成本意识的多轮LLM路由与历史-模型联合嵌入

Yiqun Zhang, Hao Li, Zihan Wang, Shi Feng, Xiaocui Yang, Daling Wang, Bo Zhang, Lei Bai, Shuyue Hu

机构 * School of Computer Science and Engineering, Northeastern University Shenyang 110819, China(东北大学计算机科学与工程学院,中国沈阳110819) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出MTRouter,通过联合历史-模型嵌入和学习轨迹预测器,提升多轮任务的性能-成本平衡,实验显示在ScienceWorld和Humanity's Last Exam上均取得显著成本降低与性能提升。

Comments This work has accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23486 2026-04-28 cs.CL cs.CY cs.HC

Your Students Don't Use LLMs Like You Wish They Did

学生不会像你希望的那样使用LLMs

Sebastian Kobler, Matthew Clemson, Angela Sun, Jonathan K. Kummerfeld

机构 * The University of Sydney(悉尼大学)

AI总结 本文提出六个计算指标,用于评估学生与AI对话的教育对齐情况,发现部署环境是影响使用模式的主要因素,而非学生偏好或系统设计。

Comments To appear at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23446 2026-04-28 cs.AI

IndustryAssetEQA: A Neurosymbolic Operational Intelligence System for Embodied Question Answering in Industrial Asset Maintenance

IndustryAssetEQA: 一种用于工业资产维护中具身体验问答的神经符号操作智能系统

Chathurangi Shyalika, Dhaval Patel, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) University of South Carolina(南卡罗来纳大学) IBM Yorktown(IBM约克镇分公司) Indian AI Research Organization(印度人工智能研究组织)

AI总结 本文提出IndustryAssetEQA系统,结合事件 telemetry 表示与FMEA-KG知识图谱,提升工业资产问答的结构有效性、反事实准确性及解释蕴含性,减少专家评估的过度声称。

Comments 20 pages, 4 figures, 4 tables, Accepted for the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026) Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23051 2026-04-28 cs.CL

Evaluating Temporal Consistency in Multi-Turn Language Models

评估多轮语言模型中的时间一致性

Yash Kumar Atri, Steven L. Johnson, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

AI总结 研究多轮对话中语言模型维持和更新时间假设的能力,提出ChronoScope基准测试集,发现模型在长对话中时间一致性常被破坏,揭示单轮事实准确与序列交互中时间推理的差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23002 2026-04-28 cs.AI cs.CL

FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean

FormalScience: 基于代理代码生成的可扩展人类在环科学自动形式化

Jordan Meadows, Lan Zhang, Andre Freitas

机构 * University of Manchester, UK(英国曼彻斯特大学) Idiap Research Institute, Switzerland(瑞士Idiap研究所) National Biomarker Centre, CRUK-MI, UK(英国国家生物标志物中心,CRUK-MI)

AI总结 FormalScience通过人类在环的代理流程,使非专业领域专家以低成本生成形式化证明,构建了包含200个大学物理问题及解决方案的FormalPhysics数据集,并探讨了现代LLM在自动形式化中的局限性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22934 2026-04-28 cs.AI cs.CL

PExA: Parallel Exploration Agent for Complex Text-to-SQL

PExA:复杂文本到SQL的并行探索代理

Tanmay Parekh, Ella Hofmann-Coyle, Shuyi Wang, Sachith Sri Ram Kothur, Srivas Prasad, Yunmo Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Bloomberg(彭博)

AI总结 本文提出PExA,通过软件测试覆盖视角解决文本到SQL的延迟与性能权衡问题,通过并行执行测试用例确保语义覆盖,最终生成准确的SQL。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22880 2026-04-28 cs.CL

TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction

TexOCR: 提升可编译页面到LaTeX重建的文档OCR模型

Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao

机构 * Yale University(耶鲁大学) Zhejiang University(浙江大学)

AI总结 本文提出TexOCR-Bench和TexOCR-Train,通过监督微调和强化学习训练出2B参数模型,提升科学PDF到可编译LaTeX的重建能力,验证了可验证奖励在结构和编译指标上的改进。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏