arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2604.23877 2026-04-28 cs.CL

Knowledge Vector of Logical Reasoning in Large Language Models

大语言模型中逻辑推理的知识向量

Zixuan Wang, Yuanyuan Lei

机构 * Department of Computer & Information Science and Engineering(计算机与信息科学与工程系)

AI总结 本文研究了大语言模型中演绎、归纳和溯因推理的知识表示,发现其在线性空间中可独立表示,提出互补子空间约束框架以增强其互补性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23842 2026-04-28 cs.CL cs.AI

Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms

重加热的玉米片?评估AI在跨文化新词交流中的支持作用

Dayeon Ki, Yu Hou, Rachel Rudinger, Hal Daumé, Marine Carpuat, Fumeng Yang

机构 * University of Maryland(马里兰大学)

AI总结 研究评估AI工具在帮助非母语者跨文化交流新词中的有效性,通过实验证明AI解释对提升母语者评价的竞争力有最大提升,但非母语者自我评估与实际表现存在偏差。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23809 2026-04-28 cs.CL

LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models

LegalDrill: 以诊断驱动合成促进小型语言模型中的法律推理

Tianchun Li, Haochen Liu, Vishwa Pardeshi, Xingchen Wang, Tianci Liu, Huijun Zhao, Wei Fan, Jing Gao

机构 * Purdue University(普渡大学) Fidelity Investments(富达投资)

AI总结 LegalDrill通过精细提示提取并迭代优化教师模型的推理轨迹,结合自我反思验证选择有效数据,提升小型语言模型的法律推理能力,无需稀缺专家标注。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23783 2026-04-28 cs.IR cs.AI

S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QA

S2G-RAG:结构充分性与间隙判断用于迭代检索增强问答

Minghan Li, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

AI总结 S2G-RAG通过结构化充分性判断和间隙判断机制,提升多跳问答的准确性和鲁棒性,适用于多轮检索流程。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23779 2026-04-28 cs.IR cs.AI

GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval

GLIER:生成式法律推理与证据排序用于法律案例检索

Minghan Li, Tianrui Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

AI总结 GLIER通过生成式法律推理和证据排序框架,解决法律案例检索中非专业查询与专业文档间的语义鸿沟问题,提升检索的可解释性和准确性。

Comments Accepted to the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23742 2026-04-28 cs.SD

RTCFake: Speech Deepfake Detection in Real-Time Communication

RTCFake: 语音深度伪造检测中的实时通信

Jun Xue, Zhuolin Yi, Yihuan Huang, Yanzhen Ren, Yujie Chen, Cunhang Fan, Zicheng Su, Yonghong Zhang, Bo Cai

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Beihang University(北京航空航天大学)

AI总结 本文提出RTCFake数据集,用于实时通信场景下的语音深度伪造检测,结合平台不变语义表征学习策略,提升跨平台泛化能力与噪声鲁棒性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23588 2026-04-28 cs.AI cs.CL cs.IR

FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

FinGround:通过原子性声明验证检测和支撑金融幻觉

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 FinGround通过三阶段验证-支撑流程,针对金融文档问答中的计算错误进行验证和修正,有效降低幻觉率,其在金融领域具有重要应用价值。

Comments Accepted to ACL 2026 Industry Track. 14 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23585 2026-04-28 cs.CL cs.IR cs.LG

ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection

ComplianceNLP:基于知识图谱的多框架监管缺口检测RAG系统

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 ComplianceNLP通过整合知识图谱增强的RAG系统,实现监管变化自动监控、义务提取及合规缺口识别,其在监管缺口检测上达到87.7 F1,优于GPT-4o+RAG,且在实际部署中显著提升分析师效率。

Comments Accepted at ACL 2026 Industry Track. 19 pages, 15 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23581 2026-04-28 cs.SE cs.CL

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23577 2026-04-28 cs.CL cs.LG

RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization

RouteNLP: 带有符合性级联和蒸馏协同优化的闭环大语言模型路由

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 RouteNLP通过闭环框架优化大语言模型在多样化NLP任务中的路由,减少成本并满足任务质量约束,通过级联和蒸馏协同优化实现显著成本降低。

Comments Accepted at ACL 2026 Industry Track. 13 pages, 2 figures, 15 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23543 2026-04-28 cs.CL cs.AI

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

Pref-CTRL: 基于偏好的大语言模型对齐方法使用表征编辑

Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

机构 * University of Technology Sydney(悉尼科技大学)

AI总结 本文提出Pref-CTRL,一种基于偏好的训练框架,通过多目标价值函数改进偏好数据结构,优于RE-Control并在跨领域数据集上表现更佳。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16909 2026-04-28 cs.CL cs.AI

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations

PRISM:探究语言模型幻觉中的推理、指令和来源记忆

Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

机构 * HKUST(GZ)(香港科技大学(广州)) NYUSH(纽约大学上海分校) DUFE(东华大学) CUHK(SZ)(香港城市大学(深圳)) CUFE(中国金融学院)

AI总结 PRISM通过四个维度分析语言模型幻觉,提供细粒度诊断评估,揭示不同模型在指令遵循、记忆检索和逻辑推理上的权衡。

Comments Accepted by ACL main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16817 2026-04-28 cs.LG cs.AI

Self-Reinforcing Controllable Synthesis of Rare Relational Data via Bayesian Calibration

通过贝叶斯校准实现自我强化的可控稀有关系数据合成

Chongsheng Zhang, Hao Wang, Zelong Yu, Esteban Garces Arias, Julian Rodemann, Zhanshuo Zhang, Qilong Li, Gaojuan Fan, Krikamol Muandet, Christian Heumann

机构 * Henan University, China(河南大学) Department of Statistics, LMU Munich(慕尼黑大学统计系) MCML Munich(慕尼黑MCML) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(萨尔布吕肯德国海德堡中心信息安全研究所)

AI总结 本文提出RDDG框架,通过动态引导生成表格数据以提升不平衡分类性能,采用核心集选择和自强化反馈机制优化生成质量。

Comments Accepted at: Findings of the Association for Computational Linguistics: ACL 2026 (ACL 2026 Findings), San Diego, California, USA, July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12373 2026-04-28 cs.CL

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

被共识掩盖:在LLM正确性中解构特权知识

Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) IBM Research(IBM研究院) Kempner Institute, Harvard University(哈弗大学凯普纳研究所)

AI总结 研究探讨大语言模型是否具备类似人类的内部状态评估正确性知识,通过自代表和外部模型对比发现,在分歧子集上,自代表在事实任务中表现更优,但数学推理中无优势。

Comments Accepted to ACL 2026 (Main Conference). 8 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15846 2026-04-28 cs.CL

Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs

基于门控树交叉注意力的检查点兼容语法注入解码器-only LLMs

Xinyu Gao, Shaonan Wang, Nai Ding

机构 * College of Biomedical Engineering & Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

AI总结 本文提出一种检查点兼容的门控树交叉注意力机制,用于在解码器-only LLMs中注入语法结构,提升语法鲁棒性而不影响问答和常识推理性能。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10298 2026-04-28 cs.CL

On Emergent Social World Models -- Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models

关于涌现的社会世界模型——证据显示语言模型中理论思维与语用推理的功能整合

Polina Tsvilodub, Jan-Felix Klumpp, Amir Mohammadpour, Jennifer Hu, Michael Franke

机构 * Department of Linguistics University of Tübingen(语言学系图宾根大学) Department of Cognitive Science Johns Hopkins University(认知科学系约翰霍普金斯大学)

AI总结 本文研究语言模型是否通过共享的计算机制整合一般理论思维与语言特定的语用推理,以支持语言模型是否具备涌现的社会世界模型。通过行为评估和因果机制实验,分析语言模型在七种理论思维能力子类别上的表现,发现支持功能整合假说。

Comments 39 pages, 20 figures, accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13288 2026-04-28 cs.CL

A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification

BERTology视角下的大语言模型编排:基于令牌和层的选择性探针用于高效单次分类

Gonzalo Ariel Meyoyan, Luciano Del Corro

机构 * Departamento de Computación, FCEyN Universidad de Buenos Aires(布宜诺斯艾利斯大学计算机系) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(圣安德烈斯大学工程系ELIAS实验室)

AI总结 本文提出基于BERTology方法的LLM编排框架,通过令牌和层选择性探针实现高效单次分类,提升安全性和情感分类性能,同时保持接近服务延迟并避免额外的VRAM和延迟成本。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10294 2026-04-28 cs.CR

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models

推理劫持:大语言模型中推理对齐的脆弱性

Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tun

AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16182 2026-04-28 cs.CR cs.CL

DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack

DualGuard: 双流大语言模型水印防御对抗同义词和伪装攻击

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Shi Wang, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

AI总结 DualGuard通过双流水印机制有效防御同义词和伪装攻击,提升水印检测的可靠性与可追溯性,实验表明其在多数据集和语言模型上的检测性、鲁棒性和文本质量均表现优异。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07538 2026-04-28 cs.CL

SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents

SwissGov-RSD: 一个人工标注的、跨语言基准,用于识别相关文档之间的词级语义差异

Michelle Wastl, Jannis Vamvas, Rico Sennrich

机构 * Department of Computational Linguistics, University of Zurich(瑞士苏黎世大学计算语言学系)

AI总结 本文提出SwissGov-RSD,首个跨语言文档级语义差异识别基准,包含224个多语言文档,通过人工标注词级差异,评估多种模型表现,揭示自动方法在跨语言任务中的不足。

Comments 30 pages; v3 accepted to ACL Main (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18774 2026-04-28 cs.CL

AI use in American newspapers is widespread, uneven, and rarely disclosed

美国报纸中AI的使用普遍存在、不均衡且很少披露

Jenna Russell, Marzena Karpinska, Destiny Akinode, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Simon Fraser University(西蒙 Fraser大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Pangram Labs(Pangram实验室)

AI总结 研究通过分析18.6万篇文章发现,约9%的新闻文章包含AI生成内容,且在小型本地报纸和特定主题中更常见,但AI使用情况很少被披露,凸显了对透明度和编辑标准更新的迫切需求。

Comments ACL Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13799 2026-04-28 cs.CL

BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning

BRIEF-Pro:基于短到长合成的通用上下文压缩用于快速准确的多跳推理

Jia-Chen Gu, Junyi Zhang, Di Wu, Yuankai Li, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 BRIEF-Pro通过短到长合成实现通用上下文压缩,提升多跳推理的效率和准确性,适用于多种语言模型。

Comments Accepted by ACL 2026 Findings. Code and data: https://github.com/JasonForJoy/BRIEF

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07838 2026-04-28 eess.AS

Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner

全双工bench-v2:一种多轮对话系统的评估框架及自动化考官

Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-yi Lee

AI总结 本文提出全双工bench-v2框架,通过自动化考官在快慢节奏下评估多轮对话系统,涵盖日常、纠正、实体追踪和安全任务,验证系统在多轮交互中的流畅性、指令遵循和任务能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05799 2026-04-28 cs.CL cs.AI cs.SD

Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech

高效的目标令牌级偏好优化用于基于大语言模型的文本到语音

Rikuto Kotoge, Yuichi Sasaki

机构 * SpiralAI Inc.(SpiralAI公司) The University of Osaka(大阪大学) Shizuoka University(izuoka大学)

AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20324 2026-04-28 cs.CL

Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities

紧凑语言模型能否像智能体一样搜索?基于知识增强的策略优化以保持智能体RAG能力

Rikuto Kotoge, Mai Nishimura, Jiaxin Ma

机构 * The University of Osaka(大阪大学) OMRON SINIC X Corporation(OMRON SINIC X公司)

AI总结 本文提出Distillation-Guided Policy Optimization方法,通过教师示范初始化和持续教师指导,使紧凑模型实现复杂的智能体搜索行为,甚至在某些情况下超越大模型。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏