arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2604.11087 2026-05-12 cs.LG

CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models

CausalGaze: 通过反事实图干预揭示大语言模型的幻觉

Linggang Kong, Lei Wu, Yunlong Zhang, Xiaofeng Zhong, Zhen Wang, Yongjie Wang, Yao Pan

机构 * College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Anhui Province Key Laboratory of Cyberspace Security Situation Awareness and Evaluation(安徽省网络空间安全态势感知与评估重点实验室) Institute of Computer Application, China Academy of Engineering Physics(中国工程物理研究院计算机应用研究所)

AI总结 CausalGaze通过反事实图干预揭示大语言模型的幻觉,利用结构因果模型提升模型可解释性,在四个数据集和三个常用LLM上实验表明其有效性,尤其在TruthfulQA数据集上比现有方法提升3.3%的AUROC。

Comments Accepted as ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14889 2026-05-12 eess.AS cs.CL cs.LG

SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness

SDiaReward:基于模态和口语性的语音对话奖励建模与基准测试

Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 本文提出SDiaReward,一种端到端的多轮奖励模型,通过SDiaReward-Dataset数据集解决模态和口语性差距问题,实现对语音对话中模态和口语性的联合评估,实验表明其在配对偏好准确率上优于通用音频大语言模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24863 2026-05-12 cs.CL cs.AI cs.CY

Big AI is accelerating the metacrisis: What can we do?

大AI正在加速元危机:我们能做什么?

Steven Bird

机构 * Charles Darwin University(查尔斯·达尔文大学)

AI总结 大AI加剧了生态、意义和语言危机,本文呼吁语言工程师团结一致,探索替代方案,设计以人类繁荣为核心的自然语言处理未来。

Comments 12 pages, 2 figures, to appear in Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), San Diego, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18880 2026-05-12 cs.CL cs.AI cs.CY

Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction

LLMs能否估计学生困难?人类-人工智能难度对齐用于项目难度预测的 proficiency 模拟

Ming Li, Han Chen, Yunze Xiao, Jian Chen, Hong Jiao, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) MBZUAI

AI总结 本文研究了LLMs在估计学生困难方面的表现,发现模型规模扩大并不总能提高准确性,且模型倾向于形成机器共识而非与人类对齐,揭示了当前模型在自动难度预测中的挑战。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23074 2026-05-12 cs.CR cs.CL

Fast-MIA: Efficient and Scalable Membership Inference for LLMs

Fast-MIA:高效且可扩展的大型语言模型成员推断

Hiromu Takahashi, Shotaro Ishihara

机构 * Independent Researcher(独立研究者) Nikkei Inc.(日本 Nikkei 公司)

AI总结 本文提出Fast-MIA库,通过高吞吐量批量推理和交叉方法缓存架构,提升LLM成员推断攻击的效率与可扩展性,支持统一框架和灵活配置,促进可重复的隐私风险审计研究。

Comments ACL 2026 System Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22767 2026-05-12 cs.LG cs.CL

TELL-TALE: Task Efficient LLMs with Task Aware Layer Elimination

TELL-TALE:任务高效的大语言模型与任务感知的层消除

Omar Naim, Krish Sharma, Niyar R Barman, Nicholas Asher

机构 * IRIT Université de Toulouse(IRIT图卢兹大学) IRIT CNRS(IRIT国家科学研究中心)

AI总结 TELL-TALE通过任务感知的层消除方法优化任务性能,减少计算成本,同时在零样本和少样本设置下实现性能提升,适用于任务专用的大语言模型推理。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14685 2026-05-12 cs.CL

SSA: Improving Performance With a Better Scoring Function

SSA:通过更好的评分函数提升性能

Omar Naim, Swarnadeep Bhar, Jérôme Bolte, Nicholas Asher

机构 * IRIT Université de Toulouse(图卢兹大学IRIT研究所) Toulouse School of Economics University of Toulouse Capitole(图卢兹经济学院大学图卢兹校区) IRIT CNRS(IRIT国家科学研究中心)

AI总结 本文提出SSA评分函数,通过改进Transformer模型的注意力机制,提升上下文学习任务和NLP基准测试的表现。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11604 2026-05-12 cs.CL

Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation

与幻灯片对话:通过语言驱动的结构化数据操作实现高效幻灯片编辑

Kyudan Jung, Hojun Cho, Jooyeol Yun, Soyoung Yang, Jaehyeok Jang, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出Talk-to-Your-Slides,通过语言驱动的结构化数据操作实现高效幻灯片编辑,相较于基于图像的GUI方法,其在文本处理和格式任务中更快、更准确且成本更低。

Comments 30 pages, Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05383 2026-05-12 cs.AI cs.MA

AVA: Attentive VLM Agent for Mastering StarCraft II

AVA:面向星际2的注意力视觉语言代理

Weiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 AVA提出一个支持多智能体强化学习和视觉语言模型的星际2基准,通过RGB图像、自然语言观察和结构化状态信息,比较训练和零样本方法在21种场景中的表现,揭示训练效率、性能上限、可解释性和部署成本的权衡。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08943 2026-05-12 cs.CL cs.AI cs.LG

Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation

超越单极:在基准评估中揭示多代的价值

Wenbo Zhang, Hengrui Cai, Wenyu Chen

机构 * University of California Irvine(加州大学尔湾分校) Meta Central Applied Science(Meta中央应用科学)

AI总结 本文提出一种分层统计模型,通过整合基准特征和LLM随机性,提升基准评估准确性并减少方差,同时定义提示级难度分数并可视化提示难度与语义。

Comments 11 pages, 5 figures, accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09147 2026-05-12 cs.CL cs.AI stat.AP

From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages

从传统标注器到LLMs:一种中世纪罗曼语词性标注的比较研究

Matthias Schöffel, Esteban Garces Arias

机构 * Bavarian Academy of Sciences (BAdW)(巴伐利亚科学院) Department of Statistics, LMU Munich, Germany(慕尼黑大学统计系) Munich Center for Machine Learning (MCML), LMU Munich, Germany(慕尼黑机器学习中心)

AI总结 本文比较了传统规则和统计标注器与现代开源LLMs在中世纪罗曼语词性标注中的表现,发现LLMs在零样本、少样本、单语微调和跨语言迁移学习中均表现更优,尤其在资源匮乏语言中跨语言迁移学习效果显著。

Comments Accepted at NLP4DH @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09106 2026-05-12 cs.CL

Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

Fin-Bias:金融领域下LLM决策制定的综合评估:在存在人类偏见的背景下

Xiaoyu Hu, Jinman Zhao

机构 * Rutgers University(罗格斯大学) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

AI总结 本文提出Fin-Bias基准,评估LLM在金融不确定性和潜在人类偏见意见下的投资决策能力,通过分析8868份分析师报告揭示LLM易受显性偏见影响,并开发方法检测人类意见以促进LLM独立思考。

Comments ACL 2026 Findings

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09092 2026-05-12 cs.CL

Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus

字符级变换器用于塔吉克-波斯语转写及平行词典语料库

Mullosharaf K. Arabov

机构 * Institute of Computational Mathematics and Information Technologies(计算数学与信息科技研究所)

AI总结 本文提出一个字符级序列到序列Transformer模型,利用52152个塔吉克-波斯语词和短语的平行语料库,通过CER和精确匹配准确率验证,优于基于词典的规则和递归神经网络基线。

Comments Published in Proceedings of the 2nd Workshop on NLP for Languages Using Arabic Script (AbjadNLP), pages 75-83, Rabat, Morocco, March 2026

Journal ref Proceedings of the 2nd Workshop on NLP for Languages Using Arabic Script (AbjadNLP), pages 75-83, Rabat, Morocco. Association for Computational Linguistics, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08847 2026-05-12 cs.CL

EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

EmoS:一种高保真多模态基准,用于细粒度流式情感理解

Pengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong

机构 * NLP(自然语言处理) CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学学院,澳门大学CT实验室) School of Computer Science, Central China Normal University(Central China Normal University计算机科学学院)

AI总结 本文提出EmoS基准,通过严格过滤静态片段与动态流式独白子集结合,解决现有数据集在生态效度和噪声方面的不足,提升多模态大语言模型在情感识别和共情模型训练中的性能。

Comments acl - 2026 main accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08799 2026-05-12 cs.RO

ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation

ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)

AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08765 2026-05-12 cs.LG cs.AI

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

无法学习者可以撒谎:评估和改进LLM去学习中的诚实性

Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

机构 * Fudan University(复旦大学) Central South University(中南大学) Michigan State University(密歇根州立大学)

AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08721 2026-05-12 cs.CL

Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

打破僵局:用于社交语言代理的双尺度进化策略训练

Minzheng Wang, Run Luo, Yanbo Wang, Zichen Liu, Yuqiao Tan, Tao Tan, Xu Nan, Yinhe Zheng, Wenji Mao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Ritzz-AI

AI总结 本文提出双尺度进化策略训练方法,解决社交语言游戏中因策略空间庞大导致的进化停滞问题,通过动态优化景观干预,恢复梯度信号并促进持续战略探索。

Comments Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08612 2026-05-12 cs.RO

ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models

ATAAT: 面向视觉-语言-动作模型后门攻击的自适应威胁感知对抗调制框架

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(重庆绿色智能技术研究院,中国科学院) Chongqing School, University of Chinese Academy of Sciences(重庆学校,中国科学院大学) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(奥卢大学信息科技与电气工程学院,芬兰)

AI总结 本文提出ATAAT框架,解决视觉-语言-动作模型中后门攻击的梯度干扰问题,通过威胁-方法自适应映射机制实现高效攻击并保持隐蔽性,实验表明其在高成功率和低污染率下表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06231 2026-05-12 cs.CL

YEZE at SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization via Heterogeneous Ensembling

YEZE在SemEval-2026任务9:通过异构集成检测多语言、多文化及多事件在线极化

Fengze Guo, Yue Chang

机构 * University of Tübingen(图宾根大学)

AI总结 本文提出了一种系统,用于SemEval-2026任务9,通过三个子任务检测22种语言的极化社交媒体内容,采用异构集成多语言预训练模型,结合多任务学习、翻译数据增强和类别加权提升分类性能。

Comments Accepted to the SemEval-2026 workshop of the ACL 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11042 2026-05-12 cs.CL cs.AI

Spectral Characterization and Mitigation of Sequential Knowledge Editing Collapse

谱分析与序列知识编辑崩溃的缓解

Chi Zhang, Mengqi Zhang, Xiaotian Ye, Runxi Cheng, Zisheng Zhou, Ying Zhou, Pengjie Ren, Zhumin Chen

机构 * Shandong University(山东大学) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文通过谱分析揭示了序列知识编辑中模型泛化能力与预训练权重矩阵主导奇异方向的关系,提出REVIVE框架通过显式保留主导奇异子空间来稳定编辑过程,提升编辑效果并保持模型泛化能力。

Comments 22 pages, 18 figures, Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03511 2026-05-12 cs.CL cs.AI cs.LG

IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation

IntroLM:通过预填充阶段自我评估实现反思语言模型

Hossein Hosseini Kasnavieh, Gholamreza Haffari, Chris Leckie, Adel N. Toosi

机构 * DisNet Lab, School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院DisNet实验室) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) Department of Data Science & AI, Monash University, Australia(墨尔本大学数据科学与人工智能系)

AI总结 IntroLM通过在预填充阶段引入自我评估机制,使语言模型能预测自身输出质量,无需外部评估器,提升了生成效率和准确性。

Comments Accepted for publication in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20036 2026-05-12 cs.CL cs.SE

ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering

ToolScope: 通过工具合并和上下文感知过滤增强LLM代理的工具使用

Marianne Menglin Liu, Daniel Garcia, Fjona Parllaku, Vikas Upadhyay, Syed Fahad Allam Shah, Dan Roth

机构 * Oracle AI

AI总结 ToolScope通过自动校正的工具合并和上下文感知检索提升LLM代理的工具选择准确性,实验表明在三个顶级LLM和开源基准上提升了8.38%至38.6%的准确率。

Comments ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01191 2026-05-12 cs.AI cs.CL cs.LG

Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens

大语言模型的链式推理是否是一种幻象?一种数据分布视角

Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu

机构 * Arizona State University(亚利桑那州立大学)

AI总结 本文通过数据分布视角探讨了大语言模型链式推理的有效性,揭示其在分布差异下的脆弱性,提出DataAlchemy环境验证了推理能力受训练分布影响的结论。

Comments Accepted by the Association for Computational Linguistics (ACL) 2026 and Foundations of Reasoning in Language Models (FoRLM) at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10960 2026-05-12 cs.LG math.ST stat.TH

Ranking Reasoning LLMs under Test-Time Scaling

在测试时间扩展下对推理LLM进行排名

Mohsen Hariri, Michael Hinczewski, Jing Ma, Vipin Chaudhary

机构 * Department of Computer and Data Sciences(计算机与数据科学系) Department of Physics(物理系) Case Western Reserve University(凯斯西储大学)

AI总结 本文提出Scorio库,通过统计排名方法评估推理模型,在20个数学竞赛基准上验证了多种排名方法的有效性,并展示了在不同测试时间扩展下的性能。

Comments Code is available at https://github.com/mohsenhariri/scorio

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15075 2026-05-12 cs.LG

Quantize What Counts: More for Keys, Less for Values

量化关键:更多关键,更少值

Mohsen Hariri, Alan Luo, Weicong Chen, Shaochen Zhong, Tianyi Zhang, Qifan Wang, Xia Hu, Xiaotian Han, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) Rice University(Rice大学) Meta

AI总结 本文提出两项定理,基于Transformer模型的内在几何特性,指导混合精度KV量化。关键投影具有更大的谱范数和Frobenius范数,优先分配精度给关键能减少量化误差并保留准确性。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08070 2026-05-11 cs.AI

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)

AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08048 2026-05-11 cs.CL

Accurate and Efficient Statistical Testing for Word Semantic Breadth

精确且高效的词义广度统计检验

Yo Ehara

机构 * Tokyo Gakugei University(东京大学)

AI总结 本文提出一种基于Householder对齐的置换检验方法,用于区分词义广度与方向差异,降低I类错误并提升效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏