arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2603.29665 2026-05-15 cs.CL

Near-Miss: Latent Policy Failure Detection in Agentic Workflows

近似失误:代理工作流中的潜在策略失败检测

Ella Rabinovich, David Boaz, Naama Zwerdling, Ateret Anaby-Tavor

机构 * IBM Research(IBM研究院)

AI总结 本文提出一种新指标,用于检测代理对话轨迹中的潜在策略失败,通过分析代理工具调用决策的充分性,揭示当前评估方法的盲点。

Comments GEM@ACL2026, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03969 2026-05-15 cs.AI cs.CL

Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models

反长度偏移:动态异常截断用于训练高效的推理模型

Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出动态异常截断方法,通过在训练时抑制冗余token,提升推理模型的效率与性能,实验显示在AIME-24上推理token使用减少78%且准确率提升。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14117 2026-05-15 cs.CL cs.AI

Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards

通过可验证奖励的强化学习进行生成式平面设计

Luis Lara, Aristides Milios, Zhi Hao Luo, Aditya Sharma, Ge Ya Luo, Christopher Beckham, Florian Golemo, Christopher Pal

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 本文提出基于LLM的平面设计方法,通过强化学习与可验证奖励提升拓扑和数值约束的满足度,优于现有方法在真实性、兼容性和多样性指标上。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14002 2026-05-15 cs.AI

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts

PolitNuggets: 评估代理发现长尾政治事实

Yifei Zhu

机构 * The University of Hong Kong(香港大学)

AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。

Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02179 2026-05-15 cs.CL

Confidence Estimation for LLMs in Multi-turn Interactions

在多轮交互中对大语言模型的置信度估计

Caiqi Zhang, Ruihan Yang, Xiaochen Zhu, Chengzu Li, Tiancheng Hu, Yijiang River Dong, Deqing Yang, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学)

AI总结 本文研究了多轮对话中大语言模型置信度估计的问题,提出了一种评估框架和新指标,发现传统方法在多轮对话中表现不佳,而新方法更有效。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07060 2026-05-15 cs.CL

Does Local News Stay Local?: Online Content Shifts in Sinclair-Acquired Stations

本地新闻仍然本地吗?:西恩斯集团收购电台的在线内容变化

Miriam Wanner, Sophia Hager, Anjalie Field

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究探讨西恩斯集团收购本地新闻电台后,其在线内容对本地与全国性话题的报道变化,发现电台更频繁报道全国性新闻,且对具有争议性的全国性话题的报道增加。

Comments Published at NLP+CSS Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00231 2026-05-15 cs.LG cs.AI

The Pitfalls of KV Cache Compression

KV缓存压缩的陷阱

Alex Chen, Renato Geh, Aditya Grover, Guy Van den Broeck, Daniel Israel

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文研究了KV缓存压缩在多指令提示中的问题,发现某些指令在压缩后性能下降明显,提出改进KV缓存淘汰策略以提升多指令任务表现。

Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23912 2026-05-15 cs.CL cs.AI

LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations

LoVeC:强化学习用于长文生成中的更可靠的 verbalized 自信度

Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Nigel Collier, Andreas Vlachos

机构 * University of Cambridge(剑桥大学)

AI总结 本文提出LoVeC,一种基于强化学习的方法,通过在长文生成过程中实时附加数值自信度评分,提升事实性生成的可靠性。实验表明,该方法在多个长文问答数据集上实现了更好的校准和跨领域泛化能力,且效率显著高于传统自一致性方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13709 2026-05-14 cs.CL cs.AI cs.LG

Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety

通过监督微调紧凑LLMs实现儿童英语阅读故事生成:具有可控难度和安全性的方法

Qian Shen, Fanghua Cao, Min Yao, Shlok Gilda, Bonnie J. Dorr, Walter L. Leite

机构 * University of Florida(佛罗里达大学)

AI总结 本文通过监督微调紧凑LLMs生成儿童英语阅读故事,实现可控难度和安全性,实验表明微调模型在难度指标上优于零样本模型。

Comments Comments: 15 pages, 4 figures. Author Two and Author Three contributed equally. Accepted by the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13412 2026-05-14 cs.CL cs.AI

LLMs as annotators of credibility assessment in Danish asylum decisions: evaluating classification performance and errors beyond aggregated metrics

大型语言模型作为丹麦庇护决定中可信度评估标注者的应用:评估分类性能和错误超越聚合指标

Galadrielle Humblot-Renaux, Mohammad N. S. Jahromi, Rohat Bakuri-Jørgensen, Marieke Anne Heyl, Asta S. Stage Jarlner, Maria Vlachou, Anna Murphy Høgenhaug, Desmond Elliott, Thomas Gammeltoft-Hansen, Thomas B. Moeslund

机构 * Visual Analysis and Perception Lab(视觉分析与感知实验室) Pioneer Center for AI(先锋人工智能中心) Center of Excellence for Global Mobility Law(全球移动法律卓越中心) Department of Computer Science(计算机科学系)

AI总结 本文研究了大型语言模型在丹麦庇护决定文本中识别可信度评估的存在和情感的性能,引入了RAB-Cred数据集,并评估了21种模型和30种提示组合的分类效果,揭示了模型和提示选择对零样本和少样本分类的影响。

Comments Accepted at the 20th Linguistic Annotation Workshop (LAW XX), co-located with ACL 2026 (https://sigann.github.io/LAW-XX-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07770 2026-05-14 cs.DC cs.CL

ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs

ArcLight:一种为多核CPU设计的轻量级大语言模型推理架构

Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

AI总结 本文提出ArcLight,一种为多核CPU优化的LLM推理架构,通过高效内存管理和线程调度及精细控制的张量并行性,解决多核CPU上的跨节点内存访问瓶颈,实现更高的推理吞吐量。

Comments Accepted by ACL 2026 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21975 2026-05-14 cs.AI cs.ET

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

注意差距: elicitation协议如何影响语言模型中的 stated-revealed偏好差距

Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

机构 * University of Oxford(牛津大学) Max Planck Institute for Biological Cybernetics(生物信息学Max Planck研究所) University of Tuebingen(图宾根大学) Cardiff University(卡迪夫大学) Cambridge–Boston Alignment Initiative (CBAI)(剑桥-波士顿对齐倡议)

AI总结 研究探讨了elicitation协议对语言模型中stated-revealed偏好差距的影响,发现中性选项和 abstention 的引入能提高相关性,但进一步允许 abstention 又导致相关性下降。

Comments Accepted to ACL 2026 Eval Eval Workshop and 3rd Technical AI Safety Conference (TAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12720 2026-05-14 cs.CL

FLEXITOKENS: Flexible Tokenization for Evolving Language Models

FLEXITOKENS: 用于进化语言模型的灵活分词

Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

AI总结 本文提出FLEXITOKENS,通过可学习的分词器实现灵活的分词,减少文本过碎片化,提升多语言和生成任务性能。

Comments Accepted to ACL (findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13292 2026-05-14 cs.CL cs.AI cs.IR cs.LG

IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages

IndicMedDialog: 一种平行多轮医疗对话数据集,用于印地语系语言中的可及性医疗

Shubham Kumar Nigam, Suparnojit Sarkar, Piyush Patel

机构 * University of Birmingham(布里斯托尔大学) Heritage Institute of Technology(遗产理工学院) Madan Mohan Malaviya University of Technology(马丹·莫汉·马尔维亚理工学院)

AI总结 本文提出IndicMedDialog数据集,包含英语和九种印地语系语言的多轮医疗对话,通过生成合成咨询并进行翻译、验证和处理,提升多语言医疗对话系统的现实性和可访问性。

Comments Accepted in BioNLP @ ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13277 2026-05-14 cs.CL cs.AI cs.CV cs.IR cs.LG

Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation

以效用为导向的多模态证据选择用于多模态检索增强生成

Weiqing Luo, Zongye Hu, Xiao Wang, Zhiyuan Yu, Haofeng Zhang, Ziyi Huang

机构 * Arizona State University(亚利桑那州立大学) Texas A&M University(德克萨斯大学) Morgan Stanley(摩根大通)

AI总结 本文提出以信息论视角重构多模态证据选择,定义证据效用为模型输出分布的信息增益,通过引入潜在的证据有效性概念,提出无需训练的代理加速框架,实验证明在MRAG-Bench和Visual-RAG上优于现有RAG基线并降低计算成本。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19931 2026-05-14 cs.CL

CascadeMind at SemEval-2026 Task 4: A Hybrid Neuro-Symbolic Cascade for Narrative Similarity

CascadeMind 在 SemEval-2026 任务 4:一种混合神经符号级联用于叙述相似性

Sebastien Kawada, Dylan Holyoak

机构 * Kaons Epoch Learn

AI总结 CascadeMind 通过神经符号级联方法在叙述相似性任务中达到72.75%的准确率,展示了在困难实例上合理分配计算资源的重要性。

Comments 7 pages, 2 figures, 5 tables. Accepted paper for SemEval-2026 Task 4 at ACL. Code: https://github.com/chreia/CascadeMind-ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09636 2026-05-14 cs.AI cs.CV cs.HC cs.LG

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

PersonalAlign:面向个性化GUI代理的分层隐式意图对齐

Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。

Comments Accepted to ACL26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09675 2026-05-14 cs.CL

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

d-TreeRPO:迈向更可靠的扩散语言模型策略优化

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) University of Illinois at Chicago(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出d-TreeRPO框架,通过树状回滚和可验证奖励提升扩散语言模型策略优化的可靠性,理论证明预测信心提升可减少预测概率偏差,并在多个推理基准上取得显著提升。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07642 2026-05-14 cs.AI cs.CL cs.CV

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents

拆解与构建:基于技能的视觉-语言导航代理混合

Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)

AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09522 2026-05-14 cs.CV cs.AI cs.CL

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

重新审视你所见:揭示视觉语义以引导LVLM解码

Beomsik Cho, Jaehyung Kim

机构 * Yonsei University(延世大学)

AI总结 本文通过分析发现视觉token在幻觉中仍提供有效信息,提出ReVisiT方法通过参考视觉token引导LVLM解码,减少计算成本并提升性能。

Comments ACL 2026 Main Conference (Oral). 30 pages, 10 figures. Code: https://github.com/bscho333/ReVisiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03800 2026-05-14 q-bio.BM

STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure Encoding

STELLA:一种通过统一序列-结构编码进行蛋白质功能注释的多模态大语言模型

Hongwang Xiao, Wenjun Lin, Xi Chen, Hui Wang, Kai Chen, Jiashan Li, Yuancheng Sun, Sicheng Dai, Boya Wu, Qiwei Ye

AI总结 STELLA通过统一序列-结构编码与文本模态协同,提升蛋白质功能注释的准确性,实现功能描述预测和酶促反应预测的最新成果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12299 2026-05-13 cs.CL

GKnow: Measuring the Entanglement of Gender Bias and Factual Gender

GKnow: 测量性别偏见与事实性性别之间的纠缠

Leonor Veloso, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 本文提出GKnow基准,用于评估语言模型在不同性别预测类型中的性别知识和偏见,发现性别偏见与事实性性别在电路和神经元层面高度纠缠,表明神经元剪除不可靠。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12281 2026-05-13 cs.CL cs.LG

What makes a word hard to learn? Modeling L1 influence on English vocabulary difficulty

什么使一个词难以学习?建模L1对英语词汇难度的影响

Jonas Mayer Martins, Zhuojing Huang, Aaricia Herygers, Lisa Beinborn

机构 * University of Göttingen(哥廷根大学)

AI总结 本文通过梯度提升模型研究了母语对英语词汇难度的影响,发现词汇熟悉度是共同主导因素,而西班牙语和德语学习者还依赖拼写转移,而中文学习者则仅依赖熟悉度和表层特征。

Comments Submitted to BEA 2026 at ACL. 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12242 2026-05-13 cs.CL cs.AI

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

注意暂停:基于LLMs的多语言语音纠错中的不流畅意识目标调优

Deepak Kumar, Baban Gain, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳瓦)

AI总结 本文提出一种多语言语音纠错方法,通过序列标注器标记不流畅词并指导LLM指令微调,结合对比学习目标提升纠错可靠性,实验证明在印地语、孟加拉语和马拉地语上优于现有基线模型。

Comments Accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06719 2026-05-13 cs.CR cs.CL cs.LG

Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)

差分隐私合成文本生成用于检索增强生成(RAG)

Junki Mori, Kazuya Kakizaki, Taiki Miyagawa, Jun Sakuma

机构 * NEC Corporation(日本电报电话公司) Institute of Science Tokyo(东京科学研究院) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

AI总结 本文提出DP-SynRAG框架,通过生成差分隐私合成RAG数据库提升隐私保护下的RAG性能,避免重复噪声注入并保持固定隐私预算。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11753 2026-05-13 cs.AI

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11693 2026-05-13 cs.AI

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏