arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2605.11662 2026-05-13 cs.IR

HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware Alignment

HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐

Guorui Li, Dugang Liu, Lei Li, Xing Tang, Zhong Ming

AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11538 2026-05-13 cs.CL cs.AI cs.LG

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

驯服极端令牌:具有高斯核优势重加权的协方差感知GRPO

Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen

机构 * National University of Singapore(新加坡国立大学) University of California, Davis(加州大学戴维斯分校) University of Southern California(美国南加州大学)

AI总结 本文提出一种协方差感知的GRPO方法,通过高斯核动态降低极端令牌更新权重,以平衡探索与利用,提升大语言模型推理性能并稳定熵。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11330 2026-05-13 cs.AI

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights

重新思考LLM幻觉检测的评估:一种需求清单,一个新的基于RAG的基准,新的见解

Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于RAG的新型基准T RIVIA+,填补了现有基准在长上下文和噪声标签方面的空白,并通过实验揭示了当前检测器在RAG基准上的改进空间。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11242 2026-05-13 cs.CL cs.AI

RETUYT-INCO at BEA 2026 Shared Task 2: Meta-prompting in Rubric-based Scoring for German

在BEA 2026共享任务2中:基于评分规则的德语短答案评分的元提示

Ignacio Sastre, Ignacio Remersaro, Facundo Díaz, Nicolás De Horta, Luis Chiruzzo, Aiala Rosá, Santiago Góngora

机构 * Instituto de Computación, Facultad de Ingeniería, Universidad de la República(计算研究所,工程学院,乌拉圭共和国大学)

AI总结 本文介绍了RETUYT-INCO在BEA 2026共享任务2中的参与,提出元提示方法用于德语短答案评分,结合经典机器学习、微调开源大模型等方法,取得前三项任务的优异成绩。

Comments To be presented at the BEA 2026 workshop, co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09043 2026-05-13 cs.CL cs.AI

Phase Transitions in Affective Meaning Divergence: The Hidden Drift Before the Break

情感意义分歧中的相变:崩溃前的隐性漂移

Napassorn Litchiowong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 研究探讨了情感意义分歧(AMD)如何导致对话修复协调的突然崩溃,通过分析多个层面的分歧变异性,揭示了AMD在理论框架中的独特时间特征。

Comments Accepted to the ACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19207 2026-05-13 cs.CV

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

长话短说:在对比视觉语言模型中解构组合性与长描述理解

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) MBZUAI(马克斯·普朗克人工智能研究所)

AI总结 本文研究对比视觉语言模型中组合推理与长描述理解之间的关系,通过实验发现两者存在双向但敏感的关联,高质量数据和合理架构设计有助于提升模型泛化能力。

Comments To be published in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05615 2026-05-13 cs.CL

Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives

视频-语言理解:从模型架构、模型训练和数据视角的综述

Thong Nguyen, Yi Bin, Junbin Xiao, Leigang Qu, Yicong Li, Jay Zhangjie Wu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文综述了视频-语言理解系统的关键任务与挑战,从模型架构、训练和数据角度总结方法,并比较性能,探讨未来研究方向。

Comments Accepted at ACL 2024 (Findings). Code is available at https://github.com/nguyentthong/video-language-understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12678 2026-05-13 cs.CL

Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction

基于列表式上下文模型的梯度提升决策树在多模态评论有用性预测中的应用

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Anh Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) DAMO Academy(达摩院)

AI总结 本文提出列表式注意力网络和梯度提升决策树,用于多模态评论有用性预测,以提升模型泛化能力与排名准确性。

Comments Published in ACL 2023 (Findings). Code is available at https://github.com/nguyentthong/gbdt_listwise_mrhp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10855 2026-05-12 cs.CL

Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding

从少量数据中学习更多:利用反事实以提高图表理解的数据效率

Jianzhu Bao, Haozhen Zhang, Kuicai Dong, Bozhi Wu, Sarthak Ketanbhai Modi, Zi Pong Lim, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Aumovio Singapore Pte. Ltd.(Aumovio新加坡私人有限公司)

AI总结 本文提出ChartCF框架,通过反事实数据合成和多模态偏好优化,提升图表理解的反事实敏感性,实验表明其在少数据下表现优异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10845 2026-05-12 cs.CV cs.CL

BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation

BabelDOC: 通过中间表示实现更好的布局保持PDF翻译

Qi Yang, Xiangyao Ma, Xiao Wang, Hao Wang, Rui Wang

机构 * School of Computer Engineering and Science, Shanghai University, Shanghai, China(1 上海大学计算机工程与科学学院,上海,中国) Funstory.ai Limited, Hong Kong SAR, China(2 Funstory.ai有限公司,香港特别行政区,中国) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(3 上海交通大学计算机科学与工程系,上海,中国)

AI总结 BabelDOC通过中间表示框架实现布局保持的PDF翻译,解决语言处理与布局保持的矛盾,提升翻译精度和文档一致性。

Comments ACL 2026 System Demonstration paper. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10714 2026-05-12 cs.CL cs.AI

Why Low-Resource NLP Needs More Than Cross-Lingual Transfer: Lessons Learned from Luxembourgish

为何低资源NLP需要比跨语言迁移更多:从卢森堡语学到的教训

Fred Philippy, Siwen Guo, Jacques Klein, Tegawendé F. Bissyandé

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院) Luxembourg Institute of Science and Technology(卢森堡科学技术研究院)

AI总结 本文探讨了低资源语言处理中跨语言迁移与语言特定努力的互补性,指出两者需结合以构建可持续的NLP流程。

Comments Accepted at BigPicture Workshop 2026 (co-located with ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10627 2026-05-12 cs.CL cs.AI

Interpretable Coreference Resolution Evaluation Using Explicit Semantics

基于显式语义的可解释指代消解评估

Bruno Gatti, Giuliano Martinelli, Roberto Navigli

机构 * Sapienza NLP Group(萨皮恩扎自然语言处理组) Sapienza University of Rome(罗马萨皮恩扎大学)

AI总结 本文提出一种语义增强的指代消解评估框架,通过叠加概念和命名实体识别,揭示指代消解中不同语义类别的系统性缺陷,并设计针对性的数据增强策略以提升模型性能。

Comments Accepted at main conference for ACL 2026. 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10622 2026-05-12 cs.MM cs.CV

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination

LVLMs中的词汇劫持:通过排除惰性标记来揭示关键注意力头以缓解幻觉

Yangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文通过分析LVLMs的注意力机制,揭示了词汇劫持现象,提出HABI方法定位惰性标记,并引入NHAR指标评估其影响,最终提出HAVAE方法增强关键注意力头以减少幻觉。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10253 2026-05-12 cs.CR cs.AI

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

针对医疗多模态检索增强生成的知识污染攻击

Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10171 2026-05-12 cs.CL cs.AI

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

当评论存在分歧时:科学同行评审中的细粒度矛盾分析

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(比哈尔邦布尔萨大学计算机工程学院)

AI总结 本文提出细粒度的同行评审矛盾分析方法,通过识别矛盾证据跨度并分配矛盾强度评分,改进了现有二元矛盾检测方法,引入RevCI基准和IMPACT框架,并通过TIDE模型实现高效部署。

Comments accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07575 2026-05-12 cs.CV cs.AI

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

响应-G1:面向前瞻性流视频理解的显式场景图建模

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu

机构 * Northwestern Polytechnical University(北华大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Engineering University(哈尔滨工程大学)

AI总结 响应-G1通过显式场景图建模提升前瞻性流视频理解,通过三阶段流程实现视频证据与查询条件的结构化对齐,提高响应时机的可解释性和准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28902 2026-05-12 cs.AI

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

ChartDiff:一种大规模的图表对理解基准

Rongtian Ye

机构 * Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

AI总结 本文提出ChartDiff,首个大规模多图表对比总结基准,通过8541对图表数据评估不同模型,揭示通用模型与专用模型在对比总结中的性能差异。

Comments 21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03042 2026-05-12 cs.CL

BaseCal: Unsupervised Confidence Calibration via Base Model Signals

BaseCal: 通过基础模型信号实现无监督的置信度校准

Hexiang Tan, Wanli Yang, Junwei Zhang, Xin Chen, Rui Tang, Du Su, Jingang Wang, Yuanzhuo Wang, Fei Sun, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

AI总结 本文提出BaseCal方法,利用基础模型信号校准大语言模型的置信度,通过两种方法减少校准误差,实验表明其在多个数据集上有效降低了ECE。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19995 2026-05-12 cs.CL cs.AI cs.LG

Schoenfeld's Anatomy of Mathematical Reasoning by Language Models

语言模型的数学推理解剖:Schoenfeld的推理结构

Ming Li, Chenrui Fan, Yize Cheng, Soheil Feizi, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文通过Schoenfeld的事件理论,提出ThinkARM框架,解剖语言模型的推理过程,揭示推理与非推理模型在结构上的差异,并通过案例研究展示探索步骤与正确性及效率方法的影响。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24859 2026-05-12 cs.LG cs.CL

Beyond Multiple Choice: Evaluating Steering Vectors for Summarization

超越多项选择:评估摘要中的引导向量

Joschka Braun, Carsten Eickhoff, Seyed Ali Bahrainian

机构 * University of Tübingen(图宾根大学)

AI总结 本文评估引导向量在摘要生成中对主题焦点、情感、毒性及可读性的控制效果,发现高引导强度会导致重复和事实性幻觉,混合方法在中等强度下表现最佳。

Comments Published in Findings of EACL 2026. Extended version of the ICML 2025 Workshop on Reliable and Responsible Foundation Models paper (v1, v2). 36 pages, 21 figures, 15 tables

Journal ref Findings of the Association for Computational Linguistics: EACL 2026, pages 3849-3884

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10766 2026-05-12 cs.LG cs.AI cs.CL

How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients

指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量

Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Allen Institute for AI(Allen人工智能研究所)

AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10043 2026-05-12 cs.CL cs.AI

Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework

通过二元反馈个性化大语言模型:一种偏好校正的优化框架

Xilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学)

AI总结 本文提出C-BPO框架,通过偏好校正的二元信号实现LLM个性化,解决用户间差异问题,实验表明其在多种任务中优于基线方法。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09922 2026-05-12 cs.CL cs.AI

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

基于双自适应加权的团队自博弈:用于微调大语言模型

Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)

AI总结 本文提出TPAW算法,通过团队协作与竞争机制提升自监督下LLM对齐效果,采用双自适应加权机制提高优化效率,实验证明其在多种模型和基准测试中表现优异。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09920 2026-05-12 cs.LG cs.AI

Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

通过内在梯度-范数奖励实现无需验证器的LLM强化学习

Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出VIGOR,一种无需外部验证器的强化学习奖励机制,通过内在偏好信号提升政策优化效果,在数学推理和代码基准测试中表现优于现有方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09739 2026-05-12 cs.CL cs.AI

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

沉默投票:通过聚合语义邻域提高零样本LLM可靠性

Sanket Badhe, Priyanka Tiwari, Deep Shah

机构 * Google(谷歌)

AI总结 本文提出Semantic Softmax方法,通过聚合目标标签的语义邻域得分,解决零样本分类中的Renormalization Bias问题,提升模型校准性和准确性。

Comments Accepted at GEM Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09497 2026-05-12 cs.AI cs.CR

Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces

别点那个:教网络代理抵抗欺骗界面

Yilin Zhang, Yingkai Hua, Chunyu Wei, Xin Wang, Yueguo Chen

机构 * Renmin University of China(中国人民大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

AI总结 本文提出DUDE框架,通过混合奖励学习和不对称惩罚,结合经验总结,提升网络代理对欺骗界面的抵抗力,实验显示欺骗敏感度降低53.8%。

Comments Accepted to ACL 2026 Main Conference. 23 pages, 8 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09414 2026-05-12 cs.CL

Cross-Cultural Transfer of Emoji Semantics and Sentiment in Financial Social Media

跨文化情感与语义在金融社交媒体中的迁移

Ahmed Mahrous, Roberto Di Pietro

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院)

AI总结 研究探讨了emoji在不同金融社区中的语义和情感稳定性,发现emoji能提供跨语言的通用情感线索,提升模型泛化能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26961 2026-05-12 cs.SE cs.AI cs.PL

Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding

基于语言模型的数据流感知静态程序切片

Pengfei He, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman

机构 * Department of Computer Science, University of Manitoba(曼尼托巴大学计算机科学系) School of Engineering and Computer Science, Concordia University(Concordia大学工程与计算机科学学院) School of Computer Science, University of Windsor(温莎大学计算机科学学院)

AI总结 本文提出Sliceformer,通过数据流感知预训练和约束解码改进静态程序切片,提升依赖建模精度和减少生成幻觉,实验显示在Java和Python基准上精确匹配提升22%。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏