arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-05-13 至 2026-05-13 共收录 17
2605.12398 2026-05-13 cs.CL cs.IR

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12299 2026-05-13 cs.CL

GKnow: Measuring the Entanglement of Gender Bias and Factual Gender

GKnow: 测量性别偏见与事实性性别之间的纠缠

Leonor Veloso, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 本文提出GKnow基准,用于评估语言模型在不同性别预测类型中的性别知识和偏见,发现性别偏见与事实性性别在电路和神经元层面高度纠缠,表明神经元剪除不可靠。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12281 2026-05-13 cs.CL cs.LG

What makes a word hard to learn? Modeling L1 influence on English vocabulary difficulty

什么使一个词难以学习?建模L1对英语词汇难度的影响

Jonas Mayer Martins, Zhuojing Huang, Aaricia Herygers, Lisa Beinborn

机构 * University of Göttingen(哥廷根大学)

AI总结 本文通过梯度提升模型研究了母语对英语词汇难度的影响,发现词汇熟悉度是共同主导因素,而西班牙语和德语学习者还依赖拼写转移,而中文学习者则仅依赖熟悉度和表层特征。

Comments Submitted to BEA 2026 at ACL. 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12242 2026-05-13 cs.CL cs.AI

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

注意暂停:基于LLMs的多语言语音纠错中的不流畅意识目标调优

Deepak Kumar, Baban Gain, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳瓦)

AI总结 本文提出一种多语言语音纠错方法,通过序列标注器标记不流畅词并指导LLM指令微调,结合对比学习目标提升纠错可靠性,实验证明在印地语、孟加拉语和马拉地语上优于现有基线模型。

Comments Accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06719 2026-05-13 cs.CR cs.CL cs.LG

Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)

差分隐私合成文本生成用于检索增强生成(RAG)

Junki Mori, Kazuya Kakizaki, Taiki Miyagawa, Jun Sakuma

机构 * NEC Corporation(日本电报电话公司) Institute of Science Tokyo(东京科学研究院) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

AI总结 本文提出DP-SynRAG框架,通过生成差分隐私合成RAG数据库提升隐私保护下的RAG性能,避免重复噪声注入并保持固定隐私预算。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11753 2026-05-13 cs.AI

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11693 2026-05-13 cs.AI

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11662 2026-05-13 cs.IR

HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware Alignment

HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐

Guorui Li, Dugang Liu, Lei Li, Xing Tang, Zhong Ming

AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11538 2026-05-13 cs.CL cs.AI cs.LG

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

驯服极端令牌:具有高斯核优势重加权的协方差感知GRPO

Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen

机构 * National University of Singapore(新加坡国立大学) University of California, Davis(加州大学戴维斯分校) University of Southern California(美国南加州大学)

AI总结 本文提出一种协方差感知的GRPO方法,通过高斯核动态降低极端令牌更新权重,以平衡探索与利用,提升大语言模型推理性能并稳定熵。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11330 2026-05-13 cs.AI

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights

重新思考LLM幻觉检测的评估:一种需求清单,一个新的基于RAG的基准,新的见解

Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于RAG的新型基准T RIVIA+,填补了现有基准在长上下文和噪声标签方面的空白,并通过实验揭示了当前检测器在RAG基准上的改进空间。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11242 2026-05-13 cs.CL cs.AI

RETUYT-INCO at BEA 2026 Shared Task 2: Meta-prompting in Rubric-based Scoring for German

在BEA 2026共享任务2中:基于评分规则的德语短答案评分的元提示

Ignacio Sastre, Ignacio Remersaro, Facundo Díaz, Nicolás De Horta, Luis Chiruzzo, Aiala Rosá, Santiago Góngora

机构 * Instituto de Computación, Facultad de Ingeniería, Universidad de la República(计算研究所,工程学院,乌拉圭共和国大学)

AI总结 本文介绍了RETUYT-INCO在BEA 2026共享任务2中的参与,提出元提示方法用于德语短答案评分,结合经典机器学习、微调开源大模型等方法,取得前三项任务的优异成绩。

Comments To be presented at the BEA 2026 workshop, co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09043 2026-05-13 cs.CL cs.AI

Phase Transitions in Affective Meaning Divergence: The Hidden Drift Before the Break

情感意义分歧中的相变:崩溃前的隐性漂移

Napassorn Litchiowong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 研究探讨了情感意义分歧(AMD)如何导致对话修复协调的突然崩溃,通过分析多个层面的分歧变异性,揭示了AMD在理论框架中的独特时间特征。

Comments Accepted to the ACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19207 2026-05-13 cs.CV

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

长话短说:在对比视觉语言模型中解构组合性与长描述理解

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) MBZUAI(马克斯·普朗克人工智能研究所)

AI总结 本文研究对比视觉语言模型中组合推理与长描述理解之间的关系,通过实验发现两者存在双向但敏感的关联,高质量数据和合理架构设计有助于提升模型泛化能力。

Comments To be published in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05615 2026-05-13 cs.CL

Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives

视频-语言理解:从模型架构、模型训练和数据视角的综述

Thong Nguyen, Yi Bin, Junbin Xiao, Leigang Qu, Yicong Li, Jay Zhangjie Wu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文综述了视频-语言理解系统的关键任务与挑战,从模型架构、训练和数据角度总结方法,并比较性能,探讨未来研究方向。

Comments Accepted at ACL 2024 (Findings). Code is available at https://github.com/nguyentthong/video-language-understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12678 2026-05-13 cs.CL

Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction

基于列表式上下文模型的梯度提升决策树在多模态评论有用性预测中的应用

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Anh Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) DAMO Academy(达摩院)

AI总结 本文提出列表式注意力网络和梯度提升决策树,用于多模态评论有用性预测,以提升模型泛化能力与排名准确性。

Comments Published in ACL 2023 (Findings). Code is available at https://github.com/nguyentthong/gbdt_listwise_mrhp

详情

展开后加载摘要…

URL PDF HTML 收藏