arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-29 至 2026-04-29 共收录 35
2508.16198 2026-04-29 cs.CL

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15707 2026-04-29 cs.CL cs.AI

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

大型语言模型在推理任务上的表现是否受提问方式的影响?

Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

AI总结 本研究探讨了不同提问方式对大型语言模型推理任务准确性的影响,发现问题类型显著影响模型表现,选项数量和用词选择也会影响最终答案选择的准确性。

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07847 2026-04-29 cs.CL cs.AI

From Ambiguity to Accuracy: The Transformative Effect of Coreference Resolution on Retrieval-Augmented Generation systems

从歧义到准确性:核心指代消解对检索增强生成系统的影响

Youngjoon Jang, Seongtae Hong, Junyoung Son, Sungjin Park, Chanjun Park, Heuiseok Lim

机构 * Korea University(韩国大学) Naver Corp(Naver公司)

AI总结 研究探讨了核心指代消解对检索增强生成系统中文档检索和生成性能的影响,发现消解能提升检索效果和问答性能,尤其对小模型有显著帮助。

Comments ACL 2025 SRW

Journal ref https://aclanthology.org/2025.acl-srw.27

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06778 2026-04-29 cs.CL cs.AI

Large Language Models Are Effective Human Annotation Assistants, But Not Good Independent Annotators

大语言模型是有效的标注助手,但不是好的独立标注者

Feng Gu, Zongxia Li, Carlos Rafael Colon, Benjamin Evans, Ishani Mondal, Jordan Lee Boyd-Graber

机构 * Department of Computer Science, University of Maryland(大学计算机科学系) National Consortium for the Study of Terrorism and Responses to Terrorism(反恐与反恐响应国家研究中心)

AI总结 本文研究了大语言模型在事件标注中的有效性,发现其在辅助专家标注时表现优于传统方法,但独立标注仍不理想。

Comments 9 pages, 4 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14427 2026-04-29 cs.CL

Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models

基于令牌密度的不确定性量化方法用于获取大语言模型的真实性

Artem Vazhentsev, Lyudmila Rvanova, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Timothy Baldwin, Artem Shelmanov

机构 * Skoltech(斯克里普切尔技术学院) AIRI(人工智能研究所) MBZUAI(马斯克商学院人工智能研究所) MIPT(莫斯科国立信息技术机械与光学学院) FRC CSC RAS(俄罗斯科学院远东分院计算机科学与控制学院) The University of Melbourne(墨尔本大学)

AI总结 本文提出一种基于令牌密度的不确定性量化方法,通过提取多层嵌入并计算Mahalanobis距离,提升文本生成和事实核查任务的不确定性评估精度与效率。

Journal ref Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏