arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2605.19075 2026-05-20 cs.CV cs.AI

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

CRAFT: 基于批评的自适应关键帧目标定位用于多模态视频问答

Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

机构 * University at Buffalo(布法罗大学) New York University(纽约大学)

AI总结 该研究提出CRAFT方法,通过动态关键帧选择、每视频ASR与多语言回退以及混合批评循环,迭代验证和修复声明,最终实现多模态视频问答的准确证据聚合。

Comments Accepted at ACL 2026 Multimodal Augmented Generation via MultimodAl Retrieval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15518 2026-05-20 cs.CL

DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection

DetectRL-X: 向可靠多语言和真实世界LLM生成文本检测迈进

Junchao Wu, Yefeng Liu, Chenyu Zhu, Hao Zhang, Zeyu Wu, Tianqi Shi, Yichao Du, Longyue Wang, Weihua Luo, Jinsong Su, Derek F. Wong

机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院NLP2 CT实验室) Alibaba Group(阿里巴巴集团) Xiamen University(厦门大学)

AI总结 本文提出DetectRL-X,一个综合性的多语言基准,用于评估先进检测器在8个维度上的性能,通过8种常见商业语言和6种易受LLM滥用的领域人类文本,结合4种流行商业LLM生成文本及润色、扩展和缩写等AI辅助写作操作,分析不同语言、领域、生成器、攻击策略、文本长度和润色操作对检测器性能的影响,以强化多语言和语言特定检测器。

Comments ACL 2026 Main. Code and data are available at https://github.com/AIDC-AI/Marco-LLM/tree/main/DetectRL-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16593 2026-05-20 cs.CL

Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models

重新审视一个令人头疼的问题:一种用于语言模型的语义推理基准

Yang Liu, Hongming Li, Melissa Xiaohui Qin, Qiankun Liu, Chao Huang

机构 * University of Science and Technology Beijing(北京科技大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 本文提出SemanticQA基准,用于评估语言模型在语义短语处理任务中的表现,通过整合现有多词表达资源并重新组织为统一测试平台,涵盖通用词汇现象及三种细粒度类别,评估不同架构和规模的语言模型在提取、分类、解释及任务组合中的性能,揭示语义推理任务中模型性能的显著差异,为提升语言模型在非平凡语义短语上的理解能力提供见解。

Comments ACL 2026 (Oral), 24 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11796 2026-05-20 cs.CL cs.AI

C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection Derived from Real-World Prompts

C-ReD:一个源自真实世界提示的综合性中文AI生成文本检测基准

Chenxi Qing, Junxi Wu, Zheng Liu, Yixiang Qiu, Hongyao Yu, Bin Chen, Hao Wu, Shu-Tao Xia

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Shannon InfoTech

AI总结 本文提出C-ReD基准,用于检测AI生成的中文文本,通过解决模型多样性、领域覆盖和提示真实性等关键问题,提升检测性能和泛化能力。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01009 2026-05-20 cs.CL

Qayyem: A Real-time Platform for Scoring Proficiency of Arabic Essays

Qayyem: 一个实时平台用于评分阿拉伯语作文的熟练程度

Hoor Elbahnasawi, Marwan Sayed, Sohaila Eltanbouly, Fatima Brahamia, Tamer Elsayed

机构 * Computer Science and Engineering Department, Qatar University(卡塔尔大学计算机科学与工程系)

AI总结 本文提出Qayyem平台,提供阿拉伯语作文评分的集成工作流程,通过友好的界面简化评分服务器API的交互,部署了多种先进的阿拉伯语作文评分模型。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01526 2026-05-20 cs.CL

Difficulty-Controllable Cloze Question Distractor Generation

可调节难度的填空题干扰项生成

Seokhoon Kang, Yejin Jeon, Seonjeong Hwang, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国立科学技术院人工智能研究生院) Department of Computer Science and Engineering, POSTECH, South Korea(韩国立科学技术院计算机科学与工程系) Mila Quebec AI Institute, Canada(魁北克AI研究院) McGill University, Canada(麦吉尔大学)

AI总结 本文提出了一种可调节难度的填空题干扰项生成框架,通过数据增强和多任务学习策略,生成高质量且标注难度的干扰项,优于GPT-4o在匹配干扰项难度与人类感知方面。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25064 2026-05-20 cs.CL

Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?

LLMs能否估算阅读理解题的认知复杂性?

Seonjeong Hwang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(韩国立科学技术院人工智能研究生院) Department of Computer Science and Engineering, POSTECH, Republic of Korea(韩国立科学技术院计算机科学与工程系)

AI总结 本文研究了大型语言模型是否能通过证据范围和转换级别两个维度估算阅读理解题的认知复杂性,结果显示LLMs能够近似估算认知复杂性,但存在推理能力与元认知意识之间的差距。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08986 2026-05-20 cs.CL cs.CE cs.CY

CAPC-CG: A Large-Scale, Expert-Directed LLM-Annotated Corpus of Adaptive Policy Communication in China

CAPC-CG:一个大规模、专家指导的中国适应性政策沟通LLM注释语料库

Bolun Sun, Charles Chang, Yuen Yuen Ang, Ruotong Mu, Yuchen Xu, Zhengxin Zhang, Pingxu Hao

机构 * Johns Hopkins University(约翰霍普金斯大学) Northwestern University(西北大学) Duke Kunshan University(杜克-昆山大学)

AI总结 本文介绍了CAPC-CG语料库,该语料库是首个开放的中国政策指令注释语料库,基于Ang的适应性政策沟通理论,采用五色分类法对清晰和模糊语言类别进行标注,旨在支持下游任务和多语言NLP研究。

Comments Accepted for publication in the Proceedings of ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08480 2026-05-20 cs.IR

Improving Korean-English Cross-Lingual Retrieval: A Data-Centric Study of Language Composition and Model Merging

改进韩英跨语言检索:语言组成与模型融合的数据导向研究

Youngjoon Jang, Junyoung Son, Taemin Lee, Seongtae Hong, Hyeonseok Moon, Seungyoon Lee, Andrew Matteson, Heuiseok Lim

AI总结 本研究通过构建语言平行的韩英数据集,探讨了训练数据组成对跨语言检索和单语言检索性能的影响,发现语言组合显著影响检索性能,并通过模型融合策略有效缓解了两者之间的权衡问题。

Comments ACL 2026 MeLLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18769 2026-05-20 cs.IR cs.AI cs.CL

ClusterRAG: Cluster-Based Collaborative Filtering for Personalized Retrieval-Augmented Generation

ClusterRAG: 基于聚类的协同过滤用于个性化检索增强生成

Gibson Nkhata, Uttamasha Anjally Oyshi, Quan Mai, Susan Gauch

机构 * University of Arkansas(阿肯色大学) Walmart Inc.(沃尔玛公司)

AI总结 ClusterRAG通过聚类用户轮廓文档,利用相似用户的协同信号提升当前用户的个性化生成性能,通过在集群和文档层面进行检索,实现了高效的个性化检索增强生成。

Comments 17 pages, 2 figures, to be published in the proceedings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18766 2026-05-20 cs.IR cs.AI cs.CL

Retrieve Only Relevant Tables Whether Few or Many: Adaptive Table Retrieval Method

仅检索相关表格,无论多少:自适应表格检索方法

Taehee Kim, Seungbin Yang, Jihwan Kim, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 本文提出了一种自适应表格检索方法,根据查询需求调整检索表格数量,通过自适应阈值机制和滑动窗口重排序算法,有效解决传统top-k检索策略的局限性,提升检索和下游任务性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18660 2026-05-19 cs.HC

Evaluating Multi-turn Human-AI Interaction

评估多轮人机交互

Shi Ding, Sijian Tan

AI总结 本文探讨了当前NLP评估方法的局限性,提出TCR框架用于评估人机交互,强调透明性、一致性和细化等维度,通过结构化评估提示和示例展示如何补充聚合指标和LLM作为评判者的方法。

Comments ACL 2026 EvalEval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18572 2026-05-19 cs.CL

MA$^{2}$P: A Meta-Cognitive Autonomous Intelligent Agents Framework for Complex Persuasion

MA$^{2}$P: 一种用于复杂说服的元认知自主智能体框架

Dingyi Zhang, Ziqing Zhuang, Linhai Zhang, Ziyang Gao, Deyu Zhou

机构 * School of Computer Science and Engineering, Key Laboratory of Computer Network and Information Integration, Ministry of Education, Southeast University, China(计算机科学与工程学院、计算机网络与信息集成重点实验室、教育部、东南大学,中国) Department of Informatics, King’s College London(信息学院、伦敦国王学院)

AI总结 本文提出MA$^{2}$P框架,通过自主多智能体架构和元认知配置器,解决复杂说服中说服者需解读内部状态、推断潜在心理状态并生成策略一致行动的挑战,提升说服成功率。

Comments 22 pages, 8 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18352 2026-05-19 cs.CL

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

条件句中的预设与推理:人类与LLM的理论研究

Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

机构 * Department of Cognitive Science, Carleton University(卡尔顿大学认知科学系) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Mila – Quebec AI Institute(魁北克人工智能研究所)

AI总结 本文通过对比人类判断和LLM预测,研究条件句中预设投影的机制,发现人类结合概率和语用线索进行判断,而LLM存在不一致的对齐模式,表明LLM的表现可能源于表面模式匹配而非语用能力。

Comments To appear in the Proceedings of CoNLL 2026, colocated with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18257 2026-05-19 cs.CV cs.AI cs.CL

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

CodeBind: 一种用于多模态对齐的解耦表示学习框架

Zeyu Chen, Jie Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(视觉人工智能实验室,香港大学)

AI总结 CodeBind通过统一的组合代码本设计优化多模态表示空间,解决了传统方法在跨模态信息差异和数据稀缺导致的对齐空间不足问题,实现了多模态分类和检索任务中的最佳性能。

Comments ACL 2026 Findings; Project page: https://visual-ai.github.io/codebind

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09413 2026-05-19 cs.SD cs.AI cs.CL cs.MA eess.AS

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

Speech-Hands: 一种基于自我反思的语音代理方法用于语音识别和多感知音频推理

Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Yu-Chiang Frank Wang, Boris Ginsburg

机构 * NVIDIA Kyoto University(京都大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Speech-Hands框架,通过自我反思决策机制解决语音识别和外部声音理解任务中的信任问题,提升了模型在多任务音频推理中的准确性和鲁棒性。

Comments Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03851 2026-05-19 cs.CL

Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search

重新思考表格修剪在表格问答中的应用:从顺序修订到黄金轨迹监督的并行搜索

Yu Guo, Shenghao Ye, Shuangwu Chen, Zijian Wen, Tao Zhang, Qirui Bai, Dong Jin, Yunpeng Hou, Huasen He, Jian Yang, Xiaobin Tan

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 本文提出TabTrim框架,通过将表格修剪从顺序修订转变为由黄金轨迹监督的并行搜索,解决了现有方法中无法检测关键答案数据丢失的问题,并在多个表格推理任务中实现了最先进的性能。

Comments 17 pages, 5 figures, accepted to ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17680 2026-05-19 cs.CL

When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables

当表格问答遇见噪声:为复杂问题和大规模表格设计的双去噪框架

Shenghao Ye, Yu Guo, Dong Jin, Yikai Shen, Yunpeng Hou, Shuangwu Chen, Jian Yang, Xiaofeng Jiang

机构 * University of Science and Technology of China(中国科学技术大学) The University of Melbourne(墨尔本大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 本文提出EnoTab双去噪框架,通过改进相关性过滤和表格修剪能力,解决复杂问题和大规模表格中的噪声问题,提升表格问答性能。

Comments 24 pages, 24 figures, accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18032 2026-05-19 cs.CL cs.AI cs.HC cs.SE

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA:多智能体大语言模型工作流的离线评估与迭代优化

Kazuki Kawamura, Satoshi Waki, Kei Tateno

机构 * Sony Group Corporation(索尼集团公司)

AI总结 本文提出PROTEA,一种用于多智能体大语言模型工作流的离线评估和迭代优化接口,通过配置评分标准和可视化工作流图中的节点状态,帮助开发者定位瓶颈并改进工作流性能。

Comments 9 pages, 3 figures, 1 table. To appear in Proceedings of ACL 2026 System Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18007 2026-05-19 cs.CL

Semantic Reranking at Inference Time for Hard Examples in Rhetorical Role Labeling

推理时对修辞角色标注中困难示例的语义重排序

Anas Belfathi, Nicolas Hernandez, Laura Monceaux, Warren Bonnard, Richard Dufour

机构 * Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院,国家科学研究中心,LS2N,UMR 6004) University of Lorraine(洛林大学)

AI总结 本文提出RISE框架,在推理时利用标签语义对修辞角色标注中的困难示例进行重排序,提升模型预测的准确性和鲁棒性。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17900 2026-05-19 cs.AI

DuIVRS-2: An LLM-based Interactive Voice Response System for Large-scale POI Attribute Acquisition

DuIVRS-2: 基于大语言模型的大型兴趣点属性采集交互语音响应系统

Le Zhang, Shengming Zhang, Rui Zha, Yunpeng Wu, Jingbo Zhou, Jizhou Huang

机构 * Baidu Inc.(百度公司)

AI总结 本文提出DuIVRS-2,一种基于大语言模型的端到端框架,用于大规模兴趣点属性采集,通过有限状态机引导的数据增强策略、选择生成方案与思维链机制,提高了输出稳定性并有效消除幻觉,最终在生产环境中实现了83.9%的任务成功率。

Comments Accepted to ACL 2026 Industry Track. 14 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17714 2026-05-19 cs.CL

From Documents to Segments: A Contextual Reformulation for Topic Assignment

从文档到段落:一种用于主题分配的上下文重述

Hoonsang Yoon, Takyoung Kim, Wonkee Lee, Ilmin Cho, Dilek Hakkani-Tür, Stanley Jungkyu Choi

机构 * LG AI Research(LG AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出了一种基于段落的主题分配方法(SBTA),通过将主题分配到短小且连贯的文本段落而非整个文档,以解决传统主题模型中文档多主题问题导致的主题污染问题,从而提升主题分析的清晰度和可解释性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17640 2026-05-19 cs.IR cs.CV

MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

MARQUIS:视频检索增强生成的三阶段流水线

Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

AI总结 本文提出MARQUIS三阶段流水线,通过查询扩展、融合和重排序、校准的结构化证据提取以及从提取证据生成文章,解决了视频检索增强生成中检索和生成的不足,提升了检索性能和文章生成质量。

Comments Accepted as an oral presentation at the ACL 2026 Workshop MAGMaR Systems. 27 pages, 4 figures. Code can be found here: https://github.com/debashishc/marquis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17379 2026-05-19 cs.CL cs.AI

Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization

通过更好的令牌学习:用于专业文本摘要的参数高效词汇适应

Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly

机构 * Dept. of Computer Science and Engg., IIT Kharagpur(印度Kharagpur理工学院计算机科学与工程系) Dept. of Medicine (Biomedical Informatics), Stanford University(斯坦福大学医学院(生物医学信息学))

AI总结 本文提出了一种参数高效的领域适应方法,通过结合词汇适应和预训练,提升大型语言模型在专业领域文本摘要任务中的性能,同时减少训练时间和参数数量。

Comments 16 pages. Accepted in the 64th Annual Meeting of the Association for Computational Linguistics [ACL (Main) 2026] as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23267 2026-05-19 cs.CL cs.LG

Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective

在大型语言模型中微调与上下文学习:从形式语言学习的角度

Bishwamittra Ghosh, Soumi Das, Till Speicher, Qinyuan Wu, Mohammad Aflah Khan, Deepak Garg, Krishna P. Gummadi, Evimaria Terzi

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Boston University(波士顿大学)

AI总结 本文从形式语言学习的角度比较了大型语言模型中的微调与上下文学习,通过设计精确的语言边界、受控字符串采样和无数据污染的任务,发现微调在分布内泛化上优于上下文学习,而两者在分布外泛化上表现相当,且两者在不同熟练度水平上的归纳偏置也有所不同。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22282 2026-05-19 cs.CL

STEM: Structure-Tracing Evidence Mining for Knowledge Graphs-Driven Retrieval-Augmented Generation

STEM: 用于知识图谱驱动检索增强生成的结构追踪证据挖掘

Peng Yu, En Xu, Bin Chen, Haibiao Chen, Yinfei Xu

机构 * AI Product Center, Kingsoft Corporation(金山办公人工智能产品中心)

AI总结 本文提出STEM框架,通过将多跳推理重新定义为以模式引导的图搜索任务,解决知识图谱结构异质性和现有推理路径检索方法缺乏全局结构视角的问题,从而提升多跳推理的准确性和证据完整性。

Comments 34 pages, 16 figures, accepted to ACL 2026 (Main Conference, Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04932 2026-05-19 cs.CL

Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection

超越最终作者:为细粒度LLM生成文本检测建模创作者与编辑的双重角色

Yang Li, Qiang Sheng, Zhengjia Wang, Yehan Yang, Danding Wang, Juan Cao

机构 * ict.ac.cn(中国科学院)

AI总结 本文提出RACE方法,通过建模创作者和编辑的双重角色,实现细粒度LLM生成文本检测,以更精确地区分不同类型的文本,从而为LLM监管提供政策对齐的解决方案。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03425 2026-05-19 cs.LG cs.AI

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models

领域专精的幻觉:揭示混合专家模型中的领域不变‘ standing committee ’

Yan Wang, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu

机构 * The Fin AI(Fin AI) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) Stevens Institute of Technology(史蒂文斯理工学院) The University of Manchester(曼彻斯特大学)

AI总结 本研究质疑混合专家模型通过稀疏路由实现领域专精的假设,提出COMMITTEEAUDIT框架分析专家组而非个体专家的路由行为,发现领域不变的standing committee,揭示模型存在向集中计算偏倚的结构倾向,表明混合专家模型中的专精程度远低于预期。

Comments Accepted by ACL 2026 main conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19134 2026-05-19 cs.CL cs.IR

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

QuCo-RAG:从预训练语料库中量化不确定性以实现动态检索增强生成

Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) New York University(纽约大学) Monash University(莫纳什大学)

AI总结 本研究提出QuCo-RAG,通过从预训练语料库中提取客观统计信息来量化不确定性,以解决动态检索增强生成中大语言模型的幻觉问题,实验表明其在多跳问答基准测试中优于现有方法,并在多个模型上实现了显著的提升。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏