arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

共收录 9218
2609.10765 2026-09-11 eess.AS 新提交

From Metrics to Natural Dialogue: French Full-Duplex Benchmark for Spoken Dialogue Models

从指标到自然对话:口语对话模型的法语全双工基准

Hamid Soltani, Gilles Boulianne

AI总结 本文提出法语全双工基准(FDB),含加拿大和欧洲法语变体,评估暂停处理、话轮转换等技能,发现时间指标跨语言稳定,内容指标受语言影响,且指标优化与自然度存在权衡。

Comments 9 pages, 0 figures. Accepted for publication in Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP): Industry Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11899 2026-09-11 cs.CV cs.HC 新提交

Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding

一次标注,按需取帧:面向预算受限的智能体长视频理解的视觉需求路由

Weitong Cai, Hang Zhang, Yukai Huang, Yiqiao Xie, Shan Gao, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang

机构 * Queen Mary University of London(伦敦玛丽女王大学) Durham University(杜伦大学) Imperial College London(帝国理工学院) Huawei(华为)

AI总结 针对边缘设备长视频理解,提出CFD框架,利用视觉-文本二元性,通过离线标注索引和按查询的视觉需求路由,仅对感知问题取帧,在降低计算成本的同时保持高精度。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11768 2026-09-11 cs.AI cs.CL cs.LG 新提交

A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias Coefficients

一种统一的逐Token门控家族用于在线策略蒸馏:FKL/RKL混合与多通道及偏置系数

Suwan Wu, Yumeng Lin, Pengcheng Yuan, Xiaolong Jiang

机构 * Xiaohongshu Inc.(小红书公司) Tianjin University(天津大学)

AI总结 提出统一四系数逐Token门控参数化,统一EOPD与ToDi,在TweetEval上优于单通道限制,作为OPD门控比较的共享坐标系。

Comments Accepted at the Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026 Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11758 2026-09-11 cs.CL cs.IR 新提交

RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety

RAG-Safety-Bench:检索增强大语言模型安全性的可靠评估

Adithiyan Rajan Indira Saravanan, Kathleen C. Fraser

机构 * University of Ottawa(渥太华大学)

AI总结 提出RAG-Safety-Bench基准,通过四种条件隔离检索质量影响,评估RAG对LLM安全性的影响,发现良性能力与不安全能力呈反比,基线安全护栏无法保证RAG下游安全。

Comments Proceedings of EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11752 2026-09-11 cs.AI cs.CL cs.LG 新提交

SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control

SIRF:一种面向工业内容风险控制的规范内化风险基础模型

Suwan Wu, Yumeng Lin, Pengcheng Yuan, Xiaolong Jiang

机构 * Xiaohongshu Inc.(小红书公司) Tianjin University(天津大学)

AI总结 SIRF通过继续预训练将平台策略内化到模型权重中,在秒级延迟下实现高精度自动风险控制,显著提升召回率并降低误罚。

Comments 14 pages, 12 figures. Accepted at the Industry Track of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11532 2026-09-11 cs.AI 新提交

Prompt Revision as a Source of Cultural Bias in Text-to-Image Systems

提示词修订作为文生图系统中的文化偏见来源

Aleksandra Urman, Elsa Lichtenegger, Salima Jaoua, Azza Bouleimen, Robin Forsberg, Corinna Hertweck, Stefania Ionescu, Nicolò Pagan, Ancsa Hannak, Joachim Baumann

机构 * University of Zurich(苏黎世大学) University of Helsinki(赫尔辛基大学) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

AI总结 本研究提出WORLDVIEW基准,通过审计提示词修订层,发现该层是文生图系统中文化偏见的因果来源,导致非西方语境被刻板化。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11505 2026-09-11 cs.CL cs.AI cs.LG 新提交

Structural priors for data-efficient language learning

数据高效语言学习的结构先验

Yana Veitsman, Jonas Mayer Martins, Jonathan Lautenschlager, Lisa Beinborn

机构 * University of Göttingen(哥廷根大学)

AI总结 本文研究通过非语言数据(如音乐、概率文法、元胞自动机)进行结构迁移作为语言建模的权重初始化,发现其可降低损失但下游表现不稳定,仅部分替代语言数据。

Comments EMNLP 2026, BabyLM Challenge; 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11460 2026-09-11 cs.CL cs.IR 新提交

ReGround: Grounding Reviewer Comments in Multimodal Evidence

ReGround:将审稿人评论锚定到多模态证据

Serwar Basch, Lizhen Qu, Iryna Gurevych

机构 * TU Darmstadt(达姆施塔特工业大学) Monash University(莫纳什大学)

AI总结 针对多模态长文档中审稿人评论难以锚定到证据的问题,提出ReGround数据集,将锚定视为检索任务,发现全文检索效果差、证据类型推断是瓶颈,多模态证据提供互补信号。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11315 2026-09-11 cs.AI 新提交

Routing by Reasoning Need: Trajectory-Aware Decoding Control for Diffusion Vision-Language Models

按推理需求路由:扩散视觉语言模型的轨迹感知解码控制

Yixiang Liu, Zhongxing Xu, Zhonghua Wang, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Monash University(莫纳什大学)

AI总结 针对扩散视觉语言模型统一解码长度与推理需求不匹配的问题,提出无训练轨迹感知路由控制,按答案封闭性等信号动态调整解码策略,提升鲁棒性。

Comments 17 pages, 9 figures. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11244 2026-09-11 cs.CL cs.CV 新提交

OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models

OmniHallu:多模态大语言模型中跨模态理解与生成的统一幻觉检测

Jianjiang Yang, Peihang Li, Shanqing Xu, Mengchen Qian, Lu Zhang, Meng Luo

机构 * The University of Manchester(曼彻斯特大学) The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Academy of Educational Sciences(上海市教育科学研究院) National University of Singapore(新加坡国立大学)

AI总结 提出OmniHallu统一幻觉检测框架及含万样本的基准,覆盖六种跨模态任务,通过多智能体架构和偏好优化验证器减少专家调用66%,揭示模态相关性能梯度。

Comments Accepted to Findings of EMNLP 2026. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11185 2026-09-11 cs.AI 新提交

Can LLMs Follow Medical Expert Logic? A Benchmark for Hierarchical Logical Consistency in Risk-of-Bias Assessment

大型语言模型能否遵循医学专家逻辑?风险偏倚评估中层级逻辑一致性基准

Jiayu Huang, Zichen Tang, Qianhui Ling, Zemin Kuang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hypertension Center, Beijing Anzhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院高血压中心)

AI总结 该研究提出LogiMed-RoB基准,基于Cochrane RoB 2.0逻辑评估LLMs的层级逻辑一致性,发现高原子一致性下存在错误复合效应和证据推理差距,强调临床部署需白盒验证。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11176 2026-09-11 cs.AI 新提交

Debate-to-Skill: Capability-Bound Process Supervision for Industrial Query-to-Agent Annotation

辩论到技能:面向工业查询到智能体标注的能力边界过程监督

Shiyu Zhang, Leisheng Cheng, Huifu Li

机构 * Baidu, Inc.(百度公司)

AI总结 针对工业查询到智能体匹配中主题相关性与可执行能力混淆的问题,提出能力边界过程监督方法辩论到技能,通过决策原则与结构化审议提升灰色地带案例的匹配效果。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10993 2026-09-11 cs.CL 新提交

Distribution-aware Language Neuron Identification in Multilingual Large Language Models

多语言大语言模型中的分布感知语言神经元识别

Minjun Kim, Inho Won, Junghun Yuk, Dongyeon Kim, Jihyo Kim, KyungTae Lim

机构 * KAIST(韩国科学技术院) InnoCORE PRISM-AI Center(InnoCORE PRISM-AI中心)

AI总结 针对多语言大模型语言特异性神经元识别不足的问题,提出分布感知选择方法,利用激活分布成对重叠聚类,提升目标语言损害达4.9倍且不损其他语言。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10950 2026-09-11 cs.CL cs.AI cs.LG 新提交

Robust Multimodal Sentiment Analysis with Incomplete Modalities via Semantic-aware Completeness based Reconstruction

基于语义感知完整性重建的模态不完整鲁棒多模态情感分析

Han-Jun Choi, Byunggill Joe, Saim Shin, Jin Yea Jang

机构 * Korea Electronics Technology Institute (KETI)(韩国电子技术研究院)

AI总结 针对多模态情感分析中模态不完整导致性能下降的问题,提出基于语义感知完整性估计的重建方法,并辅以稳定多任务训练策略,在三个基准数据集上实现更精确的情感预测。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10943 2026-09-11 cs.CV 新提交

CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation

CamPilot:用于摄像机控制电影生成的多智能体电影助手

Yang Wu, Stefano Petrangeli, Ishita Dasgupta, Yu Shen

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Adobe Research(Adobe研究院)

AI总结 CamPilot提出多智能体框架,结合电影规划与摄像机控制,利用GRPO从14K专业电影学习,提升电影生成的连贯性与质量,并建立CamEval基准验证其优越性。

Comments EMNLP 2026 Workshop REALM

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10934 2026-09-11 cs.CL 新提交

Using Semantic Uncertainty to Estimate Transition Relevance in Turn-taking

利用语义不确定性估计话轮转换中的转换关联位置

Muhammad Umair, Jan P. de Ruiter

机构 * Tufts University(塔夫茨大学)

AI总结 本研究利用LLM语义不确定性建模话轮中不断演变的语义约束,通过采样延续并监测语义离散度变化来预测转换关联位置,在实时听者反应数据集上显著优于文本基线。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 21 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10901 2026-09-11 cs.CL 新提交

SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs

SearchAtlas:通过证据查询图分析智能体搜索策略

Jiacheng Sang, Mengyuan Li, Sanxing Chen, Yukun Huang, Yu Feng, Bhuwan Dhingra

机构 * Duke University(杜克大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 SearchAtlas将搜索轨迹转为证据查询图,以86.0%边F1解析,揭示智能体搜索过程缺陷,其诊断分数比LLM评判更关联错误答案,提升可解释性。

Comments Accepted to Findings of EMNLP 2026. 30 pages, 9 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10815 2026-09-11 cs.CV cs.CL 新提交

BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation

BodyCam-VQA:通过多模态推理与探针问题生成增强执法记录仪视频描述

Karish Gupta, Matthew Alex, Alex Li, Yang Wu, Yun-Wei Chu, Kashif Munir, Xiaotian Zhou, Zhengping Ji, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Axon(Axon公司)

AI总结 本文提出自适应视觉问答框架BodyCam-VQA,通过结构化推理与探针问题生成,提升执法记录仪视频描述的细粒度取证细节提取能力,实现更可靠客观的执法记录。

Comments EMNLP 2026 Workshop NLP4PI

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10810 2026-09-11 cs.CL 新提交

Larger Context Window, Fewer Overcorrections: Optimizing Prompts and Batching for Minimal-Edit Grammatical Error Correction

更大的上下文窗口,更少的过度修正:面向最小编辑语法纠错的提示与批处理优化

Kateryna Karpo, Artem Chernodub

机构 * Ukrainian Catholic University(乌克兰天主教大学) YouScan Zendesk

AI总结 针对最小编辑语法纠错中LLM过度修正问题,提出基于分类法指令、句子批处理和LLM辅助提示优化的方法,在BEA-2019上达到F0.5=78.32,接近微调SOTA。

Comments Accepted for publication at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10750 2026-09-11 cs.IR cs.AI cs.LG 新提交

When Synthetic Data Hurts: On Catastrophic Forgetting in Skill Retrieval for LLM Agents

当合成数据有害:LLM智能体技能检索中的灾难性遗忘

Syed Shariyar Murtaza, Yifan Nie, Utkarsh Soni, Eugene Wen, Arvid Frydenlund

机构 * Manulife(宏利金融)

AI总结 本研究针对LLM智能体技能检索中合成数据微调导致的灾难性遗忘问题,提出并评估了多种持续学习方法,在保持OOD性能的同时提升分布内检索13.98%。

Comments 8 main pages, 15 pages total, accepted in EMNLP Industry track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10745 2026-09-11 cs.CL 新提交

Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

链接前思考:多语言实体链接中的稀有性、推理与检索

Parinthapat Pengpun, Simran Khanuja, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对多语言多模态实体链接中稀有实体性能下降问题,提出结合知识图谱结构指标与推理检索互补的免训练框架,在MERLIN基准上显著提升稀有实体准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.08585 2026-09-11 cs.CL cs.LG 版本更新

Limitations of Automated Simulatability: LLM Simulators Can Bypass Explanations

自动可模拟性的局限性:LLM 模拟器可以绕过解释

Antonin Poché, Fanny Jourdan, Nils Feldhus, Qianli Wang, Jing Yang, Simon Ostermann, Nicholas Asher, Philippe Muller, Vera Schmitt

机构 * IRT Saint Exupéry(IRT圣埃克苏佩里) IRIT, Université de Toulouse(图卢兹大学IRIT实验室) University of Groningen(格罗宁根大学) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所(BIFOLD)) Saarland University(萨尔大学) Johannes Gutenberg-University Mainz(美因茨约翰内斯古滕贝格大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信人工智能研究中心(CERTAIN)) CNRS(法国国家科学研究中心(CNRS))

AI总结 本文复现并扩展ConSim自动可模拟性评估,发现LLM模拟器可绕过解释直接分类或利用类别匿名化泄露标签映射,并提出改进建议。

Comments Accepted to the BlackboxNLP 2026 Reproducibility Challenge (Special Track), EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02149 2026-09-11 cs.HC cs.AI 版本更新

OmegaUse-SOP: SOP Engineering for Professional Computer Use from Human Demonstrations

OmegaUse-SOP:基于人类演示的专业计算机使用SOP工程

Yixiong Xiao, Lang An, Hucheng Yang, Pinxue Ma, Yongquan Chen, Jingjia Cao, Yusai Zhao, Ting Wang, Ting Liu, Siqi Bao, Jingbo Zhou, Hua Wu

机构 * Baidu, Inc.(百度公司) Ningxia Electric Power Engineering Co., Ltd.(宁夏电力工程有限公司)

AI总结 OmegaUse-SOP是一种人在环SOP工程系统,通过四个模块将专业计算机使用的人类演示转化为GUI智能体可复用技能,在PVsyst 7.2光伏模拟测试中提升了GUI智能体在专业SOP任务上的可靠性。

Comments Accpeted to EMNLP 2026 demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01068 2026-09-11 cs.CL 版本更新

OUTLETS: Output-Length Prediction from Speculative Decoding Backbones

OUTLETS:基于推测解码主干的输出长度预测

Weihuang Wen, Yingying Liu, Yichuan Liu, Wenqi Zeng, Li Zhou, Chumin Sun, Jie Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对LLM服务输出长度重尾分布的调度难题,OUTLETS利用推测解码草稿表示构建轻量长度预测器,降低MAE并将短请求P99延迟减少34.8%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00237 2026-09-11 cs.AI cs.CL 版本更新

Learning What to Retain: Gated-Memory Routing for Efficient Collaboration in Multi-Agent LLM Systems

学习保留什么:用于多智能体大语言模型系统高效协作的门控记忆路由

Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中佛罗里达大学)

AI总结 本研究针对多智能体LLM系统的协作协调问题,提出门控记忆路由方法,通过学习的门控机制优化记忆状态,在五组基准测试中准确率最优且推理成本降低,兼顾有效性与高效性。

Comments Accepted to EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20839 2026-09-11 cs.CL cs.CR cs.LG 版本更新

SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel Fields

SAC-Copula:基于平滑相关Gumbel场的扩散语言模型质量保留水印

Baixin Li, Haiyun He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对扩散语言模型的水印方法与迭代并行去掩蔽不兼容的问题,提出SAC-Copula方法,通过高斯Copula构建平滑相关Gumbel扰动场实现质量保留水印,在LLaDA等数据集上验证了其质量-可检测性权衡优势。

Comments 24 pages, 14 figures. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20805 2026-09-11 cs.CV 版本更新

Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding

先路由后查看:面向长视频理解的查询自适应证据获取

Tianyue Wang, Xuying Wu, Yuxiang Ma, Ruiming Liang, Jiaxuan Kang, Yanchao Hao, Zheng Wei, Leigang Qu, Haiyun Guo, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent(腾讯) Wuhan University(武汉大学) Southeast University(东南大学) National University of Singapore(新加坡国立大学)

AI总结 针对长视频理解中查询需求与证据获取策略不匹配的问题,提出Route2Look框架,通过查询自适应路由策略选择证据获取工具,实现最优性能与帧效率。

Comments Accept to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05134 2026-09-11 cs.CL cs.LG 版本更新

Activation-Based Active Learning for In-Context Learning: Challenges and Insights

基于激活的主动学习用于上下文学习:挑战与见解

Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton

机构 * School of Electronics and Computer Science (ECS), University of Southampton(电子与计算机科学学院(ECS),南安普顿大学)

AI总结 本文研究了基于MLP激活的深度主动学习方法在上下文学习中的应用,发现激活信号与示例质量或任务性能相关性弱,表明此类方法不适用于上下文学习。

Comments Insights workshop at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27865 2026-09-11 cs.CL 版本更新

MERIT: Matching Expertise via Rubric-Informed Training for Reviewer Assignment

MERIT: 通过基于评分标准的训练进行审稿人匹配的专业知识匹配

Zixuan Yang, Yibo Zhao, Weicong Liu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

AI总结 提出MERIT两阶段框架,通过强化学习训练审稿人评估器并蒸馏为检索器,实现大规模审稿人分配中的专业知识匹配。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10441 2026-09-11 cs.AI 版本更新

VeriSim: A Configurable Framework for Stress-Testing Medical AI Under Patient Communication Noise

VeriSim:一种用于在现实患者噪声下评估医疗AI的可配置框架

Sina Mansouri, Mohit Marvania, Vibhavari Ashok Shihorkar, Han Ngoc Tran, Kazhal Shafiei, Mehrdad Fazli, Yikuan Li, Ziwei Zhu

机构 * George Mason University(乔治梅森大学) Department of Computer Science, George Mason University(乔治梅森大学计算机科学系) Department of Health Administration and Policy, College of Public Health, George Mason University(乔治梅森大学公共卫生学院卫生管理与政策系) Department of Science, George Mason University(乔治梅森大学科学系)

AI总结 本文提出VeriSim框架,通过引入可控的临床证据基础噪声,评估医疗AI在现实临床场景中的鲁棒性,发现所有模型在真实患者噪声下显著退化,且小型模型退化更严重。

Comments 26 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏