arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-08-28 至 2026-08-28 共收录 33
2608.27391 2026-08-28 cs.AI cs.CL cs.IR cs.LG 新提交

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

CorporateBench:基于时序知识库的大规模问答基准测试

Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov

机构 * Epiq AI Labs(Epiq AI实验室) Cornell University(康奈尔大学)

AI总结 研究针对企业级LLM评估的数据集难题,构建了含23万+文档的CorporateBench基准,从信息提取与知识库查询维度评估5种LLM,发现输入规模接近实际时性能下降,填补了相关评估指标空白。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27380 2026-08-28 cs.CL 新提交

D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

D2C-Routing:用于混合来源AI生成文本检测的维度到组成证据路由

Xin Chen, Fuwei Zhang, Yiqi Tong, Wei Guo, Yutian Xiao, Fuzhen Zhuang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 本研究针对混合来源AI生成文本检测问题,提出D2C-Routing方法,在MixD2C数据集上取得0.8603的四向平均TPR@1%FPR,性能优于RACE-local重运行结果。

Comments 17 pages, 4 figures. To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27219 2026-08-28 cs.CL 新提交

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

BALMS:面向纵向心理健康感知的智能体大语言模型基准测试

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学)

AI总结 该研究提出首个面向纵向心理健康感知的智能体大语言模型基准BALMS,经多数据集、任务与主干评估发现零样本智能体表现有限,思维链提示有提升但存不足,凸显了对特定智能体的需求。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27206 2026-08-28 cs.CV cs.AI 新提交

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

PACE:用于快速视觉语言模型推理的统一压缩-提取范式

Junjie Liu, Shengyuan Ye, Xu Chen

机构 * Sun Yat-sen University(中山大学) Power Dispatch Control Center, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司电力调度控制中心) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对视觉语言模型推理成本随视觉 token 增多而上升的问题,提出无需训练的 PACE 框架,集成到 Qwen2.5-VL-7B 后仅用 10% 视觉 token 保留 93.8% 原性能,TTFT 加速 3.1 倍。

Comments 22 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27169 2026-08-28 cs.CV 新提交

Ancient-Bench: A Comprehensive Multi-millennial, Multi-medium, and Multi-script Benchmark for Ancient Chinese Artifact Text Recognition

Ancient-Bench:用于中国古代文物文字识别的综合多千年、多介质、多文字基准数据集

Hiuyi Cheng, Nuo Xu, Yuyi Zhang, Xuhan Zheng, Wei Pan, Jing Zhang, Dezhi Peng, Minghui Liao, Yihua Teng, Jihao Wu, Haoyu Ren, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对现有古代文本基准数据集碎片化问题,推出Ancient-Bench基准数据集,含2700张图像,覆盖多千年、多介质、多文字,经实验发现古代文物文字识别仍存在异体字等挑战。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27161 2026-08-28 cs.CL 新提交

STAR: Sentence Translation Alignment Rate for Document-to-Document Machine Translation

STAR:面向文档到文档机器翻译的句子翻译对齐率

Yichen Dong, Hao Wang, Junhui Li, Linlong Xu, Longyue Wang, Weihua Luo

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27070 2026-08-28 cs.LG cs.CL 新提交

Unifying Detection and Adaptation in Task-Free Continual Learning

统一无任务持续学习中的检测与适配

Dezheng Han, Anbang Zhang, Zhihao Zhu, Shuaishuai Guo

机构 * School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) The Hong Kong University of Science and Technology(香港科技大学) Shandong University(山东大学) Qilu Hospital of Shandong University(山东大学齐鲁医院)

AI总结 本文提出FiUni框架,通过K-FAC近似的Fisher主子空间正交性检测批量级任务,结合LoRA实现参数高效适配,动态平衡知识共享与任务隔离,缓解LLM持续学习的灾难性遗忘,性能优于先进方法且参数更少。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27049 2026-08-28 cs.CL cs.CY 新提交

Research Design Tracking and Assessment for the Social Sciences

社会科学研究设计的追踪与评估

Marco Rovera, Sergiu Burlacu, Dominique Cappelletti, Alessio Tomelleri, Sonia Marzadro, Martina Bazzoli, Annalisa Tassi, Jessica Gagete-Miranda

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) IRVAPP

AI总结 针对社会科学因果研究设计的人工评估依赖问题,本研究提出ARDTrA任务,构建专家标注数据集,用多轮RAG对话管道评估,发现段落长度是性能主因,且人机任务难度来源独立。

Comments Paper accepted at EMNLP 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27038 2026-08-28 cs.CL 新提交

Cascaded Batch Prompting

级联批量提示

Sho Hoshino, Peinan Zhang

机构 * CyberAgent(赛博agent公司)

AI总结 针对批量提示导致大语言模型下游任务性能不可预测的问题,提出级联批量提示方法,在多项选择问答等任务上性能优于单提示基线,且加速效果与批量大小成正比,在帕累托前沿达到新最优。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-08-28 cs.CV 新提交

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26991 2026-08-28 cs.AI 新提交

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions

ASIL:用结构化状态与语义动作替代截图点击

Rui Xie, Lu Chen

机构 * Shanghai Jiao Tong University(上海交通大学) BIGAI(北京智源人工智能研究院)

AI总结 本文提出ASIL智能体-软件交互层,以结构化状态与语义动作替代低效的截图点击界面,在多应用基准任务中表现优于截图点击,还可提升Qwen系列模型的性能。

Comments Accepted to Findings of EMNLP 2026. 19 pages, 7 figures: 9-page main paper followed by limitations, ethics, acknowledgments, references, and appendices A-E. Project page: this https URL (https://sharryxr.github.io/ASIL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-08-28 cs.CV 新提交

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26832 2026-08-28 cs.CL 新提交

RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models

RuleWeaver:面向大型语言模型的以规则为中心的场景推理基准测试

Bohan Yu, Shi-Yang Li, Pengfei Cao, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 针对现有基准测试无法全面评估大型语言模型以规则为中心的场景推理能力的问题,本文提出RuleWeaver基准测试框架,通过构建规则化问答实例并开展过程级评估,发现当前主流LLMs在该任务上表现不佳。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26807 2026-08-28 cs.CL cs.AI 新提交

Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory

Behavior2Trip:基于用户行为轨迹的个性化旅行规划

Zihao Cheng, Yingyu Shan, Hongru Wang, Zeming Liu, Xinyi Wang, Xiangrong Zhu, Yuhang Guo, Wei Lin, Yunhong Wang

机构 * Meituan Inc.(美团公司) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) University of Edinburgh(爱丁堡大学)

AI总结 该研究提出行为感知旅行规划新任务,构建Behavior2Trip基准,提出B2T-Agent智能体,实验显示其在旅行规划任务上表现优于基线,凸显任务挑战性与模型泛化性。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26710 2026-08-28 cs.AI 新提交

Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing

风格作为混淆因素:AI检测非母语学术写作中的假阳性

Hyeonchu Park, Gahye Jeong, Bugeun Kim

机构 * Chung-Ang University(中央大学) Wordvice(沃德斯(英文服务公司))

AI总结 该研究针对AI文本检测器检测非母语学术写作时的假阳性问题,利用135389份经专业编辑的文档对,发现编辑风格是关键混淆变量,不同检测器的响应存在差异,影响其公平性与可靠性。

Comments Presented in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26694 2026-08-28 cs.AI 新提交

Relational Over-Regularization: Graph-Based AI-Generated Text Detection via Sentence Transition Deviation

关系过正则化:基于句子转移偏差的AI生成文本检测

Hyeonchu Park, Bugeun Kim

机构 * Chung-Ang University(中央大学)

AI总结 该研究提出关系过正则化(ROR),构建基于图的CSFG框架检测AI生成文本,在四个基准上验证,准确率达97.14%,泛化性能优异。

Comments Presented in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26689 2026-08-28 cs.CL 新提交

Beyond Reflection: Affirmation as a Promising Behavioral Marker Associated with Quality in Text-Based Counseling

超越反思:肯定作为与基于文本的咨询质量相关的有前景的行为标记

Michimasa Inaba

机构 * The University of Electro-Communications(东京电机大学)

AI总结 该研究针对AI辅助文本咨询中咨询师行为与对话质量关联的未知问题,基于KokoroChat数据集分析发现肯定比反思更与咨询质量相关,且该信号可迁移至ESConv数据集,为相关培训和系统设计提供经验依据。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26674 2026-08-28 cs.CL cs.AI 新提交

Do LLMs Understand Personality? Rethinking Persona Fidelity Evaluation through Structured Behavioral Inference

大语言模型是否理解人格?通过结构化行为推理重新思考人格保真度评估

Mengfan Li, Zesheng Wei, Xuanhua Shi, Yang Deng

机构 * Singapore Management University(新加坡管理大学)

AI总结 针对现有LLM人格评估范式的局限,提出基于SFL的PRISM框架,将人格保真度评估转化为结构化逆推理任务,实验显示其评估结果更准确稳定。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26638 2026-08-28 cs.CL stat.ML 新提交

Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation

哪些指标能节省最多的人工标注?预测驱动的评估与元评估

Mingqi Gao, Anthony Sicilia, Weiyan Shi

机构 * Northeastern University(东北大学) West Virginia University(西弗吉尼亚大学)

AI总结 该研究基于预测驱动推理提出预测驱动评估框架,引入预测驱动节省率元指标,结合有限人工判断与大规模自动评分实现无偏高效的系统比较,可节省人工标注成本,适用于各类无法验证的任务。

Comments Accepted at EMNLP 2026 (Main). Code available: this https URL (https://github.com/CHATS-lab/ppi-eval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26604 2026-08-28 cs.IR cs.LG 新提交

hoBIT: A Profile-Aware Retrieval-Augmented Chatbot for University Academic Advising

hoBIT:面向大学学术咨询的感知用户画像的检索增强聊天机器人

Yoonseo Kim, Seongmin Lee, Joongheon Kim, SeongKu Kang

AI总结 针对大学学术咨询中因用户画像缺失导致的检索证据不适用问题,提出proFILL方法将hoBIT转换为感知用户画像的RAG系统,实验显示其性能优于多种基线且受用户偏好,可低成本本地部署。

Comments Accepted to the System Demonstrations Track at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26596 2026-08-28 cs.CL 新提交

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习

Rongjin Li, Yuanxin Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) WeChat AI, Tencent Inc.(腾讯微信人工智能部门)

AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26576 2026-08-28 cs.CL 新提交

Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations

双重麻烦:双语预训练会在共享语言表征中留下语言条件效应

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * George Mason University(乔治梅森大学)

AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26529 2026-08-28 cs.CL 新提交

Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue

面向开放式对话中Pairwise LLM评判的多专家共形风险控制

Ming Cheng, Yusheng Dai, Qiuhong Ke, Zhaolin Chen, Lizhen Qu

机构 * Monash University(莫纳什大学)

AI总结 本文提出多专家共形风险控制算法,针对开放式对话的Pairwise LLM评判问题,设计Score Averaging、Decision Voting及MC3方法,构建Panel基准数据集,提升了同构与异构专家面板的评估性能。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26511 2026-08-28 cs.CL 新提交

Sycophancy Suppression Can Impair Rational Updating: Anti-Sycophancy Should Preserve the Ability to Update

谄媚抑制会损害理性更新:反谄媚应保留更新能力

Huanhuan Ma, Henry Peng Zou, Chengze Li, Enze Ma, Yunyue Su, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) National University of Singapore(新加坡国立大学)

AI总结 该研究区分了大型语言模型的无支撑屈服与理性更新,发现反谄媚方法会面临二者的权衡,提出反谄媚应是选择性问题,需在抑制无支撑屈服的同时保留理性更新能力。

Comments Accepted to EMNLP 2026 Findings. Code and data: this https URL (https://github.com/dependentsign/sycophancy-rational-updating)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26506 2026-08-28 cs.LG cs.CL 新提交

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families

一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击

Yu Zhe, Yixin Tan, Junhao Wei, Wang Chen

机构 * RIKEN AIP(理化学研究所先进智能项目) Institute of Science Tokyo(东京科学大学) Zhejiang University(浙江大学)

AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。

Comments Accepted by EMNLP findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26414 2026-08-28 cs.CL cs.IR 新提交

Case2Flow: Bridging Patient Cases and Guideline Flowcharts through Multimodal Retrieval

Case2Flow:通过多模态检索连接患者病例与指南流程图

Jiale Wei, Yufan Chen, Alexander Jaus, Zdravko Marinov, Julian Friedrich, Simon Reiß, Jens Kleesiek, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Hospital Essen(埃森大学医院)

AI总结 该研究提出Case2Flow任务,构建含202份流程图的FlowAtlas语料库,提出无需训练的CRISP方法优化多模态检索,提升Recall@1达18.71个百分点,为病例匹配指南流程图提供可行方案。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26374 2026-08-28 cs.CL 新提交

Survival-Guided Length Control for Efficient Diffusion Language Models

用于高效扩散语言模型的生存引导式长度控制

Ivan Kobyzev, Abbas Ghaddar, Yufei Cui

AI总结 该研究针对扩散语言模型解码时存在不必要去噪步骤的问题,提出生存引导式长度预测器,可将推理速度最高提升7倍且保持任务准确率,同时发现模型性能对所选预测长度敏感。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏