arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-05-29 至 2026-05-29 共收录 12
2601.07525 2026-05-29 cs.CL cs.AI

Thinking Before Constraining: A Unified Decoding Framework for Large Language Models

先思考再约束:大型语言模型的统一解码框架

Ngoc Trinh Hung Nguyen, Alonso Silva, Laith Zumot, Liubov Tupikina, Armen Aghasaryan, Mehwish Alam

机构 * Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院) Nokia Bell Labs(诺基亚贝尔实验室) Nokia(诺基亚)

AI总结 提出In-Writing混合方法,通过触发令牌将自由形式推理与结构化解码解耦,在分类和推理任务上准确率提升高达27%。

Comments v2-EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29986 2026-05-29 cs.AI

Accelerating Constrained Decoding with Token Space Compression

加速受限解码:通过词元空间压缩

Michael Sullivan, Alexander Koller

机构 * Department of Language Science and Technology(语言科学与技术系) Saarland Informatics Campus(萨尔兰州信息学校区) Saarland University(萨尔兰大学)

AI总结 提出CFGzip离线压缩词元搜索空间,大幅降低上下文无关文法约束解码的开销,实现高达两个数量级的延迟减少和7.5倍的总生成速度提升。

Comments 13 pages; 5 figures; under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29927 2026-05-29 cs.CL cs.AI cs.LG

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

计划方式重要吗?LLM网络代理计划表示的实证研究

Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

机构 * Concordia University(康科德大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Copenhagen(哥本哈根大学) Universite Claude Bernard Lyon(克莱尔蒙特-伯恩大学) McGill University(麦吉尔大学)

AI总结 本研究提出PlanAhead框架,通过自动难度分类和四种计划表示(顺序子目标、叙述、伪代码、检查清单)的对比实验,发现计划表示形式和生成计划的LLM显著影响网络代理的鲁棒性和任务成功率。

Comments Extended version of paper submitted to EMNLP, waiting for acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29765 2026-05-29 cs.LG

MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion

MMTM: 基于相似性门控融合的长视频三模态主题建模

Ali Abusaleh, Bhuvanesh Verma, Alexander Mehler

机构 * Text Technology Lab (TTLab), Goethe University Frankfurt(文本技术实验室(TTLab),法兰克福歌德大学)

AI总结 提出MMTM模块化流水线,通过相似性门控融合集成语音识别、音频和视觉嵌入及BERTopic聚类,在长视频主题发现中显著提升主题质量。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28700 2026-05-29 cs.AI cs.CL

The Importance of Being Statistically Earnest: A Critical Re-evaluation of GSM-Symbolic

认真统计的重要性:对GSM-Symbolic的批判性再评估

Dominika Agnieszka Długosz, Arlindo Oliveira, Natalia Díaz-Rodríguez

机构 * Instituto Superior Técnico & INESC-ID, Universidade de Lisboa, Portugal(里斯本大学技术高级学院及INESC-ID研究所,里斯本大学,葡萄牙) Dept. of Computer Science and AI & DaSCI Institute, Universidad de Granada, Spain(计算机科学与人工智能系及DaSCI研究所,格拉纳达大学,西班牙)

AI总结 通过广义线性混合模型和每问题随机效应重新评估20个开源模型,发现仅半数模型在原始提示格式下表现显著变化,并指出GSM-Symbolic数据集存在大整数分布偏移,控制该效应后剩余显著案例约减半,表明关于LLM推理的笼统结论在统计上不成熟且机制上具有误导性。

Comments 38 pages, 11 figures. Submitted to ACL ARR / EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18395 2026-05-29 cs.CL

Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction

不要贪婪,三思而后行:文档级信息抽取的采样与选择

Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(希茨中心 - Ixa,巴斯克国家大学UPV/EHU)

AI总结 提出ThinkTwice框架,通过采样生成多个候选模板并选择最优,利用无监督一致性和有监督奖励模型,在文档级信息抽取中超越贪婪解码方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29319 2026-05-29 cs.CL

Rethinking Stepwise Model Routing: A Cost-Efficient Table Reasoning Perspective

重新思考逐步模型路由:一种成本高效的表格推理视角

Shenghao Ye, Yuxiang Wang, Yu Guo, Dong Jin, Shuangwu Chen, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) The University of Melbourne(墨尔本大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 提出EcoTab框架,通过分别估计表格令牌和文本令牌的不确定性并映射到下一步失败风险,实现表格推理中准确性与效率的更好平衡。

Comments 17pages, 15 figures, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29310 2026-05-29 cs.AI cs.CL

Rubric-Guided Process Reward for Stepwise Model Routing

基于评分准则的逐步模型路由过程奖励

Shenghao Ye, Yu Guo, Zhengheng Li, Shuangwu Chen, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 提出RoRo框架,通过收集路由轨迹、构建偏好对、训练Rubricor生成评估准则和Judge评分,结合过程与结果奖励优化路由策略,提升大型推理模型逐步路由的准确性和成本效率。

Comments 17 pages, 9 figures, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29270 2026-05-29 cs.AI

Indexing the Unreadable: LLM-Native Recursive Construction and Search of Service Taxonomies

索引不可读之物:基于LLM原生的服务分类法递归构建与搜索

Wei Zheng, Yang Yan, Yiyang Shao, Jinyang Li, Zeze Chang, Yukuang Jia, Qiming Mao, Chihyung Wang, Jingbin Zhou

AI总结 针对LLM在服务发现中因上下文窗口限制和长输入中间信息丢失问题,提出LLM原生的渐进式披露方案A2X,通过自动构建层次化服务分类法并在查询时逐层遍历,显著提升检索准确率并降低token消耗。

Comments Preprint. 8 pages main paper + appendix; 2 figures. Under submission to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28897 2026-05-29 cs.AI cs.MA

Review Arcade: On the Human Alignment and Gameability of LLM Reviews

Review Arcade: 关于LLM评审的人类对齐与可博弈性

Hans Ole Hatzel, Sebastian Steindl, Jan Strich

机构 * Language Technology Group, University of Hamburg, Germany(汉堡大学语言技术小组) Hub of Computing and Data Science (HCDS), University of Hamburg, Germany(汉堡大学计算与数据科学中心) OTH Amberg-Weiden, Germany(阿姆伯-魏登工业大学)

AI总结 通过实验评估LLM生成论文评审与人类评审的对齐程度,并发现作者可根据LLM评审迭代修改论文以提升评分(最多35%的论文显著提高),揭示了LLM评审的可博弈性。

Comments Under Review EMNLP 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20443 2026-05-29 cs.CL cs.AI cs.LG

DialToM: A Theory of Mind Benchmark for Forecasting State-Driven Dialogue Trajectories

DialToM:用于预测状态驱动对话轨迹的心智理论基准

Neemesh Yadav, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Australian National University(澳大利亚国立大学)

AI总结 提出DialToM基准,通过多选评估框架从自然对话中构建,揭示LLMs在推断心理状态(字面ToM)与利用其进行社会预测(功能ToM)之间的系统性推理不对称性,并证明领域专家与AI之间存在显著能力差距。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏