arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-06-05 至 2026-06-05 共收录 19
2606.06058 2026-06-05 cs.LG cs.AI cs.CL

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

MDP-GRPO:面向多约束指令跟随的稳定化组相对策略优化

Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

机构 * Department of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程系,工程学院) Department of Statistics, Mathematics and Computer Science, Allameh Tabataba’i University(塔巴蒂大学统计、数学与计算机科学系)

AI总结 针对标准GRPO在离散低分散奖励下的不稳定性,提出MDP-GRPO,通过多温度采样、双锚优势、前景理论整形和非对称KL正则化,在FollowBench等数据集上提升严格约束满足率最高5.0%。

Comments Accepted to ACL 2026 Main Conference. 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05924 2026-06-05 cs.CL cs.AI

Better Literary Translation: A Multi-Aspect Data Generation and LLM Training Approach

更好的文学翻译:多维度数据生成与大语言模型训练方法

Zhihao Lin, Ziqi Zhu, Hao Huang, Guanghui Wang, Peiyang He

机构 * Amazon Web Services (AWS)(亚马逊网络服务(AWS)) Peking University(北京大学)

AI总结 提出多维度迭代优化框架,通过专门的大语言模型生成高质量翻译参考和偏好数据,结合监督微调和强化学习(GRPO)提升文学翻译质量,在MetaphorTrans英中文学翻译基准上达到与Claude Sonnet 4.5竞争的性能。

Comments Accepted by ACL 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05864 2026-06-05 cs.CL

Analysis of the Neglect-Zero Effect in Large Language Models

大型语言模型中忽视零效应的分析

Jin Tanaka, Daiki Matsuoka, Ryoma Kumon, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所) Tohoku University(东北大学)

AI总结 本研究通过结构启动范式,探究大型语言模型是否像人类一样存在忽视零效应,即忽略使命题因空集而空洞为真的零模型。

Comments 14 pages (10 pages main text), 8 figures. To appear in the Proceedings of the ACL2026 Student Research Workshop (SRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05716 2026-06-05 cs.CL

Interpreting Style Representations via Style-Eliciting Prompts

通过风格诱导提示解释风格表示

Junghwan Kim, David Jurgens

机构 * University of Michigan(密歇根大学)

AI总结 提出一种通过风格诱导提示解释风格表示的新框架,利用大型语言模型生成自然语言描述,并在风格描述和模仿任务中优于直接提示的基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05531 2026-06-05 cs.CV cs.AI cs.CL cs.LG

Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

Almieyar-Oryx-BloomBench:一个用于视觉语言模型认知知情评估的双语多模态基准

Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor, Marzia Nouri, Doratossadat Dastgheib, Mohamed Hefeeda, Ehsaneddin Asgari

机构 * University of British Columbia(不列颠哥伦比亚大学) Zuse School(Zuse学校) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

AI总结 针对现有基准无法诊断视觉语言模型真实推理能力的问题,提出基于Bloom认知分类学的双语多模态基准BloomBench,系统评估六个认知层次,揭示模型在事实回忆和创造性合成方面的深层局限。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05384 2026-06-05 cs.AI cs.CL

Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges

稳定性与可操纵性:评估LLM裁判在决策后交互下的鲁棒性

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

AI总结 研究LLM作为裁判在决策后交互中的可操纵性,发现虽然重复中性评估下高度稳定,但针对性挑战可显著逆转判决,并提出评估鲁棒性分数(ERS)量化交互鲁棒性。

Comments Accepted at ACL 2026 GEM (Generation, Evaluation and Metrics) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05308 2026-06-05 cs.LG cs.AI cs.CL cs.IR stat.AP

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference

基于预测驱动推断的统计可靠LLM排序评估

Abhishek Divekar

机构 * Amazon(亚马逊)

AI总结 提出PRECISE框架,将预测驱动推断扩展到排序评估指标,通过结合少量人工标注和大量LLM判断实现无偏估计,并在ESCI基准和实际系统中验证了有效性。

Comments Accepted at ACL 2026 - GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05180 2026-06-05 cs.CL cs.AI

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

从评分到解释:评估基于量规的教学质量评估中的SHAP和LLM理由

Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Lund University(吕勒奥大学) University of Tübingen(图宾根大学) Stanford Graduate School of Education(斯坦福大学教育研究生院) Harvard Graduate School of Education(哈佛大学教育研究生院)

AI总结 提出一个结合SHAP和LLM理由的框架,用于基于量规的评分模型的可解释性,并在课堂转录数据上评估其忠实性和可迁移性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03189 2026-06-05 cs.CL

SenseJudge: Human-Centric Preference-Driven Judgment Framework

SenseJudge: 以人为中心的偏好驱动判断框架

Rui Li, Junfeng Liu, Xiangwen Kong, Linhai Xu, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) StepFun Xi’an Jiaotong University(西安交通大学)

AI总结 提出SenseJudge框架和SenseBench基准,通过融入用户偏好实现个性化判断和模型排名,实验证明其优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02907 2026-06-05 cs.CL cs.AI

Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States

线性探针检测语言模型隐藏状态中的任务格式,而非推理模式

Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

机构 * Horizon Research(远景研究) Meta Apple(苹果公司) Northeastern University(东北大学)

AI总结 通过线性探针实验发现,大语言模型隐藏状态中看似分离的推理模式实际上由任务格式(如来源、选项数、响应长度)混淆导致,而非真正的推理计算结构。

Comments Accepted in the 6th Workshop on Trustworthy NLP, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01897 2026-06-05 cs.AI

Community-Aware Assessment of Social Textual Engagement and Resonance: A Human-Centric Perspective on User-Generated Content Evaluation

社区感知的社交文本参与度与共鸣评估:以人为中心的用户生成内容评价视角

Tianjiao Li, Kai Zhao, Xiang Li, Yang Liu, Huyang Sun

AI总结 提出CASTER任务和MEDEA架构,通过社会思维链机制模拟社区认知与情感反应,实现用户生成内容的多模态共鸣评估。

Comments Published as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26046 2026-06-05 cs.CL cs.AI cs.LG cs.MA cs.SE

When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges

当梯度冲突时:多目标提示优化用于LLM评判器的失败模式

Parth Darshan, Abhishek Divekar

机构 * IIT Jodhpur(印度理工学院乔普里尔) Amazon(亚马逊)

AI总结 研究多目标文本梯度优化中梯度稀释和指令干扰两种失败模式,通过分解优化器信息共享方式揭示性能下降原因。

Comments Accepted at ACL 2026 - CustomNLP4U Workshop. Code, prompts and data available at https://github.com/adivekar-utexas/when-gradients-collide

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10063 2026-06-05 cs.CL cs.AI math.AT

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

基于注意力图拓扑分歧的LLM幻觉检测

Alexandra Bazarova, Andrei Volodichev, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey Savchenko, Serguei Barannikov, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所) SB AI Lab(SB人工智能实验室) HSE University(俄罗斯高等经济学院) CNRS, Universite Paris Cite(法国国家科学研究中心,巴黎Cité大学)

AI总结 本文提出TOHA方法,通过分析注意力矩阵的拓扑结构来检测LLM中的幻觉现象,实验表明该方法在多个基准测试中表现优异,且对标注数据和计算资源需求较低。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17260 2026-06-05 cs.CL

Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation

重新思考会议有效性:一个用于时间细粒度自动会议有效性评估的基准和框架

Yihang Li, Chenhui Chu

机构 * Kyoto University(京都大学)

AI总结 本文提出了一种新的会议有效性评估方法,通过定义有效性为时间内的客观成就率,并引入AMI-ME数据集和自动评估框架,以支持对会议中各个话题段落的有效性评分,从而建立一个全面的基准并评估框架的通用性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19568 2026-06-05 cs.AI cs.SE

Learning Adaptive Parallel Execution for Efficient Code Localization

学习适应性并行执行以实现高效的代码定位

Ke Xu, Siyang Xiao, Ming Liang, Yichen Yu, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出FuseSearch,通过将并行代码定位重新表述为联合质量-效率优化任务,采用两阶段SFT和RL训练方法学习适应性并行策略,以提高代码定位的效率和性能。

Comments Paper accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05026 2026-06-05 cs.CL cs.LG

Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding

多模态用户界面/用户体验设计理解的基准测试:MLLMs能否捕捉界面如何引导用户行为?

Jaehyun Jeon, Min Soo Kim, Jang Han Yoon, Sumin Shim, Yejin Choi, Hanbin Kim, Dae Hyun Kim, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NC AI

AI总结 本文提出WiserUI-Bench基准测试,用于评估多模态UI/UX设计对用户行为的影响,通过300对真实世界UI图像对和专家解读,发现MLLMs在理解UI/UX设计行为影响方面存在局限。

Comments ACL 2026 Main. Our code and dataset: https://github.com/jeochris/wiserui-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09061 2026-06-05 cs.SD eess.AS

O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion

O_O-VC: 基于合成数据驱动的任意到任意语音转换一一对一对齐

Huu Tuong Tu, Huan Vu, cuong tien nguyen, Dien Hy Ngo, Nguyen Thi Thu Trang

机构 * VNPT AI, VNPT Group(VNPT AI,VNPT集团) Hanoi University of Science and Technology(河内科学技术大学) Business AI Lab, National Economics University(国家经济大学商业人工智能实验室)

AI总结 本文提出了一种基于合成数据驱动的任意到任意语音转换方法,通过利用高质量预训练多说话人文本到语音模型生成的合成语音数据,学习源语音到目标语音的直接映射,从而在保留语言内容的同时捕捉说话人特定特征,并在零样本场景中提升适应性和性能。

Comments EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00537 2026-06-05 cs.CL

The Prosody of Emojis

表情符号的语调

Giulio Zhou, Tsz Kin Lam, Alexandra Birch, Barry Haddow

机构 * University of Edinburgh(爱丁堡大学) NatWest Aveni

AI总结 研究探讨了表情符号如何影响语音表达,并揭示听众如何通过语音线索恢复表情符号的含义,发现语义差异越大,语音变化越明显,表明表情符号是连接数字文本和口语表达的语调载体。

Comments ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏