arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-06-10 至 2026-06-10 共收录 12
2606.10768 2026-06-10 cs.LG cs.CL 新提交

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

N-GRPO:嵌入级邻居混合增强策略优化

Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。

Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10610 2026-06-10 cs.CL 新提交

Small Data, Big Noise: Adversarial Training for Robust Parameter-Efficient Fine-Tuning

小数据,大噪声:面向鲁棒参数高效微调的对抗训练

Eitan Cohen, Idan Simai, Uri Shaham

机构 * Bar-Ilan University(巴伊兰大学)

AI总结 提出SDBN框架,将对抗训练与参数高效微调结合,通过离散不确定性集变体增强模型在低资源场景下的鲁棒性和泛化能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10307 2026-06-10 cs.CL 新提交

Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

早期令牌置信度预测多智能体LLM辩论中的推理质量

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

AI总结 研究利用解码时令牌级对数概率作为置信度信号,预测多智能体LLM辩论中的推理质量,发现早期令牌置信度是最强预测因子。

Comments 15 pages, 8 figures, 4 tables; ACL Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10296 2026-06-10 cs.CL cs.AI 新提交

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

自信的撒谎者:利用对数概率和LLM作为评判诊断多智能体辩论

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学伊文斯分校)

AI总结 研究多智能体辩论中令牌级对数概率、LLM评判分数与任务准确性的关系,发现信心与推理质量在构造者上关联更强,且信心可检测关键推理失败。

Comments 15 pages, 7 figures, 1 table, ACL proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09966 2026-06-10 cs.SD 新提交

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

RespiraMFM:一种用于呼吸道疾病识别的对比音频-语言对齐多模态基础模型

Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang, Shrikanth Narayanan, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) University of Chicago(芝加哥大学)

AI总结 提出RespiraMFM多模态基础模型,通过对比音频-文本对齐策略整合呼吸音与临床信息,在监督和零样本任务中分别提升AUROC 9.15%和20.98%。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09837 2026-06-10 cs.HC cs.AI 新提交

Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS

Self-EmoQ: 基于Plutchik引导的价值规划驱动流式情感TTS

Yue Zhao, Hongyan Li, Yong Chen, Luo Ji

机构 * Geely AI Lab(地平线人工智能实验室)

AI总结 提出一种情感规划框架,通过强化学习训练LLM模块,在文本生成前确定情感,以驱动流式TTS,结合Plutchik情感理论进行混合奖励,实验表明在情感确定和响应质量上优于基线。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07936 2026-06-10 cs.CL cs.AI 版本更新

Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation

黄金标准的幻觉:长文本生成中人类评估协议的大规模分析

Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi, Zongwan Cao, Chenjun Xu, Bingbing Wen, Su Lin Blodgett, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) National Tsing Hua University(国立清华大学) Seoul National University(首尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Allen Institute for AI(艾伦人工智能研究所)

AI总结 通过分析2023-2025年*CL会议论文中的人类评估协议,发现报告不透明和可重复性差的问题,并提出改进建议。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14075 2026-06-10 cs.CL 版本更新

EXCEEDS: Extracting Complex Events via Nugget-based Grid Modeling in Scientific Domain

EXCEEDS: 通过基于线索块的网格建模在科学领域中提取复杂事件

Yi-Fan Lu, Xian-Ling Mao, Bo Wang, Xiao Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对科学领域事件密集、信息形式复杂的特点,构建大规模多事件文档级数据集SciEvents,并提出端到端框架EXCEEDS,将密集线索块编码为网格矩阵,简化复杂事件提取为基于线索块的网格建模任务,取得最优性能。

Comments Accepted by ACL 2026 Main Conference, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22192 2026-06-10 cs.CV 版本更新

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化

Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

机构 * Nanjing University(南京大学) LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) East China Normal University(华东师范大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学)

AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04491 2026-06-10 cs.AI cs.CL 版本更新

Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents

不耐烦的用户混淆AI智能体:用于测试智能体的高保真人类特质模拟

Muyu He, Anand Kumar, Tsach Mackey, Meghana Rajeev, James Zou, Nazneen Rajani

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出TraitBasis方法,通过控制用户特质向量(如不耐烦、不连贯)对AI智能体进行压力测试,发现性能下降2%-30%,揭示当前智能体对用户行为变化的脆弱性。

Comments ACL 2026 [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21218 2026-06-10 cs.CL 版本更新

Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data

参数化知识并非全部:通过检索预训练数据实现诚实的语言模型

Christopher Adrian Kusuma, Muhammad Reza Qorib, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

AI总结 针对大语言模型在知识不足时产生幻觉的问题,提出利用公开预训练数据构建更鲁棒的诚实性评估基准,并设计检索预训练数据的方法提升模型诚实性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04514 2026-06-10 cs.AI cs.CE cs.CL cs.CV stat.ME 版本更新

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering

ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体

Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。

Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)

详情

展开后加载摘要…

URL PDF HTML 收藏