arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-07-14 至 2026-07-14 共收录 9
2508.21787 2026-07-14 cs.CL cs.AI 版本更新

PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains

PiCSAR:基于推理链的概率置信度选择与排序

Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院)

AI总结 PiCSAR通过联合对数似然度评估推理链和最终答案的置信度,无需训练即可提升大语言模型和推理模型的准确性,在多个基准测试中表现优异。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19274 2026-07-14 cs.CL 版本更新

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing

HarDBench: 面向安全人机协作写作的基于草稿的合著越狱攻击基准

Euntae Kim, Soomin Han, Buru Chang

机构 * Korea University(韩国大学) Sogang University(ソガン大学)

AI总结 提出HarDBench基准,评估大语言模型在协作写作中面对恶意草稿填充的越狱攻击的鲁棒性,并通过偏好优化实现安全-效用平衡的对齐方法。

Comments ACL 2026 Main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 40785-40831 July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07155 2026-07-14 cs.LG cs.AI 版本更新

Stable On-Policy Distillation through Adaptive Target Reformulation

通过自适应目标重述实现稳定的在线策略蒸馏

Ijun Jang, Jewon Yeom, Juan Yeo, Hyunggyu Lim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

AI总结 本文提出Veto方法,通过在logit空间构建几何桥梁,解决传统在线策略蒸馏中的分布不匹配问题,提升训练稳定性与输出多样性。

Comments 10 pages, 5 figures, Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13353 2026-07-14 cs.CL cs.LG cs.SE 版本更新

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding

感知与敏感性:探讨语义回忆对长上下文代码推理的影响

Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana

机构 * Columbia University(哥伦比亚大学)

AI总结 本文探讨了语义回忆对长上下文代码推理的影响,通过评估10种先进LLM发现,前沿模型在词汇回忆上表现优异,但语义回忆在长上下文中央位置时显著下降。引入语义回忆敏感性指标,提出SemTrace任务,展示LLM在长上下文中的位置效应。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09149 2026-07-14 cs.LG cs.AI cs.MA 版本更新

Enabling Agents to Communicate Entirely in Latent Space

使智能体能够在潜在空间中完全交流

Zhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen, Haochao Ying

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Interlat方法,通过利用LLM的连续隐藏状态实现智能体间的潜在空间通信,实验表明其在跨异构模型中表现优异,提升了推理速度并保持性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07486 2026-07-14 cs.CR cs.AI 版本更新

Private Seeds, Public LLMs: Realistic and Privacy-Preserving Synthetic Data Generation

隐私种子,公开大语言模型:现实且隐私保护的合成数据生成

Qian Ma, Sarah Rajtmajer

机构 * Information Sciences and Technology, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

AI总结 本文提出RPSG方法,通过隐私种子和差分隐私机制生成高保真且隐私保护的合成数据,实验验证其在隐私与效用平衡上的优势。

Comments Published in Findings of the Association for Computational Linguistics: ACL 2026. Camera-ready version

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 189-210, Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10504 2026-07-14 cs.CL 版本更新

DR-Arena: an Automated Evaluation Framework for Deep Research Agents

DR-Arena:深度研究智能体的自动化评估框架

Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 针对大语言模型作深度研究智能体时任务性能评估难的问题,提出DR-Arena自动化评估框架,通过动态调查、构建实时信息树、自动考官出题及自适应进化循环提升任务复杂性来评估,实验证明其与人类偏好对齐效果好,可替代人工裁决。

Comments 22 pages, 8 figures. Accepted to ACL 2026 as an oral presentation and selected as an SAC Highlight

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 27130-27152, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06896 2026-07-14 eess.AS cs.CL 版本更新

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离

Mingyue Huo, Yiwen Shao, Yuheng Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。

Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2

详情

展开后加载摘要…

URL PDF HTML 收藏