arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

至 收录 168
2604.19047 2026-07-01 cs.CL cs.AI cs.IR 版本更新

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

RARE:面向高相似性语料的冗余感知检索评估框架

Hanjun Cho, Jay-Yoon Lee

机构 * Allganize Seoul National University(首尔国立大学)

AI总结 RARE通过分解文档为原子事实和增强LLM生成数据,构建更真实的基准,揭示当前评估体系无法捕捉的鲁棒性差距。

Comments Accepted to ACL 2026 (Main Conference)

URL PDF HTML 收藏
2601.14171 2026-07-01 cs.AI 版本更新

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance

Paper2Rebuttal: 一种透明的作者回复辅助多智能体框架

Qianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

AI总结 提出多智能体框架RebuttalAgent,将回复生成重构为以证据为中心的规划任务,通过分解反馈、构建混合上下文和外部搜索模块,提升覆盖度、忠实性和策略连贯性。

Comments Accepted by ACL2026 main conference

URL PDF HTML 收藏
2601.04126 2026-07-01 cs.CL cs.AI cs.CV 版本更新

InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training

InfiniteWeb: 面向GUI智能体训练的可扩展Web环境合成

Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang, Zongyu Guo, Jiahao Li, Bin Li, Yan Lu

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出InfiniteWeb系统,通过统一规范、任务驱动测试和多样化种子设计自动生成功能完备的Web环境,解决GUI智能体训练数据稀缺问题,在OSWorld和Online-Mind2Web上取得显著性能提升。

Comments Accepted to ACL 2026 Main

URL PDF HTML 收藏
2508.01682 2026-07-01 cs.CL 版本更新

The Bidirectional Process Reward Model

双向过程奖励模型

Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。

Comments ACL 2026

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

URL PDF HTML 收藏
2510.19600 2026-07-01 cs.SE cs.AI cs.CL 版本更新

Human-Agent Collaborative Paper-to-Page Crafting

人机协作的论文到网页制作

Qianli Ma, Siyu Wang, Yilin Chen, Yinhao Tang, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。

Comments Accepted by ACL2026 Findings

URL PDF HTML 收藏
2605.00768 2026-06-29 cs.CL 版本更新

Characterizing the Expressivity of Local Attention in Transformers

对变换器中局部注意力的表达力进行表征

Jiaoda Li, Ryan Cotterell

AI总结 本文研究了变换器中局部注意力的表达力,通过形式语言理论分析了局部注意力如何扩展可识别的正则语言,并证明了全局和局部注意力在表达力上的互补性,实验表明混合型变换器在形式语言识别和自然语言建模中表现更优。

Comments ACL 2026

URL PDF HTML 收藏
2604.21211 2026-06-29 cs.CL 版本更新

Subject-level Inference for Realistic Text Anonymization Evaluation

面向真实文本匿名化评估的个体级推断

Myeong Seok Oh, Dong-Yun Kim, Hanseok Oh, Chaean Kang, Joeun Kang, Xiaonan Wang, Hyunjung Park, Young Cheol Jung, Hansaem Kim

机构 * Tscientific Soongsil University(首尔大学) Yonsei University(延世大学) Mila

AI总结 本文提出SPIA基准,通过个体级评估而非文本跨度,揭示匿名化保护不足,显示即使90% PII被掩码,个体级推断仍达33%。

Comments Accepted at ACL 2026

URL PDF HTML 收藏
2601.17642 2026-06-29 cs.AI 版本更新

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准

Zhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji, Usman Naseem

AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。

Comments Accepted by ACL'26 Findings

URL PDF HTML 收藏
2502.16886 2026-06-29 cs.CL cs.AI cs.LG 版本更新

ReFreeKV: Towards Threshold-Free KV Cache Compression

ReFreeKV: 迈向无阈值的KV缓存压缩

Xuanfan Ni, Liyan Xu, Chenyang Lyu, Longyue Wang, Mo Yu, Lemao Liu, Fandong Meng, Jie Zhou, Piji Li

AI总结 针对KV缓存压缩中阈值依赖导致性能不稳定的问题,提出无阈值方法ReFreeKV,自适应调整预算分配,在13个数据集上保持全缓存性能。

Comments Accepted to ACL 2026 Findings

URL PDF HTML 收藏
2506.01442 2026-06-29 cs.AI 版本更新

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

URL PDF HTML 收藏
2602.18446 2026-06-26 cs.CL cs.AI 版本更新

ReportLogic: Evaluating Logical Quality in Deep Research Reports

ReportLogic: 评估深度研究报告的逻辑质量

Jujia Zhao, Zhaoxin Huan, Zihan Wang, Xiaolu Zhang, Jun Zhou, Suzan Verberne, Zhaochun Ren

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿先进计算机科学研究所,莱顿大学) Ant Group(蚂蚁集团) CISPA Helmholtz Center for Information Security(信息安全霍普夫中心)

AI总结 提出ReportLogic基准,通过可审计性视角量化报告逻辑质量,包含宏观逻辑、阐述逻辑和结构逻辑三层评估,并训练开源LogicJudge进行可扩展评估。

Comments Accepted by ACL 2026 main

URL PDF HTML 收藏
2508.03247 2026-06-26 cs.CL cs.CY 版本更新

Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达

Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Sungkyunkwan University(成均馆大学)

AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。

Comments C3NLP workshop at ACL 2026

URL PDF HTML 收藏
2603.23129 2026-06-25 cs.LG 版本更新

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架

Aditya Kakade, Vivek Srivastava, Shirish Karande

机构 * TCS Research, India(印度TCS研究)

AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。

Comments Accepted to ACL 2026 (Findings). 33 pages

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

URL PDF HTML 收藏
2505.12843 2026-06-25 cs.LG cs.AI 版本更新

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

偏差拟合以缓解RLHF中奖励模型的长度偏差

Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。

Comments 16 pages, 12 figures. Accepted to ACL 2026

URL PDF HTML 收藏
2501.18916 2026-06-25 cs.LG 版本更新

LLM Program Optimization via Retrieval Augmented Search

通过检索增强搜索实现LLM程序优化

Sagnik Anupam, Alexander Shypula, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出检索增强搜索(RAS)方法,利用LLM进行黑盒程序优化,通过检索慢-快程序对引导束搜索,并基于LLM生成的自然语言描述进行上下文检索,显著优于源码检索;同时提出AEGIS方法通过原子编辑提升可解释性。

Comments ACL 2026 Findings

URL PDF HTML 收藏
2511.20892 2026-06-24 cs.AI 版本更新

Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs

表示干预使大语言模型在终身学习中实现知识记忆控制

Xuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang, Yujun Yan, Haifeng Chen, Zhengzhang Chen

机构 * Dartmouth College(达特茅斯学院) NEC Laboratories America(NEC美国实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RILKE方法,通过在模型表示空间中进行干预,实现大语言模型的终身知识控制,有效更新知识并保持通用性。

Comments In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: ACL 2026, Oral Presentation

URL PDF HTML 收藏
2601.06395 2026-06-24 cs.CL 版本更新

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages

AfriqueLLM: 数据混合与模型架构如何影响非洲语言的持续预训练

Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(魁北克AI研究所) LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) Microsoft AI for Good Research Lab(微软AI for Good研究实验室)

AI总结 本文通过持续预训练26B tokens,在20种非洲语言上构建了AfriqueLLM模型套件,系统研究了数据组成和模型架构对下游性能的影响,发现数据组成是主要驱动因素,且架构选择比模型规模更重要。

Comments Accepted to ACL 2026 (Main Conference)

URL PDF HTML 收藏
2601.02986 2026-06-23 cs.CL 版本更新

P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist

P-Check:通过学习生成动态检查清单推进个性化奖励模型

Kwangwook Seo, Dongha Lee

机构 * Department of Artificial Intelligence,Yonsei University(燕京大学人工智能学院)

AI总结 本文提出P-Check框架,通过学习生成动态检查清单来提升个性化奖励模型的准确性,并引入偏好对比准则加权策略以增强个性化生成效果。

Comments ACL 2026 Main

URL PDF HTML 收藏
2604.10368 2026-06-23 cs.CL 版本更新

A Structured Clustering Approach for Inducing Media Narratives

一种用于归纳媒体叙事的结构化聚类方法

Rohan Das, Advait Deshmukh, Alexandria Leto, Zohar Naaman, I-Ta Lee, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Independent Researcher(独立研究者)

AI总结 提出结构化聚类方法联合建模事件与角色,自动归纳可解释的叙事模式,无需人工标注即可大规模分析媒体语料。

Comments Accepted to the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

URL PDF HTML 收藏
2510.08091 2026-06-23 cs.CL cs.AI cs.HC 版本更新

Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility

改变思维的观点:LLM 理由影响人类(和 LLM)对合理性的看法

Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 研究 LLM 生成的赞成/反对理由如何影响人类和 LLM 对常识基准答案的合理性判断,发现理由能显著改变判断,表明 LLM 可影响人类信念。

Comments ACL 2026 Camera-Ready Version

URL PDF HTML 收藏
2602.07930 2026-06-23 cs.CL 版本更新

Patches of Nonlinearity: Instruction Vectors in Large Language Models

非线性补丁:大型语言模型中的指令向量

Irina Bigoulaeva, Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity ATHENE, Germany(计算机科学系,达姆施塔特技术大学和应用网络安全国家研究中心ATHENE,德国)

AI总结 通过因果中介分析发现指令表示在模型中高度局部化,称为指令向量(IVs),并揭示其线性可分性与非线性因果交互并存,提出一种免于线性假设的新方法定位信息处理,发现IVs作为电路选择器。

Comments Accepted at ACL 2026

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

URL PDF HTML 收藏
2507.22411 2026-06-23 cs.CL cs.AI 版本更新

NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models

NeedleChain: 测量大型语言模型的完整上下文理解能力

Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

AI总结 针对现有基准高估LLM上下文理解能力的问题,提出NeedleChain基准,通过全相关上下文测试模型整合所有证据的能力,并引入ROPE收缩策略提升全上下文整合。

Comments ACL2026 - findings

URL PDF HTML 收藏
2510.09388 2026-06-23 cs.LG cs.CL 版本更新

Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

不要告诉答案,真正引导RL Rollout期间的推理

Xinyi Wang, Jinyi Han, Zishang Jiang, Tingyun Li, Jiaqing Liang, Sihang Jiang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能研究所) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Ant Group(蚂蚁集团)

AI总结 针对强化学习中任务难度超出模型能力导致奖励稀疏的问题,提出HINT框架,通过元提示和亲和力感知策略优化,提升模型推理能力并保持训练稳定性。

Comments Accepted to Findings of ACL 2026. 19 pages

URL PDF HTML 收藏
2508.13514 2026-06-23 cs.CL cs.AI 版本更新

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

ProMed:基于Shapley信息增益引导的强化学习用于主动式医疗大语言模型

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息技术研究所,天津滨海,中国) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 提出ProMed框架,通过Shapley信息增益奖励引导强化学习,使医疗大语言模型从被动回答转向主动提问,在部分信息医疗基准上平均提升6.29%。

Comments Accepted to ACL 2026 (Main Conference)

URL PDF HTML 收藏
2506.17789 2026-06-23 cs.CL 版本更新

Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights

通过印度语言的视角看多语言分词:挑战与洞见

Maharaj Brahma, N J Karthika, Rajat Verma, Nagasai Saketh Naidu, Rohit Saluja, Maunendra Sankar Desarkar, Ganesh Ramakrishnan

机构 * Department of CSE, Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校计算机科学与工程系) Department of CSE, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) SCEE, Indian Institute of Technology Mandi(印度理工学院曼迪分校软件工程系) Adobe Research(Adobe研究)

AI总结 本研究针对17种印度语言,系统评估了子词算法、标准化方法、词汇量及词汇构建策略对多语言分词的影响,发现脚本特定标准化、Unigram LM保留形态边界及聚类词汇构建可提升性能。

Comments Accepted at ACL 2026 (Findings - Long paper)

URL PDF HTML 收藏
2505.16312 2026-06-23 cs.AI cs.CL 版本更新

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning

EquivPruner:通过动作剪枝提升基于LLM的搜索效率与质量

Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) iFLYTEK Research(iFLYTEK研究院)

AI总结 针对LLM搜索中语义等价步骤导致的大量冗余消耗,提出EquivPruner方法,通过剪枝等价动作提升效率,并创建数学等价数据集MathEquiv训练轻量检测器,在多种任务中显著减少token消耗并提高准确性。

Comments Accepted by ACL 2026

URL PDF HTML 收藏