arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

至 收录 155
2607.00008 2026-07-02 cs.IR cs.AI 新提交

SchemaRAG: Dynamic Large Schema Reduction for LLM-driven Structured Information Extraction

SchemaRAG:面向LLM驱动的结构化信息提取的动态大规模模式缩减

Sin Yu Bonnie Ho, Arlie Coles, Erik Larsson, Eric Marshall, Nathan Bodenstab, Paul Vozila

AI总结 针对大规模模式导致LLM提取结构化信息时成本高、性能下降的问题,提出SchemaRAG框架,通过检索增强动态缩减输出模式空间,在医疗和电商数据集上实现F1提升8.8%、延迟降低47%、令牌成本降低48%。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), pages 1114-1127, San Diego, California, USA, July 2026. Association for Computational Linguistics

URL PDF HTML 收藏
2607.00464 2026-07-02 cs.LG cs.CL 新提交

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

URL PDF HTML 收藏
2607.00862 2026-07-02 cs.CL cs.AI 新提交

CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models

CAT:面向大型推理模型高效推理的置信度自适应思考

Qizhi Jiang, Shuo Wang, Pei Ke, Yuhang Song, Ke Qin

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省泛在智能与可信服务重点实验室)

AI总结 提出置信度自适应思考(CAT)框架,利用模型内在自确信信号作为置信度,通过偏好优化自主调节推理长度,在保持准确率的同时压缩简单问题的推理开销。

Comments Accepted at ACL 2026 Industry Track

URL PDF HTML 收藏
2607.00083 2026-07-02 cs.CL cs.AI cs.LG 新提交

Harnessing the Latent Space: From Steering Vectors to Model Calibrators for Control and Trust

利用潜在空间:从引导向量到模型校准器以实现控制与信任

Nishant Subramani

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

AI总结 本文提出利用潜在空间中的引导向量控制语言模型行为,并开发基于潜在空间的模型校准器评估输出可信度,从而增强模型的可控性与可靠性。

Comments ACL 2026 (BigPicture Workshop)

URL PDF HTML 收藏
2606.32029 2026-07-01 cs.CL cs.AI 新提交

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

当LLM粗心阅读表格时:测量并减少数据引用错误

Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala

机构 * University of Southern California(南加州大学) AWS AI Labs(AWS AI实验室)

AI总结 本研究系统评估了大型语言模型在表格任务中的数据引用错误,并提出基于批评模型的过滤与拒绝采样方法,将答案准确率提升高达12.0%。

Comments ACL 2026 (Oral)

URL PDF HTML 收藏
2606.31167 2026-07-01 cs.RO cs.AI 新提交

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

URL PDF HTML 收藏
2606.31156 2026-07-01 cs.IR cs.AI 新提交

One Retrieval to Cover Them All: Co-occurrence-Aware Knowledge Base Reorganization for Session-Level RAG

一次检索覆盖所有:基于共现感知的知识库重组用于会话级RAG

Shivam Ratnakar, Yixuan Zhu, Cecilia Cheng, Chaya Vijayakumar

机构 * University of Southern California(南加州大学)

AI总结 针对会话级信息需求,提出基于共现聚类的知识库离线重组和查询时扩展检索候选的方法,将单次查询会话覆盖率从41%提升至58%,并压缩知识库至原大小的20%。

Comments Accepted to the Towards Knowledgeable Foundation Models (KnowFM) Workshop at ACL 2026

URL PDF HTML 收藏
2606.31039 2026-07-01 cs.CL 新提交

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

真相还是诡辩?LoFa:大语言模型对逻辑谬误鲁棒性的基准测试

Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) South China University of Technology(华南理工大学)

AI总结 提出LoFa基准,通过多智能体管道生成事实与谬误配对,结合多轮辩论框架评估LLM对逻辑谬误的鲁棒性,并设计LFR@k指标量化抵抗能力。

Comments Accepted to ACL 2026 Main. 33 pages (9 pages main text)

URL PDF HTML 收藏
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

URL PDF HTML 收藏
2606.27380 2026-06-29 cs.CL 新提交

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

自动演讲辅导系统综述:系统、方法与开放挑战

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司) RoleGaku

AI总结 本文综述自动演讲辅导系统,提出五维任务分类法,覆盖发音、韵律、节奏和内容忠实度,并分析TTS示例生成与诊断方法,指出语料稀缺、口音公平和低延迟诊断等挑战。

Comments accepted into the BEA 2026 workshop at ACL

URL PDF HTML 收藏
2606.27330 2026-06-26 cs.CL cs.AI cs.CV cs.LG 新提交

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning

通过自主经验探索与事后经验利用赋能GUI智能体任务规划

Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 提出PEEU方法,通过自主探索环境发现经验并利用事后经验合成严格对齐的高层训练数据,提升小型多模态大语言模型在GUI任务中的规划与跨网站泛化能力。

Comments Accepted to ACL 2026 Main

URL PDF HTML 收藏
2606.27287 2026-06-26 cs.AI 新提交

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

大型语言模型在自动化简历筛选中的提示注入:单注入与多注入设置

Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin

AI总结 研究LLM在简历筛选中的提示注入攻击,发现当简历质量同质且注入者少时有效,但随注入者增多效果消失;质量异质时虽平均效果减弱,但偶尔让低质量候选人超越高质量,引发公平问题。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

URL PDF HTML 收藏
2606.26775 2026-06-26 cs.CL cs.LG 新提交

Evaluation Pitfalls and Challenges in Multimedia Event Extraction

多媒体事件抽取中的评估陷阱与挑战

Philipp Seeberger, Steffen Freisinger, Tobias Bocklet, Korbinian Riedhammer

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡应用技术大学)

AI总结 本文系统分析多媒体事件抽取中的评估陷阱,指出数据处理不一致、任务假设不一致和评估设置过于宽松三大问题,通过严格评估框架下的控制实验揭示评估选择对性能的显著影响。

Comments Accepted to ACL 2026

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

URL PDF HTML 收藏
2606.25380 2026-06-25 cs.CL 新提交

A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

多语言语言模型毒性检测与缓解策略综述

Soham Dan, Himanshu Beniwal, Thomas Hartvigsen

机构 * Scale AI Indian Institute of Technology Gandhinagar(印度理工学院甘地讷格尔分校) University of Virginia(弗吉尼亚大学)

AI总结 综述多语言大模型的毒性检测与缓解方法,包括威胁模型、检测方法(跨语言编码器、翻译流水线等)和缓解策略(数据过滤、偏好调优等),指出语言覆盖不均、文化依赖等挑战。

Comments Accepted to the Findings of ACL, 2026

Journal ref Findings of ACL, 2026

URL PDF HTML 收藏
2606.25102 2026-06-25 cs.CL 新提交

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

URL PDF HTML 收藏
2606.24889 2026-06-25 cs.CL cs.SD 新提交

Graph-Based Phonetic Error Correction of Noisy ASR

基于图的噪声ASR语音错误纠正

Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik

机构 * Sony Research India(索尼印度研究院)

AI总结 提出G-SPIN框架,结合图神经网络构建音近候选集,并用掩码语言模型和指令调优大语言模型进行上下文重排序,以纠正ASR中结构化的音近错误。

Comments Accepted at ACL Industry Track 2026

URL PDF HTML 收藏
2606.24644 2026-06-24 cs.CL cs.HC 新提交

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

测量用户在人机协作中对语音翻译的心理模型

HyoJung Han, Nishant Balepur, Jordan Boyd-Graber, Marine Carpuat

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 通过跨语言问答框架研究用户对语音翻译系统的心理模型,发现用户通过实践和源语言知识能更好地预测系统错误,且提供语音转录有助于改善心理模型。

Comments ACL2026

URL PDF HTML 收藏
2606.24501 2026-06-24 cs.CL 新提交

UOL@IDEM at BEA 2026 Shared Task 1: Neural Fusion and Feature-Rich Modeling for L1-Aware Vocabulary Difficulty Prediction

UOL@IDEM 在 BEA 2026 共享任务1:面向L1感知词汇难度预测的神经融合与特征丰富建模

Nouran Khallaf, Serge Sharoff

机构 * Centre for Translation, Localisation and Interpreting Studies, School of Languages, Cultures and Societies, University of Leeds(利兹大学语言、文化与社会学院翻译、本地化与口译研究中心) Alexandria University(亚历山大大学)

AI总结 提出一种结合多语言上下文表示与工程化特征的回归模型,用于预测L1感知的词汇难度,在西班牙语、德语和中文上取得优于基线的RMSE结果。

Comments Published at BEA2026, 21st Workshop on Innovative Use of NLP for Building Educational Applications, at ACL, July 2026, San Diego

URL PDF HTML 收藏
2606.24259 2026-06-24 cs.CL cs.AI 新提交

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估

Noor Islam S. Mohammad, Ulug Bayazit

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。

Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT

URL PDF HTML 收藏
2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

URL PDF HTML 收藏
2606.23764 2026-06-24 cs.MA cs.AI 新提交

Emergent Relational Order in LLM Agent Societies: From Collective Affect to Authority Stratification

LLM智能体社会中的涌现关系秩序:从集体情感到权威分层

Zhiyuan Ji, Xinyu Chen, Ziqi Dai, Shiyun Tang, Chunyu Wei, Yueguo Chen

机构 * Renmin University of China(中国人民大学) Beihang University(北京航空航天大学) Minzu University of China(民族大学)

AI总结 基于情感控制理论、社会认同理论和涂尔干集体情感,提出CAREB-MAS多智能体框架,通过长期模拟自发再现差序格局的五种核心现象,支持将差序格局解释为社会机制的结构敏感性涌现结果。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. 37 pages

URL PDF HTML 收藏
2606.23693 2026-06-24 cs.CL cs.IR 新提交

EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL

EXPO-SQL:基于执行的子句级策略优化用于文本到SQL

Jaehoon Lee, CheolWon Na, Suyoung Bae, Jin-Seop Lee, Jihyung Lee, YunSeok Choi, Jee-Hyong Lee

机构 * College of Computing and Informatics(计算与信息学院)

AI总结 提出EXPO-SQL方法,通过子句级奖励实现细粒度监督,解决现有强化学习在文本到SQL任务中粗粒度奖励导致学习信号不足的问题,显著提升性能。

Comments 20 pages, 8 figures

Journal ref ACL 2026 Findings

URL PDF HTML 收藏
2606.23271 2026-06-23 cs.CL 新提交

Scaling LLM Knowledge Boundaries via Distribution-Optimized Synthesis

通过分布优化合成扩展LLM知识边界

Songze Li, Yarong Lan, Zhongpu Bo, Zhaoyang Wang, Zhiqiang Liu, Yuan Yuan, Chengtao Gan, Menghao Qian, Enpei Niu, Xiaoke Guo, Yuanxiang Liu, Zhaoyan Gong, Xiangjin Hu, Liangyurui Liu, Jingdian Lu, Lei Liang, Jun Zhou, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 提出KDoS框架,通过知识密度驱动的三阶段反馈机制优化合成数据的知识分布,显著扩展LLM知识边界,并在多模型和多数据规模上验证了最优分布的稳定性和有效性。

Comments ACL ARR May (EMNLP 2026) Submission

URL PDF HTML 收藏
2606.22783 2026-06-23 cs.IR 新提交

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

打破评估悖论:用计算不可约约束评估高熵搜索

Juntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun, Ke Wang

AI总结 针对LLM穷举搜索评估中因人类无法创建完整标注导致的悖论,提出VERITAS框架,通过计算不可约约束构造可验证的稀疏答案搜索任务,实现自动生成完美标注测试用例并精确控制难度。

Comments 25 pages, 5 figures, Accepted at ACL 2026

URL PDF HTML 收藏
2606.22627 2026-06-23 cs.CL cs.AI 新提交

Orthogonal Representation Editing: Decoupling Semantic Entanglement in Batch Knowledge Editing of LLMs

正交表示编辑:解耦大型语言模型批量知识编辑中的语义纠缠

Wenhao Yu, Zhicong Lu, Bo Lv, Fangyin Ma, Kaiwen Wei, Shihao Yang, Nayu Liu

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Kexin Technology(可心科技) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元) College of Computer Science, Chongqing University(重庆大学计算机学院)

AI总结 针对批量知识编辑中语义表示纠缠导致性能下降的问题,提出正交表示编辑(ORE),通过构建通用语义子空间并对编辑向量施加正交约束来解耦纠缠,并引入门控非线性表示头自适应学习编辑位置,实验表明ORE在跨语言场景中表现优异。

Comments Accepted to Findings of ACL 2026

URL PDF HTML 收藏
2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

URL PDF HTML 收藏
2606.22454 2026-06-23 cs.CL cs.AI 新提交

CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories

机器中的CASPER:LLM生成故事中角色多样性的洞察

Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

AI总结 本文借用叙事学定义,从八个维度分析LLM与人类创作故事中角色的刻画,发现两者在角色类型和多样性上既有相似也有差异。

Comments Proceedings of ACL, 2026

URL PDF HTML 收藏
2606.21939 2026-06-23 cs.CL 新提交

Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

超越价值基准:通过对称Q分类测量大型语言模型中的价值结构对齐

Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室)

AI总结 提出基于Q方法的对称人机评估框架,通过140项道德陈述的强制分布排序,测量LLM价值结构对齐,发现跨家族异质性和局部错位。

Comments 32 pages, 8 figures, 16 tables; accepted to ACL 2026 Main Conference

URL PDF HTML 收藏
2606.21890 2026-06-23 cs.CL cs.AI 新提交

Scaling Performance and Low-Resource Annotation with Many-Shot In-Context Learning for Named Entity Recognition

扩展性能与低资源标注:面向命名实体识别的多示例上下文学习

Qi Zhang, Fangping Lan, Cornelia Caragea, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文研究多示例上下文学习在命名实体识别中的扩展性,发现使用数百示例可使LLM匹配甚至超越监督BERT,并利用约百个人工标注示例生成高质量数据,在低资源NER上提升约10% F1。

Comments ACL 2026 Findings

URL PDF HTML 收藏