arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-05-11 至 2026-05-11 共收录 17
2605.08070 2026-05-11 cs.AI

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)

AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08048 2026-05-11 cs.CL

Accurate and Efficient Statistical Testing for Word Semantic Breadth

精确且高效的词义广度统计检验

Yo Ehara

机构 * Tokyo Gakugei University(东京大学)

AI总结 本文提出一种基于Householder对齐的置换检验方法,用于区分词义广度与方向差异,降低I类错误并提升效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07925 2026-05-11 cs.CL

How Value Induction Reshapes LLM Behaviour

价值观诱导如何重塑大语言模型行为

Arnav Arora, Natalie Schluter, Katherine Metcalf, Maartje ter Hoeve

机构 * University of Copenhagen(哥本哈根大学) Apple(苹果公司)

AI总结 研究探讨价值观诱导对大语言模型行为的影响,发现诱导价值观会引发其他相关或对立价值观的表达,提升安全性,但增加拟人化语言使用,导致模型更易产生验证性和趋炎附势倾向。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07606 2026-05-11 cs.CL cs.AI

Nürnberg NLP at PsyDefDetect: Multi-Axis Voter Ensembles for Psychological Defence Mechanism Classification

Nürnberg NLP在PsyDefDetect中的多轴投票集成:心理防御机制分类

Philipp Steigerwald, Eric Rudolph, Jens Albrecht

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学)

AI总结 本文提出多轴投票集成方法,通过类粒度、训练方法和基模型三个维度提升心理防御机制分类效果,系统在隐藏测试集上达到0.420的F1分数,排名第一。

Comments Accepted at the BioNLP 2026 PsyDefDetect Shared Task @ ACL 2026 (1st place, 21 registered teams)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23032 2026-05-11 cs.CL cs.AI cs.LG

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

链式推理真的不可解释性吗?链式推理可以在不提示 verbalization 的情况下保持忠实

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文挑战了链式推理的忠实性定义,指出基于提示注入的偏差特征指标过于狭隘,通过新指标显示推理预算影响提示 verbalization,并通过因果中介分析证明非 verbalized 提示可通过链式推理影响预测,呼吁更广泛的可解释性工具。

Comments Accepted to ACL 2026. 23 pages, 29 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07250 2026-05-11 cs.CV cs.AI

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07248 2026-05-11 cs.CL cs.LG

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

PaT:在试后进行规划以实现高效的测试时间代码生成

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

AI总结 本文提出PaT方法,通过在试后规划来提高测试时间代码生成的效率,采用异构模型配置在多个基准和模型家族中显著提升了成本性能帕累托前沿。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07201 2026-05-11 cs.CL cs.AI cs.LG

PSK@EEUCA 2026: Fine-Tuning Large Language Models with Synthetic Data Augmentation for Multi-Class Toxicity Detection in Gaming Chat

PSK@EEUCA 2026: 通过合成数据增强微调大语言模型用于游戏聊天中的多类毒性检测

Srikar Kashyap Pulipaka

机构 * Independent Researcher(独立研究员)

AI总结 本文提出通过合成数据增强微调大语言模型,用于游戏聊天中的多类毒性检测,实验结果显示在测试集上达到0.6234的F1-macro分数,发现验证性能高反而导致测试转移差的'验证陷阱'现象。

Comments Accepted to the EEUCA workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07172 2026-05-11 cs.CL

Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

基于拓扑的大型语言模型对齐:轨迹拓扑损失与拓扑偏好优化

Yurui Pan, Ke Xu, Bo Peng

机构 * School of Computing and Intelligent Innovation, Fudan University(复旦大学计算与智能创新学院) School of Economics and Management, Tongji University(同济大学经济与管理学院) College of Information Technology, Shanghai Ocean University(上海海洋大学信息学院)

AI总结 本文提出基于拓扑的对齐框架,通过轨迹拓扑损失和拓扑偏好优化提升大型语言模型的对齐性能,实验表明其在自动偏好指标和LLM判断评估中优于传统方法。

Comments Accepted to ACL 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06886 2026-05-11 cs.CL

TajPersLexon: A Tajik-Persian Lexical Resource and Hybrid Model for Cross-Script Low-Resource NLP

TajPersLexon:一种塔吉克-波斯语词汇资源和混合模型用于跨脚本低资源NLP

Mullosharaf K. Arabov

机构 * Institute of Computational Mathematics and Information Technologies(计算数学与信息科技学院)

AI总结 本文提出TajPersLexon,一个包含40112词对的塔吉克-波斯语平行词汇资源,通过混合模型在低资源环境下实现跨脚本词检索与对齐,取得96.4%准确率。

Comments Published in The Proceedings of the First Workshop on NLP and LLMs for the Iranian Language Family (SilkRoadNLP 2026), pages 29-37, Rabat, Morocco. Association for Computational Linguistics

Journal ref Proceedings of the First Workshop on NLP and LLMs for the Iranian Language Family (SilkRoadNLP 2026), pages 29-37

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06716 2026-05-11 cs.AI cs.CL

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11121 2026-05-11 cs.CL

BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection

BITS Pilani 在 SemEval-2026 任务 9:基于 DPO 细调的结构化监督微调用于极化检测

Atharva Gupta, Dhruv Kumar, Yash Sinha

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,瓦拉纳西,印度)

AI总结 本文提出结合结构化监督微调与 DPO 细调的方法,用于社交媒体文本中的极化检测,通过 LoRA 微调 Qwen 2.5-7B-Instruct 并利用自动偏好对减少误判,最终在英文测试集上达到 0.7664 的 Macro-F1 分数。

Comments Accepted to the 20th International Workshop on Semantic Evaluation (SemEval-2026), to be held in conjunction with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02805 2026-05-11 cs.CL cs.AI

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher:通过端到端强化学习训练LLM进行推理、搜索和管理内存

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司)

AI总结 MemSearcher通过端到端强化学习训练LLM进行推理、搜索和内存管理,通过维护紧凑的记忆在多轮交互中保持上下文长度稳定,优于基于历史拼接的基线方法。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07926 2026-05-11 cs.CL

Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation

全面性指标用于文本生成中事实回忆的自动评估

Adam Dejl, James Barry, Alessandra Pascale, Javier Carnerero Cano

机构 * Department of Computing, Imperial College London(伦敦帝国学院计算机系) IBM Research(IBM研究院)

AI总结 本文提出三种自动评估指标以评估大语言模型生成文本的全面性,发现端到端方法在效果上优于复杂指标,但牺牲了鲁棒性和可解释性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05085 2026-05-11 cs.CL cs.SD eess.AS

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models

S2S-Arena:评估语音到语音模型的副语言指令遵循

Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec分校) National University of Singapore(新加坡国立大学)

AI总结 S2S-Arena通过四级交互协议和双阶段数据构建流程,评估语音模型在语义理解和副语言表达上的能力,揭示了现有系统在复杂副语言需求下的性能差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏