arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10304
2512.20626 2026-04-21 cs.AI cs.CL cs.CV cs.IR

MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation

MegaRAG:基于多模态知识图谱的检索增强生成

Chi-Hsiang Hsiao, Yi-Cheng Wang, Tzung-Sheng Lin, Yi-Ren Yeh, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程系) Department of Mathematics, National Kaohsiung Normal University(高雄师范大学数学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心) E.SUN Financial Holding Co., Ltd.(E.SUN财务公司)

AI总结 MegaRAG通过引入多模态知识图谱,提升大语言模型在跨模态推理中的内容理解能力,在文本和多模态语料中均优于现有RAG方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12643 2026-04-21 cs.CL

LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases

LexRel:中国民事案件法律关系抽取基准测试

Yida Cai, Ranjuexiao Hu, Huiyuan Xie, Chenyang Li, Yun Liu, Yuxiao Ye, Zhenghao Liu, Weixing Shen, Zhiyuan Liu

机构 * Tsinghua University(清华大学) Peking University(北京大学) University of Glasgow(格拉斯哥大学) Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Northeastern University(东北大学)

AI总结 本文提出LexRel基准,用于评估法律关系抽取任务,揭示当前大语言模型在识别民事法律关系上的不足,并展示显式整合法律关系信息对下游法律AI任务的积极影响。

Comments Accepted to ACL 2026 (main conference). 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07129 2026-04-21 cs.CL cs.AI cs.LG

LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging

LoRA on the Go:实例级动态LoRA选择与合并

Seungeon Lee, Soumi Das, Manish Gupta, Krishna P. Gummadi

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特研究所) Microsoft, India(微软公司,印度)

AI总结 LoRA on the Go通过实例级动态选择和合并适配器,在无需额外训练的情况下提升多任务性能,实验证明其在多个NLP基准和数据集上表现优异。

Comments Accepted as a main conference paper in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22215 2026-04-21 cs.IR cs.CV

Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy

混合向量检索用于视觉丰富文档:结合单向量效率和多向量准确性

Juyeon Kim, Geon Lee, Dongwon Choi, Taeuk Kim, Kijung Shin

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

AI总结 本文提出HEAVEN框架,通过单向量高效检索与多向量精确排序相结合,提升视觉丰富文档检索效率与准确性,同时引入ViMDoc基准测试。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19410 2026-04-21 cs.CL cs.AI

ToMMeR -- Efficient Entity Mention Detection from Large Language Models

ToMMeR -- 从大语言模型中高效实体提及检测

Victor Morand, Nadi Tomeh, Josiane Mothe, Benjamin Piwowarski

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR), Sorbonne Université, CNRS(智能系统与机器人研究所(ISIR),索邦大学,法国国家科学研究中心) LIPN, Université Sorbonne Paris Nord, UMR7030 CNRS(LIPN,巴黎-索邦大学,法国国家科学研究中心) INSPE, UT2J, Univ. Toulouse, IRIT, CLLE UMR5505 UMR5263 CNRS(INSPE,图卢兹大学,IRIT,CLLE法国国家科学研究中心)

AI总结 ToMMeR通过轻量模型验证早期LLM层的提及检测能力,在13个NER基准中实现93%零样本召回率,证明实体提及自然从语言建模中产生。

Comments Accepted at ACL2026 - Code: https://github.com/VictorMorand/llm2ner

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17001 2026-04-21 cs.CL

Vocab Diet: Reshaping the Vocabulary of LLMs via Vector Arithmetic

词汇饮食:通过向量运算重塑大语言模型的词汇

Yuval Reif, Guy Kaplan, Roy Schwartz

机构 * The Hebrew University of Jerusalem(海法大学)

AI总结 本文提出通过向量运算重塑LLM词汇,利用变换向量替代单一词表,减少词汇槽位占用,提升多语言覆盖和多样性,同时保持下游性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16458 2026-04-21 cs.CL

Agree, Disagree, Explain: Decomposing Human Label Variation in NLI through the Lens of Explanations

一致、分歧、解释:通过解释的视角分解自然语言推理中的人类标注变异

Pingjun Hong, Beiduo Chen, Siyao Peng, Marie-Catherine de Marneffe, Benjamin Roth, Barbara Plank

机构 * Faculty of Computer Science, UniVie(维也纳大学计算机科学系) Doctoral School Computer Science, Faculty of Philological and Cultural Studies, University of Vienna, Austria(维也纳大学哲学与文化研究系计算机科学博士学院) MaiNLP, Center for Information and Language Processing, LMU Munich, Germany(慕尼黑大学信息与语言处理中心MaiNLP) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心) FNRS, CENTAL, UCLouvain, Belgium(比利时列日大学FNRS、CENTAL)

AI总结 本文通过分析解释视角,探讨自然语言推理中人类标注变异的多样性,揭示标注者在推理类别和标签上的分歧,强调推理类别一致性比标签一致性更能反映解释的语义相似性。

Comments Accepted by ACL 2026 Findings, 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16054 2026-04-21 cs.CR cs.CL

Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning

Privacy-R1: 通过强化学习实现隐私意识的多LLM代理协作

Zheng Hui, Yijiang River Dong, Sanhanat Sivapiromrat, Ehsan Shareghi, Nigel Collier

机构 * University of Cambridge(剑桥大学) University College London(伦敦大学学院)

AI总结 本文提出Privacy-R1框架,通过强化学习动态路由文本块,在隐私泄露与任务性能间取得平衡,引入医疗数据集验证方法有效性,实现隐私-效用前沿的新状态。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09351 2026-04-21 cs.CL

ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering

ReTraceQA:评估小语言模型在常识问答中的推理轨迹

Francesco Maria Molfese, Luca Moroni, Ciro Porcaro, Simone Conia, Roberto Navigli

机构 * Sapienza NLP Group(萨皮恩扎大学自然语言处理小组) Sapienza University of Rome(罗马萨皮恩扎大学)

AI总结 ReTraceQA通过引入过程级评估,揭示小语言模型在常识推理中存在大量推理过程错误,但最终答案正确的情况,表明现有评价方法高估了模型能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09275 2026-04-21 cs.CL cs.AI

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation

卓越还是真实表现?通过动态评估重新思考医疗诊断基准

Xiangxu Zhang, Lei Li, Yanyun Zhou, Xiao Zhou, Yingying Zhang, Xian Wu

机构 * GSAI, Renmin University of China(清华大学人工智能研究院,中国人民大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部)

AI总结 本文提出DyReMe动态基准,通过生成临床相关干扰因素的咨询式案例,评估医疗诊断模型的鲁棒性,揭示现有模型在临床干扰下的不足。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08878 2026-04-21 cs.SD cs.AI cs.CL eess.AS

ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling

ControlAudio:通过渐进扩散建模解决文本引导、时间指示和可理解音频生成

Yuxuan Jiang, Zehua Chen, Zeqian Ju, Yusheng Dai, Weibei Dou, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu AI(盛舒AI) University of Science and Technology of China(中国科学技术大学) Monash University(墨尔本大学)

AI总结 ControlAudio通过多任务学习和渐进扩散建模,实现文本、时间及音素特征的精细控制,提升音频生成的时序精度和语音清晰度,达到当前最优水平。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08252 2026-04-21 cs.IR cs.CL

ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval

ReasonEmbed:用于推理密集型文档检索的增强型文本嵌入

Jianlyu Chen, Junwei Lan, Chaofan Li, Defu Lian, Zheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出ReasonEmbed,通过ReMixer合成数据、Redapter自适应学习算法和多规模backbone实现,提升推理密集型检索性能,其中ReasonEmbed-Qwen3-8B在BRIGHT基准上取得38.1的nDCG@10高分。

Comments 19 pages, 3 figures; Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07761 2026-04-21 cs.CL

Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers

测试时推理器是战略性的多选题答题者

Nishant Balepur, Atrey Desai, Rachel Rudinger

机构 * University of Maryland(马里兰大学) New York University(纽约大学)

AI总结 本文研究了测试时推理器在多选题回答中的策略性表现,发现其在全输入和仅选项输入下均能提升准确性,挑战了部分输入成功总是缺陷的观点。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07591 2026-04-21 cs.CL

Creating ConLangs to Probe the Metalinguistic Grammatical Knowledge of LLMs

创建ConLangs以探测LLMs的元语言语法知识

Chihiro Taguchi, Richard Sproat

机构 * University of Notre Dame(诺特达美大学) Sakana AI(萨卡纳人工智能) Notre Dame, IN, USA(印第安纳州诺特达美) Tokyo, Japan(日本东京)

AI总结 本文提出IASC系统,通过LLMs生成构造语言,探讨LLMs对语言和语言学概念的理解能力,实验显示不同LLM和语言规范在形态语法能力上有显著差异。

Comments 53 pages, 18 tables, 3 figures. Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06700 2026-04-21 cs.CL

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02025 2026-04-21 cs.CL

Style over Story: Measuring LLM Narrative Preferences via Structured Selection

风格胜过故事:通过结构化选择测量大语言模型的叙事偏好

Donghoon Jung, Jiwoo Choi, Songeun Chae, Seohyon Jung

机构 * School of Digital Humanities and Computational Social Sciences, KAIST(数字人文与计算社会科学学院,韩国科学技术院)

AI总结 通过结构化选择实验测量大语言模型的叙事偏好,发现模型在风格优先于叙事内容方面表现一致,且风格偏好稳定,而内容元素则存在模型间差异和指令敏感性。

Comments Accepted to ACL 2026 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21042 2026-04-21 cs.CL cs.LG

LayerNorm Induces Recency Bias in Transformer Decoders

层归一化在Transformer解码器中诱导近期偏差

Junu Kim, Xiao Liu, Zhenghao Lin, Lei Ji, Yeyun Gong, Edward Choi

机构 * KAIST(韩国科学技术院) Microsoft Research(微软研究院)

AI总结 研究揭示Transformer解码器中层归一化与自注意力机制相互作用导致近期偏差的机制,分析残差连接和输入嵌入分布的影响,提出改进位置编码的新思路。

Comments Codes available at: https://github.com/starmpcc/layernorm_recency_bias

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11290 2026-04-21 cs.CL

SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering

SafeConstellations: 通过任务感知的表示引导缓解大语言模型的过度拒绝行为

Utsav Maskey, Sumit Yadav, Mark Dras, Usman Naseem

机构 * Macquarie University(麦考瑞大学) IOE, Pulchowk Campus(IOE普楚克校区)

AI总结 本文提出SafeConstellations方法,通过任务感知的表示引导在推理时调整表示轨迹,减少大语言模型在处理良性指令时的过度拒绝现象,同时保持模型实用性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07809 2026-04-21 cs.LG

EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning

EvoCoT:克服强化学习中的探索瓶颈

Huanyu Liu, Jia Li, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) Imperial College London(伦敦帝国理工学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 EvoCoT通过两阶段链式思维优化框架,解决强化学习中稀疏奖励下的探索瓶颈问题,提升大语言模型的推理能力。

Comments Camera-ready version for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15586 2026-04-21 cs.CL

Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation

通过强化学习学习提取理性证据以增强检索增强生成

Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Peking University(北京大学)

AI总结 本文提出EviOmni,通过推理先提取证据,结合证据推理与提取,利用强化学习优化生成质量,实验表明其在多个基准数据集上表现优异,提升下游任务准确率。

Comments 23 pages, 8 Figures, 18 Tables; Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12606 2026-04-21 cs.CL cs.AI

An Exploration of Mamba for Speech Self-Supervised Models

对Mamba在语音自监督模型中的探索

Tzu-Quan Lin, Heng-Cheng Kuo, Tzu-Chieh Wei, Hsi-Chun Cheng, Chun Wei Chen, Hsien-Fu Hsiao, Yu Tsao, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Graduate Institute of Communication Engineering(通信工程研究所) Research Center for Information Technology Innovation, Academia Sinica(学术院信息技术创新研究中心) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立台湾大学人工智能卓越研究中心)

AI总结 本文探讨了Mamba在语音自监督学习中的应用,提出基于Mamba的HuBERT模型,相比Transformer架构在长上下文ASR任务中计算更高效,且在流式ASR和SUPERB基准测试中表现更优。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02264 2026-04-21 cs.CL

CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment

通过对话流程对齐构建可解释的任务导向对话系统:CoDial

Radin Shayanfar, Chu Fei Luo, Rohan Bhambhoria, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs, Queen’s University(电气与计算机工程系及Ingenuity实验室,女王大学) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院) Vector Institute for AI(人工智能向量研究所)

AI总结 CoDial通过将预定义任务 schema 转换为结构化异构图并生成程序化 LLM 防御代码,实现对话策略的高效可解释对齐,提升任务导向对话系统的泛化能力与可解释性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23114 2026-04-21 cs.CL

Alignment Data Map for Efficient Preference Data Selection and Diagnosis

用于高效偏好数据选择与诊断的对齐数据图

Seohyeong Lee, Eunwon Kim, Hwaran Lee, Buru Chang

机构 * Sogang University(ソガン大学) Upstage(アップステージ) Korea University(韩国大学)

AI总结 本文提出对齐数据图,通过评估偏好数据的对齐分数,选择高质量低变异性样本,提升对齐效果并提高标注准确性。

Comments ACL 2026 Findings Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15353 2026-04-21 cs.CL

Establishing a Scale for Kullback-Leibler Divergence in Language Models Across Various Settings

在不同设置中为语言模型建立KL散度量表

Ryo Kishino, Yusuke Takase, Momose Oyama, Hiroaki Yamagiwa, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) RIKEN(日本科学技术研究所)

AI总结 本文通过扩展log-likelihood空间,建立统一的KL散度量表,分析预训练轨迹显示log-likelihood空间变化比权重空间更小,导致学习轨迹亚扩散并早稳定语言模型行为。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21248 2026-04-21 cs.CL cs.AI cs.CE

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试

Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。

Comments Accepted by ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14281 2026-04-21 cs.CR cs.LG cs.SE

XOXO: Stealthy Cross-Origin Context Poisoning Attacks against AI Coding Assistants

XOXO:针对AI编码助手的隐蔽跨域上下文污染攻击

Adam Štorek, Mukur Gupta, Noopur Bhatt, Aditya Gupta, Janie Kim, Prashast Srivastava, Suman Jana

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

AI总结 本文提出XOXO攻击,通过隐蔽的跨域上下文污染使AI编码助手生成漏洞代码。引入GCGS算法,利用Cayley图系统搜索变换空间,实现75.72%的攻击成功率,传统防御方法无效。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏