arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5849 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5849 篇

2602.11852 2026-06-02 cs.AI cs.CL cs.LG 67%

Prototype Transformer: Towards Language Model Architectures Interpretable by Design

原型Transformer:迈向可解释设计的语言模型架构

Yordan Yordanov, Matteo Forasassi, Bayar Menzat, Ruizhi Wang, Chang Qi, Markus Kaltenberger, Amine M'Charrak, Tommaso Salvatori, Thomas Lukasiewicz

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出原型Transformer(ProtoT),一种用线性代价原型模块替代二次代价自注意力的自回归语言模型架构,原型自动捕获可命名概念,提升可解释性并支持行为编辑。

Comments Accepted at ICML 2026. Equal contribution: Yordan Yordanov and Matteo Forasassi. 40 pages, 28 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31408 2026-06-01 cs.CL cs.AI cs.LG 67%

Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study

大型语言模型代理中的技能可用性与呈现粒度:一项受控的SkillsBench研究

Xiaonan Xu, Wenjing Wu

机构 * Computer Information Technology, Northern Arizona University(计算机信息科技,北亚利桑那大学) Computer Science, University of Colorado Boulder(计算机科学,科罗拉多大学博尔德分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过受控实验研究技能知识的呈现粒度对下游任务成功率的影响,发现技能可用性显著提升成功率,而呈现粒度变化影响较小且不确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28009 2026-05-28 cs.CL cs.AI cs.LG 67%

MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models

MemGuard:防止长期记忆增强型大语言模型中的记忆污染

Hyeonjeong Ha, Jeonghwan Kim, Cheng Qian, Jiayu Liu, William M. Campbell, Yue Wu, Yuji Zhang, Kathleen McKeown, Dilek Hakkani-Tur, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Capital One

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MemGuard,一种类型感知的记忆框架,通过显式分配功能角色、维护类型隔离记忆间的关联并选择性组合必要类型的证据,防止异构记忆污染,提升记忆可靠性最高28.27%并减少检索token数最高5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27564 2026-05-28 cs.CL cs.AI cs.LG 67%

The Future of Facts: Tracing the Factual Generation-Verification Gap

事实的未来:追踪事实生成-验证差距

Tim R. Davidson, Anja Surina, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过训练阶段分析,发现语言模型在事实知识上存在生成-验证差距,验证能力先于生成能力习得且更稳健,事实更新可能导致模型处于“多宇宙”状态。

Comments Code for this project is available at https://github.com/anjasurina/factgap , blog post at https://www.trdavidson.com/fact-gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06025 2026-05-28 cs.CL cs.AI cs.LG 67%

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

学习面向运行时智能体记忆的查询感知预算层级路由

Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei Qin, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学香槟分校) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 BudgetMem 框架,通过强化学习训练的轻量级路由器实现查询感知的预算层级路由,以在运行时平衡任务性能与记忆构建成本。

Comments Accepted by ICML 2026. Code is available at https://github.com/ViktorAxelsen/BudgetMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15390 2026-05-28 cs.CV 67%

Automatic Pruning Discovery for Large Language Models

大型语言模型的自动剪枝发现

Haidong Kang, Lihong Lin, Enneng Yang, Hongning Dai, Hao Wang

机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern University at Qinhuangdao 066004, Hebei Province, China(河北省海洋感知网络与数据处理重点实验室,秦皇岛东北大学066004,河北省) Sun Yat-sen University, Shenzhen, China(深圳大学) Hong Kong Baptist University, Hongkong, China(香港 Baptist 大学) Xidian University, Xian, China(西安电子科技大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出AutoPrune方法,利用LLMs自动设计剪枝算法,并通过图驱动思维链优化提示,结合偏态感知动态稀疏分配解决高剪枝率下的异常值问题,在主流基准上超越现有方法。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09001 2026-05-21 cs.CL cs.AI cs.LG 67%

Retrospective Sparse Attention for Efficient Long-Context Generation

回顾性稀疏注意力用于高效长上下文生成

Seonghwan Choi, Beomseok Kang, Dongwon Jo, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RetroAttention,一种新的KV缓存更新技术,通过回顾后续解码步骤的KV条目来修正过去的注意力输出,从而提高长上下文生成的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14558 2026-05-15 cs.LG cs.AI cs.CL 67%

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

消除行动瓶颈:由令牌级能量指导的代理强化学习

Langzhou He, Junyou Zhu, Yue Zhou, Zhengyao Gu, Junhua Liu, Wei-Chieh Huang, Henry Peng Zou, David Wipf, Philip S. Yu, Qitian Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Technical University of Berlin(柏林技术大学) University of Southern California(南加州大学) University of Hong Kong(香港大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ActFocus方法,通过令牌级能量建模解决强化学习中令牌级训练信号分配不均的问题,显著提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05306 2026-05-15 cs.LG cs.AI cs.CL 67%

LLMs Should Express Uncertainty Explicitly

大型语言模型应显式表达不确定性

Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

机构 * University of California, Berkeley(加州大学伯克利分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究通过训练使模型在回答时显式表达不确定性,以减少过度自信的错误,提升回答质量,并通过检索增强生成技术改进最终响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15867 2026-05-14 cs.LG cs.AI cs.CL cs.MA 67%

RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records

RDMA: 低成本的代理驱动罕见病挖掘从电子健康记录

John Wu, Adam Cross, Jimeng Sun

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RDMA通过代理框架在电子健康记录中挖掘罕见病,无需特定任务训练,提升性能并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26089 2026-05-12 cs.LG cs.AI cs.CL 67%

Selective Deficits in LLM Mental Self-Modeling in a Behavior-Based Test of Theory of Mind

对LLM心理自我建模能力的有选择性缺陷的测试:基于行为的理论自我认知测试

Christopher Ackerman

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过行为测试探讨LLM在理论自我认知任务中的能力,发现较早的LLM无法完成任务,而较新的LLM在他人认知建模上表现接近人类,但自我建模仍存在缺陷,除非使用推理轨迹辅助。

Comments 22 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07646 2026-05-11 cs.CL cs.AI cs.LG 67%

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN:具有步骤内认知审计的多智能体验证-扩展网络

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng

机构 * Tongji University(同济大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAVEN通过显式角色解耦将LLM转化为有意识的推理者,采用对抗性Skeptic-Researcher-Judge循环,生成可验证的模块化推理轨迹,提升多任务推理质量。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06723 2026-05-11 cs.AI cs.CL cs.LG 67%

When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment

语言模型何时做出承诺?一种有限答案理论的预言语承诺

Long Zhang, Wei-neng Chen, Feng-feng Wei, Zi-bo Qin

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在生成最终答案前的推理过程,通过有限答案偏好稳定化理论分析模型在回答前的承诺时间,发现其在可解析前稳定,且信号可从隐藏状态恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00199 2026-05-08 cs.CL cs.AI cs.IR cs.LG 67%

RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners

RSAT:结构化归因使小型语言模型成为可信表格推理器

Jugal Gajjar, Kamalasankari Subramaniakuppusamy

机构 * Department of Computer Science, The George Washington University, USA(计算机科学系,乔治·华盛顿大学,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RSAT通过结构化归因提升小型语言模型的表格推理可信度,采用SFT和GRPO阶段训练,显著提高推理忠实度并确保引用有效性。

Comments 8 pages, 8 tables, 9 figures, and a 3-page Appendix. Accepted at the SURGeLLM Workshop at ACL 2026 and will be included in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05715 2026-05-08 cs.AI cs.CL cs.LG 67%

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

可解码但无法通过固定残差-流线性引导进行纠正:来自医疗LLM失败模式的证据

Ming Liu

机构 * Amazon(亚马逊)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了LLM隐藏状态中线性可解码的失败信号能否用于纠正失败,通过Overthinking现象发现线性引导无法有效纠正,但可解码的失败结构支持生成后可靠性估计。

Comments 22 pages (14 main + 8 appendix), 5 figures, 7 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27624 2026-05-01 cs.CL cs.AI cs.CY cs.HC cs.LG 67%

Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behavior

映射LLMs在模仿人类性格特征、社会人口统计数据和社会媒体行为时如何辩论社会问题

Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过CDS数据集研究LLMs在不同社会和情境提示下生成的辩论内容变化,分析其社会议题立场和情感表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 67%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01595 2026-04-28 cs.CL cs.AI cs.LG 67%

Always Tell Me The Odds: Fine-grained Conditional Probability Estimation

始终告诉我概率:细粒度条件概率估计

Liaoyaqi Wang, Zhengping Jiang, Anqi Liu, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种最先进的模型,用于在上下文条件下对命题进行细粒度概率估计。通过结合人类和合成数据创建与评估、扩大模型规模和改进监督,提出了一系列强而精确的概率估计模型,在依赖条件概率估计的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22343 2026-04-23 cs.CL cs.AI cs.LG cs.LO 67%

Transformers Can Learn Connectivity in Some Graphs but Not Others

变换器在某些图中可以学习连接性,但在其他图中不行

Amit Roy, Abulhair Saparov

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了变换器在推断传递关系任务中的能力,发现其在网格状图中能有效推断连接性,但对非网格图尤其是具有多个不连通组件的图表现较差。

Comments This paper contains some assumption which is not correct

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18609 2026-04-23 cs.CL cs.AI cs.LG 67%

Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models

任务分层的知识扩展规律用于训练后量化的大语言模型

Chenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出任务分层的知识扩展规律,通过统一模型大小、位宽和细粒度因素,验证了293种不同的训练后量化配置,揭示了不同知识能力对精度、规模和校准的敏感性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19944 2026-04-21 q-fin.TR q-fin.ST 67%

Large Language Models and Stock Investing: Is the Human Factor Required?

大语言模型与股票投资:是否需要人类因素?

Ricardo Crisostomo, Diana Mykhalyuk

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究大语言模型能否生成可靠的股市预测,发现其预测能力受限于推理错误,需人类监督以提升表现。

Comments 33 pages; 6 tables; 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16858 2026-04-21 cs.CV 67%

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

Q-DeepSight:利用图像激励思考用于图像质量评估与细化

Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Q-DeepSight框架,通过多模态链式思考与工具增强证据获取,提升图像质量评估与细化的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21686 2026-04-21 cs.CL cs.AI cs.LG 67%

Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework

矩阵:基于点对点的多智能体合成数据生成框架

Dong Wang, Yang Li, Ansong Ni, Ching-Feng Yeh, Youssef Emad, Xinjie Lei, Liam Robbins, Karthik Padthe, Hu Xu, Xian Li, Asli Celikyilmaz, Ramya Raghavendra, Lifei Huang, Carole-Jean Wu, Shang-Wen Li

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12634 2026-04-15 cs.AI cs.CL cs.LG cs.MA 67%

RPRA: Predicting an LLM-Judge for Efficient but Performant Inference

RPRA:为高效且高性能推断预测一个LLM判断者

Dylan R. Ashley, Gaël Le Lan, Changsheng Zhao, Naina Dhingra, Zhipeng Cai, Ernie Chang, Mingchen Zhuge, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber

机构 * Meta Platforms, Inc.(Meta公司) The Swiss AI Lab IDSIA (USI-SUPSI)(瑞士AI实验室IDSIA) Center of Excellence for Generative AI, KAUST(生成式人工智能卓越中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了通过预测LLM判断者评分来提升小模型推断性能的方法,通过零样本预测、上下文报告卡和监督微调三种方法,发现大模型在零样本预测中表现优异,而小模型通过微调或报告卡显著提升预测准确性,达到最高55%的改进。

Comments 10 pages in main text + 6 pages of references + 36 pages of appendices, 12 figures in main text + 37 figures in appendices, 2 tables in main text + 3 table in appendices, 13 prompts in appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10161 2026-04-14 cs.SD 67%

From Speech to Profile: A Protocol-Driven LLM Agent for Psychological Profile Generation

从语音到档案:一种基于协议的LLM代理用于心理档案生成

Xingjian Yang, Yudong Yang, Zhixing Guo, Yongjie Zhou, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出StreamProfile框架,通过增量处理咨询语音,提取证据并生成可追溯的心理档案,有效避免幻觉和长上下文遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00487 2026-04-14 cs.MA cs.GT cs.SY eess.SY 67%

Competition and Cooperation of LLM Agents in Games

博弈中的大语言模型代理竞争与合作

Jiayi Yao, Cong Chen, Baosen Zhang

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究大语言模型代理在资源分配和Cournot竞争博弈中的行为,发现多轮提示和非零和上下文促进合作,基于公平性推理提出分析框架。

Comments Submitted to CDC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15593 2026-04-14 cs.CL cs.AI cs.LG 67%

Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow

掩码扩散语言模型中的并行性与生成顺序:今日的限制,明日的潜力

Yangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Social Sciences(中国社会科学院大学) Westlake University(西湖大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了八种主流MDLM在58个基准上的表现,发现其并行性和生成顺序受任务领域和正确性影响显著,且在需要逆向信息的任务中表现更优,提出生成后编辑范式以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09494 2026-04-13 cs.CL cs.AI cs.IR cs.LG 67%

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

RecaLLM:通过显式上下文检索解决‘思维迷失’现象

Kyle Whitecross, Negin Rahimi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RecaLLM通过交替推理与显式上下文检索解决推理过程中因长上下文导致的检索性能下降问题,显著提升了RULER和HELMET基准测试表现。

Comments Code, data, and models available at https://github.com/kswhitecross/RecaLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17421 2026-04-09 cs.CL cs.AI cs.LG 67%

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification

LongSpec: 长上下文无损推测解码与高效草稿生成与验证

Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An

机构 * Sea AI Lab(Sea AI实验室) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LongSpec通过三种创新解决长上下文场景下的推测解码问题,实现3.26倍速度提升和2.25倍时间减少,适用于长上下文理解任务。

Comments Accepted by ACL'25 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15195 2026-04-08 cs.CR cs.AI cs.CL cs.LG 67%

Weight space Detection of Backdoors in LoRA Adapters

LoRA适配器中后门的权重空间检测

David Puertolas Merenciano, Ekaterina Vasyagina, Kevin Zhu, Javier Ferrando, Maheep Chaudhary

机构 * Algoverse AI Research Independent(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无需运行模型即可检测LoRA适配器后门的方法,通过分析权重矩阵的谱统计特征,利用逻辑回归分类器在三种模型家族上实现100%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏