SPFinder: Improving the Context Length and Scalability for Tracing Known Vulnerability Patches
SPFinder:提升已知漏洞补丁追踪的上下文长度与可扩展性
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 SPFinder是一种用于追踪已知漏洞补丁的可扩展检索框架,通过分层嵌入和三阶段检索解决长上下文与可扩展性问题,在多数据集评估中优于现有方法,可实用关联CVE补丁。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SPFinder:提升已知漏洞补丁追踪的上下文长度与可扩展性
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 SPFinder是一种用于追踪已知漏洞补丁的可扩展检索框架,通过分层嵌入和三阶段检索解决长上下文与可扩展性问题,在多数据集评估中优于现有方法,可实用关联CVE补丁。
图语言:知识图谱如何与大语言模型对话
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。
Comments Accepted to ISWC 2025
LLM辅导器中教学式泄露的可审计发布控制
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。
Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed
LLMBDC:面向生物域的基因本体聚类语言模型
专题命中 推理与问题求解 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract,abstract_cn);分类 cs.AI
AI总结 该研究针对GO富集分析的术语冗余问题,提出无需训练的LLMBDC框架,利用LLM零样本推理聚类GO术语为生物域,在AD和FXS数据集上较基线方法显著提升了聚类性能。
HyperGuide: 用于大型语言模型高效多步推理的双曲引导
机构 * Department of Computer Science(计算机科学系) ; Stony Brook University(石英布鲁克大学) ; Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Yale University(耶鲁大学) ; Department of Data Science(数据科学系) ; New Jersey Institute of Technology(新泽西理工学院) ; Department of Biomedical Informatics(生物医学信息学系)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。
X-KGRank:一种基于知识图谱检索增强的推荐框架,通过模式挖掘与大语言模型重排序实现可解释推荐
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 X-KGRank是一种知识图谱检索增强推荐框架,结合协同过滤与LLM解释,在MovieLens-1M数据集上提升了推荐指标,且小参数LLM可实现相当的解释质量但更易产生事实错误。
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍
机构 * Intel Labs China(英特尔中国实验室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。
Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern
OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架
机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。
Comments Accepted to ICML 2026
推理摘要能透露多少信息?大语言模型的可观测性阶梯
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出大语言模型的可观测性阶梯,通过实验发现有提示时摘要对正确性监测的帮助远小于完整轨迹,可监测性由显示内容和读者共同决定。
Comments 71 pages, 13 figures, 65 tables
大语言模型自适应元推理的认知需求引导
机构 * Thomson Reuters Foundational Research(汤森路透基础研究部) ; Imperial College London(帝国理工学院)
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出无需训练的元推理框架CDS,通过认知量表刻画需求,在三类大模型和六个基准上较直接调用、标准CoT分别提升21.9%、9%准确率,难数学编码任务增益显著。
Comments 21 pages, 3 figures
使用大型语言模型进行创新中的创意生成
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究对比人类与GPT-4生成的大学生适用低价新产品创意,发现AI生成创意平均购买意向更高、跻身前10%的概率是人类的7倍,但新颖性较低,少样本提示效果略优于零样本。
认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架
机构 * Sichuan University(四川大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。
任何房屋任何任务:为抽象人类任务的可扩展长周期规划
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。
多智能体系统中的潜在协作
机构 * University of Washington(华盛顿大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。
Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS
HPFA:基于超图的大语言模型推理配对失败归因
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。
PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力
机构 * Korea University(高丽大学)
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%
基于数字孪生增强多尺度规划的智能体事件响应
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。
Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026
在想象之翼上:用于幽默标题生成的冲突脚本多角色框架
机构 * Hong Kong Baptist University(香港 Baptist 大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。
Comments Paper published as a conference paper at ICLR 2026
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) ; Oxford University Innovation(牛津大学创新公司) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所) ; King’s College London(伦敦国王学院)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。
用于推理增强型语言模型的综合FP8训练方案
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出整合持续预训练与监督微调的端到端FP8训练方案,通过混合粒度量化实现高效无损失训练,效率较BF16提升显著,将发布代码推动大规模模型训练普及。
Comments This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented
超越均值:面向大语言模型推理的多时刻策略优化
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。
无人机数学推理:基于检索增强生成的方法用于复杂算术推理
机构 * Department of Computer Science(计算机科学系) ; Institute For Artificial Intelligence(人工智能研究所) ; Hamm-Lippstadt University of Applied Sciences(哈姆-利普施塔特应用科学大学) ; University of Stuttgart(斯图加特大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.AI
AI总结 本文提出RAG-UAV框架,通过引入领域文献提升LLM在无人机任务中的数学推理能力,实验表明检索显著提高准确率并减少错误选择。
Comments 15 pages, 7 figures, 4 appendix subsections
Journal ref ICLR 2026 Workshop on Logical Reasoning of Large Language Models
对AR和扩散LLM中逐层表示能力的比较分析
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文比较了AR和扩散LLM的表示能力,发现扩散模型产生更全局的表示,而AR模型产生紧密耦合的局部表示,扩散训练引入深度冗余以实现原理性压缩。
Comments v4: improving writing and adding Qwen2.5-Instruct results with all v3 changes
将推理痕迹提炼为软件工程任务的建议提示词
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI
AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。
CoT-Core:通过感知思维链的核心集选择加速大语言模型评估
机构 * Nanjing University(南京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。
Comments 23 pages, 3 figures, 10 tables. Includes appendix
地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用
专题命中 推理与问题求解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。
Comments 34 pages, 4 figures, and 10 tables
ReasonCast:面向可解释时间序列预测的推理方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。
从‘我们’到‘我’:基于演绎推理的理论指导叙事转变
机构 * Syracuse University(苏塞克斯大学) ; Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。
SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力
机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract)
AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。