arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-28 至 2026-01-28 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 20 篇

2502.18771 2026-01-28 cs.LG cs.SI 57%

Exploring Graph Learning Tasks with Pure LLMs: A Comprehensive Benchmark and Investigation

探索纯大语言模型在图学习任务中的应用:全面的基准测试与调查

Yuxiang Wang, Xinnan Dai, Wenqi Fan, Yao Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Michigan State University(密歇根州立大学) The Hong Kong Polytechnic University(香港理工大学) Rensselaer Polytechnic Institute(纽约理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究探讨纯大语言模型在图学习任务中的应用,通过全面的基准测试与分析,发现指令微调的LLMs在少样本设置中表现优异,具备强大的领域迁移能力和良好的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19239 2026-01-28 cs.SE 50%

LLM-based Vulnerability Detection at Project Scale: An Empirical Study

基于大语言模型的项目级漏洞检测:一项实证研究

Fengjie Li, Jiajun Jiang, Dongchi Chen, Yingfei Xiong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了基于LLM的项目级漏洞检测方法,发现其在召回率低的情况下仍能发现更多漏洞,但存在高误报率和计算成本问题。

Comments 19 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19134 2026-01-28 cs.CR cs.SE 50%

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

在亚马逊前沿模型安全框架下评估Nova 2.0 Lite模型

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

专题命中 推理评测 :reasoning(abstract)

AI总结 本文在亚马逊前沿模型安全框架下评估了Nova 2.0 Lite模型,分析其在高风险领域的安全性和性能表现。

Comments Arxiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2601.19447 2026-01-28 cs.CL cs.AI 81%

KG-CRAFT: Knowledge Graph-based Contrastive Reasoning with LLMs for Enhancing Automated Fact-checking

基于知识图谱的对比推理:利用大语言模型增强自动事实核查

Vítor N. Lourenço, Aline Paes, Tillman Weyde, Audrey Depeige, Mohnish Dubey

机构 * Universidade Federal Fluminense(联邦Fluminense大学) Amazon(亚马逊) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KG-CRAFT通过结合知识图谱和大语言模型,提升自动事实核查的准确性与性能。

Comments Accepted to publication at the 19th Conference of the European Chapter of the Association for Computational Linguistics, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-01-28 cs.AI cs.MA 79%

TS-Debate: Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments Code will be available at https://github.com/DeepAuto-AI/TS-Debate

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11811 2026-01-28 cs.CL 79%

Less is More: Compact Clue Selection for Efficient Retrieval-Augmented Generation Reasoning

少即是多:为高效检索增强生成推理设计的紧凑线索选择

Qianchi Zhang, Hainan Zhang, Liang Pang, Yongxin Tong, Hongwei Zheng, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 CompSelect通过紧凑线索选择机制提升RAG推理效率,减少LLM推理成本,优化线索提取与排序。

Comments Accepted to the ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19273 2026-01-28 cs.CL cs.AI cs.IT math.IT 62%

Riddle Quest : The Enigma of Words

谜题 quest:词语的谜题

Niharika Sri Parasa, Chaitali Diwan, Srinath Srinivasa

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种生成和评估基于类比谜题的流程,研究大型语言模型在不同谜题类型中恢复完整答案集的能力,发现模型在推理覆盖和歧义处理方面存在不足。

Comments This paper is submitted under 'Demo track' for WWW conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19825 2026-01-28 cs.AI cs.DB 57%

Routing End User Queries to Enterprise Databases

将用户查询路由到企业数据库

Saikrishna Sudarshan, Tanay Kulkarni, Manasi Patwardhan, Lovekesh Vig, Ashwin Srinivasan, Tanmay Tulsidas Verlekar

机构 * TCS Research(TCS研究机构) Department of CSIS, BITS Pilani KK Birla Goa Campus(计算机科学与信息系统系,比斯科恩理工学院KK Birla Goa校区)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于推理的重新排序策略,通过建模模式覆盖、结构连接性和语义对齐,提升多数据库环境中自然语言查询路由的准确性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19752 2026-01-28 cs.AI 57%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19174 2026-01-28 cs.CR cs.AI 57%

SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks

SHIELD:一种针对LLM资源耗尽攻击的自愈代理防御框架

Nirhoshan Sivaroopan, Kanchana Thilakarathna, Albert Zomaya, Manu, Yi Guo, Jo Plested, Tim Lynar, Jack Yang, Wangli Yang

机构 * The University of Sydney(悉尼大学) Western Sydney University(西部悉尼大学) University of New South Wales(新南威尔士大学) University of Wollongong(沃林戈大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 SHIELD通过多代理自愈机制有效应对LLM资源耗尽攻击,整合语义检索、模式匹配和LLM推理,实现动态知识更新和防御优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18833 2026-01-28 cs.AI cs.SE 57%

Agentic Business Process Management Systems

代理业务流程管理系统

Marlon Dumas, Fredrik Milani, David Chapela-Campa

机构 * University of Tartu(塔尔图大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种整合自主性、推理和学习的代理业务流程管理系统,利用流程挖掘技术实现数据驱动的业务流程管理,重新定义流程自动化和治理的边界。

Comments Presented at the BPM'2025 conference on Artificial Intelligence for Business Process Management (AI4BPM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19231 2026-01-28 cs.CR 50%

LLMs Can Unlearn Refusal with Only 1,000 Benign Samples

LLMs 可通过仅 1000 个无害样本实现拒绝反学习

Yangyang Guo, Ziwei Xu, Si Liu, Zhiming Zheng, Mohan Kankanhalli

专题命中 其他推理 :reasoning(abstract)

AI总结 通过仅 1000 个无害样本,研究发现 LLMs 可通过反学习技术降低拒绝响应,揭示安全性对齐可能依赖 token 序列记忆而非推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18203 2026-01-28 cs.IR 50%

DMAP: Human-Aligned Structural Document Map for Multimodal Document Understanding

DMAP: 人类对齐的多模态文档结构地图用于多模态文档理解

ShunLiang Fu, Yanxin Zhang, Yixin Xiang, Xiaoyu Du, Jinhui Tang

专题命中 其他推理 :reasoning(abstract)

AI总结 DMAP通过构建人类对齐的多模态文档结构地图,提升文档理解的结构化表示和多模态推理能力。

Comments WebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16463 2026-01-28 cs.CR cs.SE 50%

Cutting the Gordian Knot: Detecting Malicious PyPI Packages via a Knowledge-Mining Framework

解开 Gordian 节:通过知识挖掘框架检测恶意 PyPI 包

Wenbo Guo, Chengwei Liu, Ming Kang, Yiran Zhang, Jiahui Wu, Zhengzi Xu, Vinay Sachidananda, Yang Liu

专题命中 其他推理 :reasoning(abstract)

AI总结 PyGuard 通过知识挖掘框架提升 PyPI 恶意包检测准确率,实现 99.50% 准确率,识别 219 个新恶意包,展示语义理解在跨编程语言中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏