arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45259 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3043 篇

2606.15656 2026-06-16 cs.AI 新提交 57%

Overcoming the Impedance Mismatch: A Theoretical Roadmap for Fusing Foundation Models and Knowledge Graphs

克服阻抗不匹配:融合基础模型与知识图谱的理论路线图

Sahil Rajesh Dhayalkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出“阻抗不匹配”概念,形式化分析基础模型与知识图谱的结构与几何摩擦,通过三级层次分类揭示现有方法的局限,并给出理论路线图实现真正的语义融合。

Comments 12 pages. Accepted at the ACL 2026 4th Workshop on Towards Knowledgeable Foundation Models (https://openreview.net/forum?id=hXDYsNAq8m)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 57%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15563 2026-06-16 cs.AI cs.IT cs.MA math.IT 新提交 57%

Minimal Oversight: Uncertainty-Aware Governance for Delegated AI Systems

最小监督:委托AI系统的不确定性感知治理

Carlos R. B. Azevedo

机构 * Independent Researcher(独立研究员)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 提出最小充分监督原则(MSO),通过Fisher信息流形上的变分法最小化治理负担,导出任务空间的水填充分配,并证明容量定理、局部近似和漂移主导的自律时间标度律,为委托AI系统提供可计算的治理框架。

Comments Companion Python package: pip install minimal-oversight | Code: https://github.com/crbazevedo/delegation-lab | 26 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15500 2026-06-16 cs.AR cs.AI cs.SY eess.SY 新提交 57%

LLM4RTL: Tool-Assisted LLM for RTL Generation

LLM4RTL: 工具辅助的大语言模型用于RTL生成

Jing Jin, Robert Chu, Ning Yan, Masood S. Mortazavi

机构 * UC Riverside(加州大学河滨分校) Futurewei(未来科技)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出JRCRC流水线,利用商业LLM层次结构过滤和优化RTL代码生成数据集,并设计工具辅助架构提升逻辑推理能力,在VerilogEval上超越多数方法,用更小模型达到GPT-4O性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14875 2026-06-16 cs.CL 新提交 57%

Context Compression Is Not One Thing: Readable Symbolic Re-expression vs. Coherent Summary at Matched Budget

上下文压缩并非单一事物:在匹配预算下可读的符号化重新表达与连贯摘要的比较

Sisong Bei, Mikhail L. Arbuzov, Ziwei Dong, Dmitri Kalaev, Alexey Shvets

机构 * Independent Researcher(独立研究员) Palo Alto Networks

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Telegraph English可读符号格式,将检索段落重写为结构化实体关系陈述,在匹配预算下比三种压缩基线及连贯摘要更有效,F1提升13-20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06302 2026-06-16 cs.LG cs.SE 版本更新 57%

Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving

Tangram: 解锁非均匀KV缓存以实现高效的多轮LLM服务

Hyungmin Kim, Minsoo Kim, Hongseok Kim, Jungwook Choi

机构 * Hanyang University(翰林大学) Rebellions Republic of Korea(Rebellions)

专题命中 逻辑推理 :planning(abstract);分类 cs.LG

AI总结 针对多轮LLM服务中KV缓存线性增长导致的GPU内存和带宽压力,提出Tangram系统,通过确定性预算分配、头组页面和提前负载均衡三项技术实现非均匀KV缓存的高效管理,吞吐量提升达2.6倍。

Comments 13 pages. 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03489 2026-06-16 cs.CR cs.AI 版本更新 57%

Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs

从错误中学习:面向安全代码LLM的树状自博弈

Wenqi Chen, Ziyan Zhang, Bin Wang, Lin Liu, Hengheng Zhang, Zhengsu Chen

专题命中 逻辑推理 :self-correction(abstract);分类 cs.AI

AI总结 提出树状自博弈(TSP)框架,将安全代码生成建模为细粒度序列决策过程,通过构建决策树探索安全与脆弱路径,使模型在关键决策节点自我纠正,显著提升代码安全性并实现跨语言泛化。

Comments 18 pages, 3 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14463 2026-06-15 cs.LG 新提交 57%

EM-NeSy: Expectation Maximization for Neurosymbolic Learning

EM-NeSy:神经符号学习的期望最大化

Annegret Seibt, Luc De Raedt, Giuseppe Marra

机构 * Department of Computer Science(计算机科学系) KU Leuven(根特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出EM-NeSy框架,将概率神经符号学习视为期望最大化算法实例,通过概率推理计算符号后验,仅通过神经组件进行梯度更新,实现可扩展且高效的近似推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14145 2026-06-15 cs.CL 新提交 57%

Personal Care Utility: Health as Everyday Infrastructure

个人护理公用设施:健康作为日常基础设施

Mahyar Abbasian, Elahe Khatibi, Saba A. Farahani, Nitish Nagesh, Arshia Ilaty, Hooman Sajjadi, Amir Rahmani, Ramesh Jain

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出个人护理公用设施(PCU)分层事件驱动架构,将健康视为日常基础设施,通过Personicle组织连续信号,分离临床决策与语言表达,以2型糖尿病为例验证其生成实时干预和知识引导的能力。

Comments 12 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10813 2026-06-15 cs.CR cs.CL 版本更新 57%

RedAct: Redacting Agent Capability Traces for Procedural Skill Protection

RedAct: 为程序技能保护而编辑智能体能力痕迹

Shuwen Xu, Zhitao He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 提出RedAct框架,通过定位保护关键信息、重写痕迹并嵌入行为水印,将技能转移率降至无技能基线以下,同时保留审计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02274 2026-06-12 q-bio.QM cs.AI 版本更新 57%

Contextual Invertible World Models: A Neuro-Symbolic Agentic Framework for Colorectal Cancer Drug Response

上下文可逆世界模型:用于结直肠癌药物反应的神经符号智能框架

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang

机构 * School of Electronics, Electrical Engineering and Computer Science(电子工程与计算机科学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出上下文可逆世界模型(CIWM),结合机器学习模拟器与大语言模型推理层,通过逆推理进行CRISPR扰动,揭示KRAS突变在5-氟尿嘧啶耐药中的主导作用及PIK3CA修复的意外效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12387 2026-06-11 cs.DB cs.AI 新提交 57%

TAHOE: Text-to-SQL with Automated Hint Optimization from Experience

TAHOE: 基于经验的自动提示优化文本到SQL系统

Zhiyi Chen, Jie Song, Peng Li

机构 * ByteDance Inc.(字节跳动公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 提出TAHOE系统,通过错误驱动的提示学习管道将调试痕迹转化为结构化提示库,结合策略层建模用户意图,在Spider 2.0-Snow上无需更新参数即可显著提升Text-to-SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05608 2026-06-11 cs.SE cs.AI 版本更新 57%

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

软件工程的终结:AI代理如何根本性地重构软件范式

Zhenfeng Cao

机构 * Lingxi Intelligent Investment (Shenzhen) Development Co., Ltd.(灵犀智能投资(深圳)发展有限公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过第一性原理分析,论证了以LLM为推理引擎的AI代理系统正在根本性地重构软件范式,从传统软件(代码承载决策逻辑)转向代理系统(代码作为临时工具),并提出了代理工程作为新兴学科。

Comments 15 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14764 2026-06-11 cs.AI cs.HC cs.LO 版本更新 57%

An XAI View on Explainable ASP: Methods, Systems, and Perspectives

可解释ASP的XAI视角:方法、系统与展望

Thomas Eiter, Tobias Geibinger, Zeynep G. Saribatur

机构 * Institute of Logic and Computation, TU Wien, Austria(逻辑与计算研究所,维也纳技术大学,奥地利)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文从XAI视角综述回答集编程(ASP)的解释方法,分类解释类型并评估现有理论与工具的覆盖范围,指出研究空白与未来方向。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14463 2026-06-10 cs.CL 版本更新 57%

An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs

一个工业级保险大语言模型,实现可验证的领域掌握与幻觉控制,无能力权衡

Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin

机构 * Ant Group(蚂蚁集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出INS-S1保险专用大语言模型,通过可验证数据合成系统和渐进式SFT-RL课程框架,在领域任务上达到SOTA,同时保持通用能力并实现0.6%的低幻觉率。

Comments 21 pages, 12 figures, 17 tables

Journal ref ICLR 2026 Workshop Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09366 2026-06-09 cs.CL eess.AS 新提交 57%

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

文本就是一切?文本作为语音大语言模型的通用信息瓶颈

Ming-Hao Hsu, Yuxuan Hu, Shujie Liu, Jinyu Li, Yan Lu, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18050 2026-06-09 cs.AI cs.LO 版本更新 57%

The Topological Dual of a Dataset: A Logic-to-Topology Encoding for AlphaGeometry-Style Data

数据集的拓扑对偶:一种逻辑到拓扑的编码用于AlphaGeometry风格的数据

Anthony Bordg

机构 * Huawei Lagrange Center(华为拉格朗日中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种逻辑到拓扑的编码方法,用于揭示模型潜在空间的结构不变性,通过逻辑观察的对偶性,为神经符号AI提供解释路径。

Comments Company decision as a precautionary measure while a third-party dispute is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22793 2026-06-09 cs.AI 版本更新 57%

Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI

信号不是状态:面向文化意识课堂AI的神经符号安全机制

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NSCR框架,通过神经符号方法处理课堂多模态信号,区分可观测证据与文化负载解读,减少文化偏见对课堂AI的负面影响。

Comments Accepted at the Workshop on Stereotypes Across Cultures in Language Technologies @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05804 2026-06-05 cs.CL 57%

Can LLMs Be Constrained to the Past? Improving Knowledge Cutoff through Recall-Based Prompting

LLMs 能否被约束到过去?通过基于回忆的提示改进知识截止

Michiro Asai, Ailiang Lin, Yu Kishimoto, Takao Obi, Satoshi Kosugi, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出两种基于回忆的提示策略(Self-Recall 和 Question-Recall)来改进大语言模型在知识截止约束下的表现,在反事实问题上尤其有效,并构建了多截止历史事件基准(MHEB)进行鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05201 2026-06-05 cs.LG 57%

State commitment learning: training language models to distinguish computation from memory

状态承诺学习:训练语言模型区分计算与记忆

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出状态承诺学习目标及反事实擦除强化学习(CERL)方法,通过训练模型区分应保留的持久状态与可丢弃的临时计算,减少推理对隐藏思维的依赖,在数学、长链逻辑、科学问答和多轮工具使用任务中保持准确率的同时降低依赖。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04325 2026-06-04 cs.CL 57%

Parameter-Efficient Fine-Tuning with Learnable Rank

可学习秩的参数高效微调

Arpit Garg, Simon Lucey, Hemanth Saratchandran

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出LR-LoRA方法,通过训练过程中学习适配器秩而非固定秩,在语言理解和常识推理基准上达到最先进性能。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29928 2026-06-04 cs.HC cs.AI 57%

Label Over Logic? How Source Cues Bias Human Fallacy Judgments More Than LLMs

标签胜过逻辑?源标签如何比LLMs更严重地偏差人类的谬误判断

Mahjabin Nahar, Nafis Irtiza Tripto, Aiping Xiong, Ting-Hao 'Kenneth' Huang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 通过在线实验和LLM对比,发现人类在评估逻辑谬误时显著受到内容源标签(如人类、AI等)的影响,而LLM评估相对稳定,表明源标签偏差主要是人类的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03956 2026-06-04 cs.MA cs.CL 57%

Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems

使用约束引导的多智能体系统解决斑马谜题

Shmuel Berman, Kathleen McKeown, Baishakhi Ray

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学)

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 提出一种多智能体系统ZPS,结合大语言模型与定理证明器,通过分解问题、生成SMT代码和智能体间反馈,显著提升复杂逻辑谜题的解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01665 2026-06-02 cs.LG 57%

Quantifying the Energy Floor: Direct Measurement and Replay Buffer Bias in SAC-Based HVAC Control on sbsim

量化能量下限:基于sbsim的SAC HVAC控制中的直接测量与回放缓冲区偏差

Bo Li, Chen Zhang

机构 * Shanghai Jiao Tong University College of Smart Energy(上海交通大学智能能源学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.LG

AI总结 通过最小动作实验直接测量SAC HVAC控制中的能量下限,发现回放缓冲区初始化是次优性的主要来源,消除后可将成本降至接近下限。

Comments 5 pages, 3 figures, 2 tables. Presented at AI-DEEDS 2026 Workshop, ACM Sustainability Week, Banff, Canada (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00756 2026-06-02 cs.AI 57%

CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems

CoMIC:云边系统中长周期LLM代理的协作记忆与洞察循环

Yannan Wang, Longli Yang, Zhen Liu, Abhishek Kumar, Carsten Maple

机构 * Beijing Jiaotong University(北京交通大学) The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 提出无需参数更新的云边框架CoMIC,通过集中式反思与分布式执行设计,利用语义子目标标识实现跨代理经验聚合,提升弱边缘代理在长周期任务中的进展率和动作基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00750 2026-06-02 cs.CL 57%

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性

Dasen Dai, Biao Wu, Meng Fang, Shuoqi Li, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS University of Liverpool(利物浦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00518 2026-06-02 cs.AI 57%

Acting with AI: An Interaction-Based Framework for Agentic Tort Liability

与AI行动:基于交互的代理侵权责任框架

Yiheng Yao

机构 * Yiheng Yao(姚艺恒)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文基于Bratman规划理论和普通法人类协同行动原则,提出一种交互分类框架(自主漂移、纯工具使用、协作规划)来分配AI代理系统的侵权责任,并引入“合理代理”标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29977 2026-06-02 cs.CV cs.LG 57%

EVL-ECG: Efficient ECG Interpretation With Multi-Aspect Heterogeneous Knowledge Distillation

EVL-ECG:面向多视角异构知识蒸馏的高效心电图解读

Dang Nguyen Hong, Nhi Ngoc-Yen Nguyen, Huy-Hieu Pham

机构 * University of Notre Dame(诺丁汉大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出EVL-ECG框架,通过多头交叉注意力对齐、最优传输视觉特征匹配和几何结构关系匹配三种创新方法,实现跨架构知识蒸馏,在资源受限环境下高效解读心电图。

Comments 7Accepted at the SD4H Workshop at ICML 2026. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22999 2026-06-02 cs.CL 57%

PaperVoyager : Building Interactive Web with Visual Language Models

PaperVoyager:利用视觉语言模型构建交互式网页

Dasen Dai, Biao Wu, Meng Fang, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS(UTS大学) University of Liverpool(利物浦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出PaperVoyager框架,将研究论文自动转化为可执行的交互式网页系统,通过显式建模机制和交互逻辑,显著提升生成系统的质量。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI 57%

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏