arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45335 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3046 篇

2511.06315 2026-03-13 cs.CV 50%

PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models

PuzLM:利用序列到序列语言模型解决拼图问题

Gur Elkin, Ofir Itzhak Shahar, Ohad Ben-Shahar

机构 * Ben-Gurion University of the Negev(贝内-加里翁内盖夫大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PuzLM通过将拼图重组视为序列到序列问题,利用离散符号推理实现高效拼图求解,提升了复杂拼图的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08633 2026-03-10 eess.SY cs.SY 50%

Reachability-based Temporal Logic Verification for Reliable LLM-guided Human-Autonomy Teaming

基于可达性的时序逻辑验证用于可靠的大语言模型引导的人-自主系统协同

Joonwon Choi, Kartik Anand Pant, Karthik Nune, Inseok Hwang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出基于可达性的时序逻辑验证框架,利用LLM将自然语言指令转换为STL规范,通过可行性过滤器确保任务规划的安全性和信息反馈的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18606 2026-03-10 cs.RO cs.CV 50%

OVerSeeC: Open-Vocabulary Costmap Generation from Satellite Images and Natural Language

OVerSeeC: 从卫星图像和自然语言生成开放词汇成本图

Rwik Rana, Jesse Quattrociocchi, Dongmyeong Lee, Christian Ellis, Amanda Adkins, Adam Uccello, Garrett Warnell, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 逻辑推理 :planning(abstract)

AI总结 OVerSeeC通过模块化基础模型实现从卫星图像和自然语言生成开放词汇成本图,支持任务自适应的全球规划。

Comments Website : https://amrl.cs.utexas.edu/overseec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23506 2026-03-06 cs.RO 50%

Ask, Reason, Assist: Robot Collaboration via Natural Language and Temporal Logic

提问、推理、协助:通过自然语言和时序逻辑实现机器人协作

Dan BW Choe, Sundhar Vinodh Sangeetha, Steven Emanuel, Chih-Yuan Chiu, Samuel Coogan, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种基于自然语言和时序逻辑的机器人协作协议,通过LLM实现冲突检测与帮助请求,利用MILP优化选择最优助人,有效提升协作效率。

Comments arXiv admin note: substantial text overlap with arXiv:2505.13376

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01460 2026-03-03 cs.SE 50%

Production-Grade AI Coding System for Client-Side Development

面向客户端开发的生产级AI编码系统

Ruihan Wang, Chencheng Guo, Guangjing Wang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01272 2026-03-03 cs.SE 50%

NeuroSCA: Neuro-Symbolic Constraint Abstraction for Smart Contract Hybrid Fuzzing

NeuroSCA:面向智能合约混合模糊测试的神经符号约束抽象

Haochen Liang, Jiawei Chen, Hideya Ochiai

专题命中 逻辑推理 :verifier(abstract)

AI总结 NeuroSCA通过神经符号约束抽象技术,提升智能合约混合模糊测试的效率和效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17371 2026-03-03 cs.SE 50%

GraphCue for SDN Configuration Code Synthesis

基于图的SDN配置代码合成

Haomin Qi, Fengfei Yu, Chengbo Huang

专题命中 逻辑推理 :verifier(abstract)

AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。

Comments 2 pages, 2 figures

Journal ref IEEE Consumer Communications & Networking Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24275 2026-03-02 cs.CV 50%

Hierarchical Action Learning for Weakly-Supervised Action Segmentation

分层动作学习用于弱监督动作分割

Junxian Huang, Ruichu Cai, Hao Zhu, Juntao Fang, Boyan Xu, Weilin Chen, Zijian Li, Shenghua Gao

机构 * Guangdong University of Technology(广东技术大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Hong Kong(香港大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 HAL模型通过分层因果数据生成和稀疏转换约束,提升弱监督动作分割的识别能力。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21778 2026-03-02 cs.CV 50%

From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors

从静态到动态:基于物理的图像编辑与潜在过渡先验

Liangbing Zhao, Le Zhuo, Sayak Paul, Hongsheng Li, Mohamed Elhoseiny

机构 * CUHK MMLab(香港中文大学多模态实验室)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出PhysicEdit,通过引入物理状态过渡和大规模数据集,提升图像编辑的物理真实性和知识引导能力,达到开源方法的新水平。

Comments All code, checkpoints, and datasets are available at https://liangbingzhao.github.io/statics2dynamics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23005 2026-02-27 cs.SE 50%

Managing Uncertainty in LLM-based Multi-Agent System Operation

在基于大语言模型的多智能体系统操作中管理不确定性

Man Zhang, Tao Yue, Yihua He

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种基于生命周期的不确定性管理框架,用于提升基于大语言模型的多智能体系统在安全关键领域的可靠性和可诊断性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16949 2026-02-24 cs.CY 50%

How should AI knowledge be governed? Epistemic authority, structural transparency, and the case for open cognitive graphs

AI知识应该如何被治理?知识权威、结构透明性与开放认知图的案例

Chao Li, Chunyi Zhao, Yuru Wang, Yi Hu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出开放认知图作为教育AI治理框架,通过结构透明和知识权威管理,实现教育AI与民主问责的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17256 2026-02-20 physics.soc-ph physics.app-ph physics.comp-ph 50%

On the Concept of Violence: A Comparative Study of Human and AI Judgments

关于暴力概念的观念:人类与AI判断的比较研究

Mariachiara Stellato, Francesco Lancia, Chiara Galeazzi, Nico Curti

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文通过比较人类与AI对暴力的判断,探讨了AI如何处理模糊的道德概念及人类解释的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15228 2026-02-18 cs.SE 50%

An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation

对指令微调模型在代码生成中系统提示效果的实证研究

Zaiyu Cheng, Antonio Mastropaolo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究探讨了系统提示对代码生成模型性能的影响,发现提示具体性与模型规模、编程语言等因素相关,且不同语言对提示敏感性存在差异。

Comments 34 pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12569 2026-02-16 cs.HC 50%

Editable XAI: Toward Bidirectional Human-AI Alignment with Co-Editable Explanations of Interpretable Attributes

可编辑的可解释性AI:通过可编辑的可解释属性实现双向人机对齐

Haoyang Chen, Jingwen Bai, Fang Tian, Brian Y Lim

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出可编辑的XAI方法CoExplain,通过允许用户编写规则来提升人机对齐,实验表明其在理解和控制方面优于传统只读XAI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09801 2026-02-11 cs.MA 50%

Tiny Moves: Game-based Hypothesis Refinement

Tiny Moves: 基于游戏的假设精炼

Agnieszka Dobrowolska, Rogier Hintzen, Martin Balla, Karl Gemayel, Sabine Reichert, Thomas Charman, Jen Ning Lim, Lindsay Edwards, Anna Gogleva

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出基于游戏的假设精炼方法,通过LLM代理在共享状态上进行渐进式推理移动,有效提升科学发现中假设修正的精度与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14614 2026-02-10 cs.CR 50%

Towards Cybersecurity Superintelligence: from AI-guided humans to human-guided AI

迈向网络安全超智能:从AI引导的人类到人类引导的AI

Víctor Mayoral-Vilches, Stefan Rass, Martin Pinzger, Endika Gil-Uriarte, Unai Ayucar-Carbajo, Jon Ander Ruiz-Alcalde, Maite del Mundo de Torres, María Sanz-Gómez, Francesco Balassone, Cristóbal R. J. Veas-Chavez, Vanesa Turiel, Alfonso Glera-Picón, Daniel Sánchez-Prieto, Yuri Salvatierra, Paul Zabalegui-Landa, Ruffino Reydel Cabrera-Álvarez, Patxi Mayoral-Pizarroso

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出通过AI引导人类到人类引导AI的网络安全超智能发展路径,展示了PentestGPT、CAI和G-CTR在安全领域的创新与突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07360 2026-02-10 eess.SY cs.SY 50%

In-Context System Identification for Nonlinear Dynamics Using Large Language Models

基于大语言模型的非线性动力学在境系统识别

Linyu Lin

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种利用大语言模型辅助SINDy的方法,通过在境学习迭代优化方程结构,提升复杂动力学系统的符号恢复精度与可解释性。

Comments 6 pages, 5 figures, submitted to The 10th IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07100 2026-02-10 cs.CV 50%

TLC-Plan: A Two-Level Codebook Based Network for End-to-End Vector Floorplan Generation

TLC-Plan: 一种基于两级代码库的网络用于端到端向量地板计划生成

Biao Xiong, Zhen Peng, Ping Wang, Qiegen Liu, Xian Zhong

机构 * Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北交通物联网重点实验室,计算机科学与人工智能学院,武汉理工大学) School of Information Engineering, Nanchang University(信息工程学院,南昌大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 TLC-Plan通过两级代码库网络直接生成端到端向量地板计划,实现高效且拓扑有效的建筑设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06325 2026-02-09 cs.CR cs.SE 50%

Identifying Adversary Tactics and Techniques in Malware Binaries with an LLM Agent

利用LLM代理识别恶意软件二进制中的攻击战术与技术

Zhou Xuan, Xiangzhe Xu, Mingwei Zheng, Louis Zheng-Hua Tan, Jinyao Guo, Tiantai Zhang, Le Yu, Chengpeng Wang, Xiangyu Zhang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05306 2026-02-06 math.OC 50%

Inverse Optimization Without Inverse Optimization: Direct Solution Prediction with Transformer Models

无需逆向优化:基于Transformer模型的直接解预测

Macarena Navarro, Willem-Jan van Hoeve, Karan Singh

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出基于Transformer模型的直接解预测方法,用于解决具有未知组件的组合优化问题,通过约束推理模块整合已知约束,生成结构相似且满足约束的解,展现出在复杂问题中优于LSTM和逆向优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04056 2026-02-05 eess.SY cs.RO cs.SY 50%

Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World

模块化安全护栏是现实世界中由基础模型赋能的机器人所必需的

Joonkyung Kim, Wenxi Chen, Davood Soleymanzadeh, Yi Ding, Xiangbo Gao, Zhengzhong Tu, Ruqi Zhang, Fan Fei, Sushant Veer, Yiwei Lyu, Minghui Zheng, Yan Gu

机构 * Purdue University(普渡大学) Amazon(亚马逊公司) NVIDIA(英伟达公司)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出模块化安全护栏以解决现实世界中由基础模型赋能的机器人在开放、长尾和随时间适应的环境中的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03158 2026-02-04 cs.IR 50%

PAMAS: Self-Adaptive Multi-Agent System with Perspective Aggregation for Misinformation Detection

PAMAS:基于视角聚合的自适应多智能体系统用于虚假信息检测

Zongwei Wang, Min Gao, Junliang Yu, Tong Chen, Chenghua Lin

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PAMAS通过自适应多智能体系统和视角聚合技术,有效解决虚假信息检测中的信息淹没问题,提升检测准确性和效率。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02752 2026-02-04 cs.SE 50%

Beyond the Prompt: Assessing Domain Knowledge Strategies for High-Dimensional LLM Optimization in Software Engineering

超越提示:评估领域知识策略在软件工程高维LLM优化中的应用

Srinath Srinivasan, Tim Menzies

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究比较了人类与人工智能策略在生成领域知识方面的效果,通过四种不同架构评估如何利用结构化知识整合提升LLM在高维优化中的表现。

Comments Accepted at MSR 2026 (Registered Reports Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02529 2026-02-04 physics.soc-ph 50%

How Much of the United States Can Still Host New Hyperscale Data Centers? A Constraint-Based Feasibility Analysis

美国还能有多少地方还能建设新的超大规模数据中心?一种基于约束的可行性分析

Milan Janosov

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文基于美国的地理空间框架,分析了在现有物理、基础设施和环境约束下,超大规模数据中心的可行建设区域,得出美国实际可行容量在数十吉瓦范围内。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01630 2026-02-03 cs.CV 50%

Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks

世界模型的研究并非仅仅是将世界知识注入特定任务

Bohan Zeng, Kaixin Zhu, Daili Hua, Bozhou Li, Chengzhuo Tong, Yuran Wang, Xinyi Huang, Yifan Dai, Zixiang Zhang, Yifan Yang, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Tianyi Bai, Hongcheng Gao, Junbo Niu, Yang Shi, Xinlong Chen, Yue Ding, Minglei Shi, Kai Zeng, Yiwen Tang, Yuanxing Zhang, Pengfei Wan, Xintao Wang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出统一的世界模型设计规范,强调其应整合交互、感知、符号推理和空间表示,以实现更通用和稳健的世界模型。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16416 2026-01-30 cond-mat.mtrl-sci physics.comp-ph 50%

A Multi-agent Framework for Physical Laws Discovery

发现物理定律的多智能体框架

Bo Hu, Siyu Liu, Beilin Ye, Yun Hao, Yanhui Liu, Yang Lu, Ju Li, David J. Srolovitz, Tongqi Wen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究提出基于大语言模型的多智能体框架,用于发现物理定律,通过整合文献引导的变量选择、假设形成、符号回归等技术,实现了对金属玻璃形成能力、化合物硬度和多组分合金杨氏模量的高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19968 2026-01-29 cs.CR 50%

What is the AGI in Offensive Security ?

进攻性安全中的AGI是什么?

Youngwoong Cho

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨进攻性安全中的AGI,提出将任务归结为符号语言操作,并通过状态机和符号代理模型分析交互编码问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18096 2026-01-27 cs.IR 50%

Enhancing LLM-based Recommendation with Preference Hint Discovery from Knowledge Graph

基于知识图谱的偏好提示发现增强大语言模型推荐

Yuting Zhang, Ziliang Pei, Chao Wang, Ying Sun, Fuzhen Zhuang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出基于知识图谱的偏好提示发现模型,通过提取关键属性作为提示,提升大语言模型在推荐任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17833 2026-01-27 cs.CR 50%

An Effective and Cost-Efficient Agentic Framework for Ethereum Smart Contract Auditing

一种高效且成本效益高的以太坊智能合约审计代理框架

Xiaohui Hu, Wun Yu Chan, Yuejie Shi, Qumeng Sun, Wei-Cheng Wang, Chiachih Wu, Haoyu Wang, Ningyu He

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出Heimdallr,一种高效且低成本的智能合约审计代理,通过四个创新技术实现高精度检测,减少分析时间和成本,发现多个零日漏洞并保护大量资金。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17762 2026-01-27 cs.SE 50%

Multi-Agent End-to-End Vulnerability Management for Mitigating Recurring Vulnerabilities

多智能体端到端漏洞管理用于缓解重复漏洞

Zelong Zheng, Jiayuan Zhou, Xing Hu, Yi Gao, Shengyi Pan

专题命中 逻辑推理 :reasoning(abstract)

AI总结 MAVM通过多智能体框架实现端到端重复漏洞管理,整合知识库、检测、确认、修复和验证,有效提升漏洞修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏