arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 282 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 282 篇

2608.00678 2026-08-04 cs.CV 新提交 50%

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

打破水平先验:从长尾方向偏差到抗翻滚单目深度估计

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该研究针对单目深度估计中受水平先验(长尾方向偏差)导致的相机翻滚鲁棒性差问题,提出训练时监督策略ID-Constraint,经多基准数据集实验验证了方法的有效性。

Comments The code is publicly available on GitHub: https://github.com/KaihuaTang/Horizontal-Prior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00629 2026-08-04 cs.GR 新提交 50%

ParticleGen: A Multi-Agent System for Particle Effects Generation

ParticleGen:用于粒子效果生成的多智能体系统

Junhao Zhuge, Junyi Yang, Yuqing Wang, Kangzhan Wang, Sipeng Yang, Xiaogang Jin

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究提出多智能体框架ParticleGen,可从自然语言描述合成结构化可编辑粒子系统,经Unreal Engine 5的Niagara系统多场景验证,能降低创作门槛、提升迭代效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00490 2026-08-04 cs.CV 新提交 50%

Image-Space Rule Discovery

图像空间中的规则发现

Misora Sugiyama, Toya Oyama, Hirokatsu Kataoka

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology (AIST)(独立行政法人产业技术综合研究所) University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究提出WISRD基准测试图像编辑模型的图像空间规则发现能力,发现Nano Banana Pro表现最优,当前模型可部分依赖图像内指令,且该模型在4×4数独等任务上有一定性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00886 2026-08-04 cs.SE econ.GN math.OC q-fin.EC 新提交 50%

Joint Optimization of Human Headcount and Stochastic AI Resource Capacity

人力资源配置与随机AI资源容量的联合优化

Marco Montes de Oca

专题命中 逻辑推理 :planning(abstract)

AI总结 本文针对生成式AI工具带来的成本压力,构建联合分配模型优化人力资源与AI令牌容量,得出相关最优解及替代关系反转的实证检验条件。

Comments 16 pages, 4 figures. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25823 2026-07-29 cs.IR 新提交 50%

Hypothesis-Driven Shelf Generation for Personalised Recommendation

用于个性化推荐的假设驱动型货架生成

Aleksandr V. Petrov, Tarun Chillara, Matthew D. Moellman, Lucas de Haas, Yabai Song, Alina Susoykina, Melissa Crawford, Gabriel Negash, Erik Franco, Tasnim Rahman, Binal Jhaveri, Shubham Bansal, Hugues Bouchard, Roberto Mirizzi, Mounia Lalmas, Aloïs Gruson

专题命中 逻辑推理 :planning(abstract)

AI总结 研究针对个性化推荐中货架生成问题,提出内容假设驱动型系统,含假设生成等四个阶段,解耦货架规划与目录填充,支持独立优化,经生产管道结合多种操作,通过离线和在线评估,该系统能扩展个性化推荐供应,效果有竞争力。

Comments Accepted at ACM RecSys '26 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18580 2026-07-22 cs.RO 新提交 50%

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

机构 * University of Maryland(马里兰大学)

专题命中 逻辑推理 :planning(abstract)

AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17053 2026-07-21 cs.SE cs.AR 新提交 50%

MechMem-RTL: Reusing Verified Mechanism Memories for LLM-Based RTL Repair

MechMem-RTL:用于基于大语言模型的RTL修复的可复用验证机制存储器

Mingyu Cheng, Junjie Gao, Jinhua Cui, Kuncai Zhong

专题命中 逻辑推理 :verifier(abstract)

AI总结 研究针对大语言模型修复RTL设计时,利用任务文本相似性易误导的问题,提出MechMem-RTL框架,复用验证器确认的修复记录,通过严格匹配触发证据来注入记录,实验表明该框架在多个任务上修复效果优于标准反馈修复和任务相似性RAG。

Comments 7 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17174 2026-07-21 quant-ph math.LO 新提交 50%

QBism Logic

QB主义逻辑

Kenji Tokuo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究基于QB主义对量子理论的解释进行逻辑形式化,通过引入相关语言和证明定理,将无动态算子片段转化为一阶公式,归约有效性,还表明有限维量子理论可通过SIC等实现框架并满足相关条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15535 2026-07-20 cond-mat.mtrl-sci 新提交 50%

Symbolic Predicate-Guided Language Agents for Inverse Design of Perovskite Oxides

用于钙钛矿氧化物逆设计的符号谓词引导语言智能体

Dong Hyeon Mok, Seoin Back, Victor Fung, Guoxiang Hu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究钙钛矿氧化物逆设计,引入 DSL 引导策略,将自然语言规则转化为符号谓词,开发 ORCHESTRA 框架。该策略能增强 LLM 智能体推理能力,无需大量特定任务数据集或额外训练,提升材料设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13528 2026-07-16 cs.LO math.LO 新提交 50%

Intuitionistic Dynamic Logic

直觉主义动态逻辑

Lukas Zenger

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究直觉主义动态逻辑的数学理论,涵盖五种该逻辑。通过开发证明论工具、进行语义研究,建立相关性质与界限。主要贡献为开发演算、获有限模型性质及可判定性、给出直觉主义线性时态逻辑完备公理系统。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13549 2026-07-16 astro-ph.IM astro-ph.SR 新提交 50%

JW-ASTClaw: A Generalizable Multi-Agent Framework for Autonomous Solar Telescope and Its Implementation within Chinese Meridian Project

JW-ASTClaw:一种用于自主太阳望远镜的通用多智能体框架及其在中国子午工程中的实现

Li-Yue Tong, Jia-Ben Lin, Yuan-Yong Deng, Ying-Zi Sun, Ming-Fu Shao, Hui Wang, Chen Yang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究将大语言模型驱动的自主控制系统部署在太阳望远镜上,采用多智能体框架及解耦三层架构,通过感知智能体编码专业知识,经中央推理引擎处理,实现实时自适应调度,跨季节验证效果良好,提升了观测等多方面能力。

Comments 17 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11611 2026-07-14 cs.PL 新提交 50%

Mizzle: A Complete Concurrent Incorrectness Logic for Preventing False Alarms in Agentic Bug Finding

Mizzle:一种用于在智能体错误查找中防止误报的完整并发错误逻辑

Alexandre Moine, Sam Westrick, Joseph Tassarotti

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对大语言模型在程序错误查找中产生大量误报的问题,提出Mizzle方法,它是一种用于并发程序的错误分离逻辑,在Rocq证明助手实现机械化,能防止误报且完整,还通过三种错误概念实例化并展示其可用于证明错误存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11308 2026-07-14 cs.SE cs.CR 新提交 50%

FlowArk: Boosting Agentic Data-flow Analysis for Android Apps via Context-Aware Knowledge Reuse

FlowArk:通过上下文感知知识重用提升安卓应用的智能数据流分析

Yiming Zhang, Jiangrong Wu, Yuhong Nan

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究安卓应用数据流分析中批量任务重复分析成本高的问题,提出FlowArk系统,通过提炼、打包和注入知识条目降低成本,实验表明其在保持分析质量的同时,能降低API成本并增加任务完成量。

Comments 12 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10340 2026-07-14 cs.AR 新提交 50%

When Fuzzing Meets Understanding: LLM-Driven Semantic Test Generation for RTL Verification

当模糊测试与理解相遇:用于RTL验证的大语言模型驱动的语义测试生成

Kun Wang, Cangyuan Li, Kaiyan Chang, Siyang Cai, Yinhe Han, Ying Wang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对硬件验证难题,提出ChipFuzzer框架,利用大语言模型语义推理能力。采用双阶段工作流程,覆盖引导阶段结合控制流分析提升覆盖率,错误引导阶段借助历史数据提高错误发现率,实验显示其显著提升验证效果。

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10011 2026-07-14 cs.CY 新提交 50%

Religion and Artificial Intelligence as Distributed Meaning Systems: A Naturalistic Conceptual Model

宗教与人工智能作为分布式意义系统:一种自然主义概念模型

Dhushy Thillaivasan, Samar Shailendra, Sohag Sarkar

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该文将宗教与人工智能视为结构相似的分布式意义系统,源于相同底层认知架构。通过概念模型展示意义的产生等过程,宗教与当代AI系统有类似功能,此模型解释相关机制并阐明AI成意义权威的条件,提供统一框架理解二者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09176 2026-07-13 cs.CR 新提交 50%

SherAgent: Scaling Attack Investigation in the Wild via LLM-Empowered Iterative Query-Filter Backtracking

SherAgent:通过大语言模型赋能的迭代查询-过滤回溯在野外扩展攻击调查

Zhenyuan Li, Zhengkai Wang, Ling Jiang, Xiangmin Shen, Ruixiao Lin, Sen Nie, Shi Wu, Shouling Ji

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对野外攻击调查中依赖爆炸和因果链碎片化问题。提出SherAgent系统,基于大语言模型,采用迭代“查询-过滤”回溯范式处理非结构化数据,克服相关问题。相比传统方法,提高调查成功率,且运行高效,减轻专家分析负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08809 2026-07-13 cs.CR cs.NI 新提交 50%

Privacy-Preserving Intent Fulfilment and Assurance for 6G RAN

6G无线接入网的隐私保护意图实现与保证

Joss Armstrong

专题命中 逻辑推理 :verifier(abstract)

AI总结 研究6G无线接入网隐私保护意图实现与保证问题,提出一种架构,协调器依意图类别分配资源且仅用O1接口计数器验证,定义隐私属性并证明其成立,映射到相关框架确定运行点,实验表明意图类别粒度变化对分配和保证有相应影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08529 2026-07-10 cs.IR 新提交 50%

Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis

Log-Insight:通过神经符号日志分析实现微服务事件诊断自动化

Carlos Garcia-Hernandez, Aymane Abdali, Guangyu Wu, Mingxue Wang, Fei Shen, Zhaoyu Pang, Yanbin Zhang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对大规模微服务系统生产事件诊断难题,提出Log-Insight系统,通过自动化SRE手动分类工作流程,经符号阶段处理后为LLM提供证据合成假设报告,六阶段管道减少大量原始事件,评估显示该系统能高效准确诊断根本原因,还报告了相关故障模式等内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03661 2026-07-07 cs.CV 新提交 50%

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

使用多模态大语言模型从几何标签到室内建筑组件的语义理解

Shuju Jing, Chao Yin

机构 * School of Qilu Transportation, Shandong University(山东大学齐鲁交通学院) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省地理研究所)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对室内建筑组件,提出以点云为中心的多模态大语言模型Building-MLLM,通过特定机制解决语义集中问题,开发引擎编译数据集,实验表明其在多任务上表现优异,提升室内组件语言理解。

Comments 46 pages, 13 figures, accepted by Automation in Construction journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03601 2026-07-07 cs.AR 新提交 50%

ArchEval: Measuring AI Agents as Computer Architects

ArchEval:将人工智能代理作为计算机架构师进行评估

Chenyu Wang, Zishen Wan, Jeffrey Ma, Shvetank Prakash, Zhenting Qi, Haebin Do, Andy Cheng, Arya Tschand, Jiahe Shi, Yilun Du, Vijay Janapa Reddi

专题命中 逻辑推理 :verifier(abstract)

AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01742 2026-07-03 cs.CR cs.SE 新提交 50%

Knowledge Over Parameters: Evolving Smart Contract Vulnerability Detection

知识超越参数:演化智能合约漏洞检测

Yuqiang Sun, Han Liu, Ying Li, Yiran Zhang, Zong Cao, Ziyun Guo, Yang Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出EvoVuln框架,将漏洞检测转化为程序性知识演化问题,通过运行时反转控制架构和两阶段演化流水线,仅用少量标注样本自动合成并优化检测逻辑,在五种真实漏洞类型上实现71%宏平均F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01641 2026-07-03 cs.SE 新提交 50%

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

当智能体不停止:揭示LLM智能体中的无限循环

Xinyi Hou, Shenao Wang, Yanjie Zhao, Haoyu Wang

专题命中 逻辑推理 :planning(abstract)

AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31866 2026-07-01 cs.LO cs.MA 新提交 50%

Inquisitive Action Logic

探究性行动逻辑

Ivano Ciardelli

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出探究性行动逻辑InqAL,一种用于推理行动的多主体模态逻辑,通过问题模态分析主体对结果的确定作用,并证明其完备性和可判定性。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 222-241

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31339 2026-07-01 cs.RO 新提交 50%

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

验证门控的智能工业多机器人系统任务状态治理

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26545 2026-06-26 cs.SE 新提交 50%

ConcoLixir: Reactive LLM Discovery Oracles for Python Concolic Testing

ConcoLixir:用于Python符号执行的响应式LLM发现预言

Dong Chen, Chih-Duo Hong, Fang Yu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25388 2026-06-25 cs.DB 新提交 50%

TabClean: Reusable LLM-Synthesized Programs for Tabular Data Cleaning

TabClean: 用于表格数据清洗的可复用LLM合成程序

Yibo Wang, Riteng Zhang, Yinghao He, Yongye Su, Bharat Bhargava, Chunwei Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21276 2026-06-23 cs.CY 新提交 50%

CEDAR-42001: From ISO/IEC 42001 Conformity to Architecture-Aware, Audit-Visible Assurance Posture for AI Cyber-Physical Systems

CEDAR-42001: 从ISO/IEC 42001符合性到面向架构、可审计可见的AI信息物理系统保障态势

Priyanka Prakash Surve, Asaf Shabtai, Yuval Elovici

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出CEDAR-42001方法,将ISO/IEC 42001审计证据转化为架构感知的保障态势,通过分层归因、成熟度评估和行动推荐,揭示符合性审计的局限性,并在自动驾驶案例中验证。

Comments 19 Pages, 3 figures, 4 tables. Code and data are available in the accompanying artifact repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 50%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 逻辑推理 :planning(abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏