arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 15 篇

2608.30498 2026-09-01 cs.AI 新提交 89%

CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework

CM2:基于集成多智能体框架的多模态文化推理

Qi Li, Zhaojie Kang, Yingjie He, Zheng Lin, Hao Zhang, Guangxin Wu, Yan Gong, Rong Fu, Jianyuan Ni

机构 * Lanzhou University(兰州大学) Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 逻辑推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLM)跨学科文化推理不足的问题,提出基于人类文化解释认知路径的CM2多智能体框架,在CM2D数据集上较CoT等范式取得一致提升,各模块贡献及跨模态仲裁能力均得到验证。

Comments Accepted to the 23rd Pacific Rim International Conference on Artificial Intelligence (PRICAI 2026) as a short paper. 11 pages, 4 figures. Code and dataset are available at this https URL (https://github.com/GitHub-12138/CM2-Multimodal-Cultural-Reasoning-via-an-Integrated-Multi-Agent-Framework)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30256 2026-09-01 cs.CL cs.AI 新提交 88%

Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

超越表面形式:以符号编辑测试大语言模型的逻辑推理能力

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Monash University(莫纳什大学) University College London(伦敦大学学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出工具驱动的符号编辑框架,通过可控修改逻辑算子等结构成分,发现不同LLM在算子编辑下的推理行为不一致,可用于评估模型推理可靠性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28006 2026-09-01 cs.CL cs.AI 版本更新 81%

Integrated and Cross-Architecture Interpretation of LLM Reasoning

LLM推理的集成与跨架构解释

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出集成跨架构推理(IAR)框架,通过带宽校准的MIP与Tukey IQR峰值检测、重叠分析及Jaccard稳定性度量,统一解释LLM推理模式。

Comments Accepted as main conference paper by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29490 2026-09-01 cs.MA cs.AI cs.RO 新提交 79%

Generalizable Multi-Agent Planning from Signal Temporal Logic Specifications via Diffusion

基于扩散模型的、可从信号时序逻辑规范实现通用多智能体规划

Joe Eappen, Zikang Xiong, Shreyash S. Iyengar, Suresh Jagannathan

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多智能体STL规划的通用能力与可扩展性的权衡问题,提出STL引导的扩散方法,实现了可泛化、可扩展且规划多样的多智能体规划,减少了安全违规。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17638 2026-09-01 cs.AI 版本更新 79%

Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing

超越轨迹:将可解释推理状态读出与原生MoE路由耦合

Kang Chen, Sihan Zhao, Yixin Cao, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出将可解释推理状态读出J64与原生MoE路由耦合的两级机制,提升推理过程可解释性与性能,R64作为低开销代理可保留其核心增益,还能优化分支选择与投票策略、调整推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30938 2026-09-01 cs.MA 新提交 78%

Evidence, Logic, and Compliance: Multi-Agent Structured Graph Reasoning with Expert Arbitration for Medical Referral

证据、逻辑与合规性:面向医疗转诊的专家仲裁多智能体结构化图推理

Qi Peng, Yi Cai, Jialin Cui, Tong Zhu, Yujuan Ding, Qingbao Huang, Tao Wang, Jiayuan Xie, Changmeng Zheng, Qing Li

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 该研究针对LLM用于医疗转诊的信息过载与非结构化协作问题,提出MASGR框架,通过多智能体结构化图推理及专家仲裁机制提升复杂医疗转诊的精准度,表现优于现有模型。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22878 2026-09-01 cs.AI cs.CL cs.IR cs.LG 版本更新 67%

SciAtlas: A Computable Atlas of Science for Knowledge-Grounded AI Research

SciAtlas:面向自动化科学研究的大规模知识图谱

Shuofei Qiao, Yunxiang Wei, Busheng Zhang, Mengru Wang, Jiazheng Fan, Huadong Jian, Bin Wu, Shumin Deng, Yida Xue, Zifan Cheng, Xiang Chen, Dan Zhang, Junfeng Fang, Ningyu Zhang, Keyan Ding, Qiang Zhang, Jeff Z. Pan, Emine Yilmaz, Huajun Chen

机构 * Zhejiang University(浙江大学) University College London(伦敦大学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 为应对学术信息爆炸和跨学科整合困难,提出包含4300万论文、1.57亿实体和30亿三元组的多学科知识图谱SciAtlas,并开发神经符号检索算法,实现从语义匹配到确定性关联发现的转变,降低推理成本。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30258 2026-09-01 cs.CL cs.AI 新提交 62%

Stratified Consistency Distillation for Natural Language Formalization

面向自然语言形式化的分层一致性蒸馏

Zhichao Hou, Ferhat Erata, Joe Lilien, MohamadAli Torkamani

机构 * North Carolina State University(北卡罗来纳州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对自然语言到逻辑公式翻译准确率提升难题,提出分层一致性蒸馏方法,经实验在Pass@K与等价逻辑相似度指标上获显著稳定提升,推进了逻辑翻译技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29529 2026-09-01 cs.CL cs.AI 新提交 62%

Argument-Aware Semantic Alignment of Normative Texts: A Toulmin-Based Neuro-Symbolic Approach

规范文本的论元感知语义对齐:一种基于图尔敏的神经符号方法

William Schroeder

机构 * Purdue University(普渡大学) Cleantech Software(清洁技术软件公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对专业规范文本语义对齐难题,提出结合神经文本表示与图尔敏特征的神经符号方法,在网络安全标准映射基准上验证论元结构特征可提升对齐效果。

Comments 11 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-09-01 cs.LG cs.AI cs.MA 版本更新 62%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments Long paper accepted to EMNLP 2026 main conference, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30277 2026-09-01 cs.AI cs.MA 新提交 57%

SimCRAFT: Distilling Remote Sensing Agents via Synthetic Trajectories and Contextual Retrieval-Augmented Fine-Tuning

SimCRAFT:通过合成轨迹和上下文检索增强微调蒸馏遥感智能体

Haoran Wang, Jing Yao, Xu Yang, Zeqing Wang, Yang Zhang, Pedram Ghamisi, Zhengchao Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗森多夫亥姆霍兹中心)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出SimCRAFT框架,通过合成轨迹与上下文检索增强微调,将复杂遥感编排能力蒸馏到7B模型,性能优于开源LLM,为轻量遥感智能提供开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21719 2026-09-01 cs.DC cs.AI 交叉投稿 57%

PowerSlider: Exploiting Phase Asymmetry for LLM Serving under Demand Response

PowerSlider:利用相位不对称性实现需求响应下的大语言模型服务

Yueying Li, Jiayang Chen, Yuanfan Chen, Leo Han, Haoran Qiu, Esha Choukse, Rodrigo Fonseca, Udit Gupta

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 PowerSlider通过分解大语言模型服务阶段并结合KKT在线求解器,在电网需求响应的时变功率上限下,显著提升了服务吞吐量与延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29808 2026-09-01 cs.CR cs.PL cs.SE 新提交 50%

POLYFLOW: A Neuro-Symbolic Framework for Static Cross-Language Information Flow Analysis

POLYFLOW:用于静态跨语言信息流分析的神经符号框架

Haoran Yang, Zhixuan Zhong, Jiawei Guo, Haipeng Cai

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PolyFlow是结合LLM与静态分析的跨语言信息流分析神经符号框架,在多语言系统实验中表现优于基线,可发现未知跨语言漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29078 2026-09-01 cs.RO 新提交 50%

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM:基于实境到仿真的部署时演示生成,用于可扩展的策略适配

Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究提出DREAM框架,可无需人类演示生成VLA微调数据,经实机实验验证其能降低新工作空间的数据收集成本并提升操纵任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏