arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3050 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3050 篇

2601.17260 2026-01-27 cs.LG cs.AI 62%

The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment

逻辑的粘度:DPO对齐中的相变与滞后效应

Marco Pollanen

机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15442 2026-01-23 cs.AI cs.LG cs.LO cs.NA math.NA stat.ML 62%

A tensor network formalism for neuro-symbolic AI

用于神经符号AI的张量网络形式化

Alex Goessmann, Janina Schütte, Maximilian Fröhlich, Martin Eigel

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种张量网络形式化方法,用于统一神经和符号AI,通过结构化张量分解实现逻辑与概率模型的混合训练。

Comments 51 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12442 2026-01-21 cs.LG cs.AI cs.CV 62%

Constraint-Aware Neurosymbolic Uncertainty Quantification with Bayesian Deep Learning for Scientific Discovery

具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现

Shahnawaz Alam, Mohammed Mudassir Uddin, Mohammed Kaif Pasha

机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11379 2026-01-19 cs.CL cs.AI cs.CY cs.SI 62%

Evaluating LLM Behavior in Hiring: Implicit Weights, Fairness Across Groups, and Alignment with Human Preferences

评估LLM在招聘中的行为:隐含权重、群体公平性及与人类偏好的一致性

Morgane Hoffmann, Emma Jouffroy, Warren Jouanneau, Marc Palyart, Charles Pebereau

机构 * Malt

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估LLM招聘决策的框架,发现模型重视核心生产力信号,但对某些特征的解释超出显性匹配价值,且不同群体间权重存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10108 2026-01-16 cs.CL cs.AI cs.MM 62%

SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature

SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链

Yiming Ren, Junjie Wang, Yuxin Meng, Yihang Shi, Zhiqiang Lin, Ruihang Chu, Yiran Xu, Ziming Li, Yunfei Zhao, Zihan Wang, Yu Qiao, Ruiming Tang, Minghao Liu, Yujiu Yang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) KuaiShou Inc.(快手公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09728 2026-01-16 cs.CL cs.AI 62%

Eliminating Agentic Workflow for Introduction Generation with Parametric Stage Tokens

通过参数化阶段令牌消除引言生成中的代理工作流

Meicong Zhang, Tiancheng su, Guoxiu He

机构 * School of Economics and Management, East China Normal University(经济管理学院,东华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STIG方法,通过参数化阶段令牌消除代理工作流,使LLM在单次推理中生成连贯的引言,提升逻辑结构和语义相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09049 2026-01-15 cs.CL cs.AI 62%

Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers

Grokking是否值得?Transformer中泛化电路的功能分析与可迁移性

Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德克萨斯大学达拉斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了Transformer中泛化电路的功能与可迁移性,发现grokking过程是整合记忆事实到自然推理路径,而非突然获得新范式,且其在迁移新知识时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06181 2026-01-13 cs.AI cs.FL cs.LG cs.LO 62%

Neuro-Symbolic Compliance: Integrating LLMs and SMT Solvers for Automated Financial Legal Analysis

神经符号合规:整合大语言模型与SMT求解器用于自动化金融法律分析

Yung-Shen Hsia, Fang Yu, Jie-Hong Roland Jiang

机构 * Department of Management Information Systems, National ChengChi University, Taipei, Taiwan(管理信息系,中华大学,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电子工程系,台湾大学,台北,台湾)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究整合大语言模型与SMT求解器,提出神经符号合规框架,用于自动化金融法律分析,实现形式可验证性和基于优化的合规修正。

Comments 10 pages, 6 tables, 3 figures, accepted by the 2nd ACM AIware Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17198 2026-01-13 cs.AI cs.LG 62%

Towards Symbolic XAI -- Explanation Through Human Understandable Logical Relationships Between Features

迈向符号化XAI——通过人类可理解的特征间逻辑关系进行解释

Thomas Schnake, Farnoush Rezaei Jafari, Jonas Lederer, Ping Xiong, Shinichi Nakajima, Stefan Gugler, Grégoire Montavon, Klaus-Robert Müller

机构 * Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) Machine Learning Group, Technical University of Berlin(柏林技术大学机器学习组) Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Mathematics and Computer Science, Free University of Berlin(柏林自由大学数学与计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符号化XAI框架,通过人类可理解的逻辑关系解释模型决策,提升AI透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01266 2026-01-09 cs.CL cs.AI 62%

From Policy to Logic for Efficient and Interpretable Coverage Assessment

从策略到逻辑:为高效和可解释的覆盖评估而设

Rhitabrat Pokharel, Hamid Reza Hassanzadeh, Ameeta Agrawal

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种结合覆盖意识检索器和符号规则推理的方法,以提高医疗覆盖政策审查的效率和可解释性,同时降低模型成本并提升评估准确性。

Comments Accepted at AIMedHealth @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03261 2026-01-08 cs.CL cs.AI 62%

DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing

DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距

Shuo Lu, Yinuo Xu, Jianjie Cheng, Lingxiao He, Meng Wang, Jian Liang

机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) School of AI UCAS(UCAS人工智能学院) Meituan Inc.(美团公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 62%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01298 2026-01-06 cs.LG cs.AI cs.AR cs.DC cs.MA 62%

Warp-Cortex: An Asynchronous, Memory-Efficient Architecture for Million-Agent Cognitive Scaling on Consumer Hardware

Warp-Cortex: 一种异步、内存高效的用于百万智能体认知扩展的消费级硬件架构

Jorge L. Ruiz Williams

机构 * Warp Research(Warp研究)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Warp-Cortex通过异步架构和内存优化技术,实现百万智能体在消费级硬件上的高效认知扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22336 2025-12-30 cs.AI cs.CL 62%

Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback

Agent2World: 通过自适应多智能体反馈学习生成符号世界模型

Mengkang Hu, Bowei Xia, Yuran Wu, Ailing Yu, Yude Zou, Qiguang Chen, Shijian Wang, Jiarui Jin, Kexin Li, Wenxiang Jiao, Yuan Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司) UESTC(电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Agent2World通过自适应多智能体反馈学习生成符号世界模型,提升推理和微调性能,实现30.95%的相对提升。

Comments 48 pages, 15 tables, 7 figures, Project page: https://agent2world.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22258 2025-12-30 cs.AI cs.LG cs.LO cs.SC 62%

Logic Sketch Prompting (LSP): A Deterministic and Interpretable Prompting Method

逻辑草图提示(LSP):一种确定性和可解释的提示方法

Satvik Tripathi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 逻辑草图提示(LSP)通过引入类型变量、确定性条件评估器和规则验证器,提升了大语言模型在需要严格规则遵守、确定性和可审计性任务中的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17923 2025-12-30 q-fin.ST cs.AI cs.LG 62%

Inferring Latent Market Forces: Evaluating LLM Detection of Gamma Exposure Patterns via Obfuscation Testing

推断潜在市场力量:通过混淆测试评估大语言模型检测伽马暴露模式的能力

Christopher Regan, Ying Xie

机构 * Department of Computer Science Kennesaw State University Marietta, GA, Cobb(计算机科学系 凯尼恩州立大学 马里埃塔, 乔治亚州, 理查兹) Department of Information Technology Professor of Information Technology Kennesaw State University Marietta, GA(信息科技系 信息科技教授 凯尼恩州立大学 马里埃塔, 乔治亚州)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过混淆测试验证大语言模型能否通过因果推理识别结构性市场模式,发现其在无偏提示下检测伽马暴露模式的准确率为71.5%,展示了LLMs在金融机制识别方面的潜力。

Comments 10 pages, 8 figures. Accepted at IEEE Big Data 2025. Extended journal version in preparation. ISBN: 979-8-3315-9447-3/25. Page numbers: 7226-7235

Journal ref 2025 IEEE International Conference on Big Data (Big Data)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17920 2025-12-23 cs.CL cs.AI 62%

Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression

分离约束合规性与语义准确性:一种新的基准,用于在压缩下评估指令遵循

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CDCT基准,揭示LLMs在压缩下约束合规性与语义准确性之间的矛盾,发现中等压缩时约束违规主要由RLHF训练的有用性行为导致。

Comments 19 pages, 9 figures; currently under peer review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17308 2025-12-22 cs.AI cs.CL 62%

Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation

大型语言模型作为宝可梦战斗代理:战略玩法与内容生成

Daksh Jain, Aarya Jain, Ashutosh Desai, Avyakt Verma, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,比兰)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在宝可梦战斗中的战略决策能力及内容生成能力,展示了其作为动态游戏对手和设计者的潜力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15298 2025-12-18 cs.AI cs.CL cs.CY 62%

ChatGPT and Gemini participated in the Korean College Scholastic Ability Test -- Earth Science I

ChatGPT 和 Gemini 参与韩国大学入学考试——地球科学I

Seok-Hyun Ga, Chun-Yen Chang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了ChatGPT和Gemini在地球科学I考试中的多模态推理能力,发现模型在感知与认知之间存在差距,揭示了AI在科学评估中的局限性。

Comments 23 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12012 2025-12-17 cs.CV cs.AI cs.CL cs.RO 62%

Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus

语义驱动:通过开放词汇锚定和神经符号视觉语言共识民主化长尾数据整理

Antonio Guillen-Perez

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Semantic-Drive通过开放词汇锚定和神经符号视觉语言共识,提升自动驾驶中长尾数据整理的效率与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18054 2025-12-17 cs.IR cs.AI cs.LG 62%

A Knowledge Graph-based Retrieval-Augmented Generation Framework for Algorithm Selection in the Facility Layout Problem

基于知识图谱的检索增强生成框架用于设施布局问题中的算法选择

Nikhil N S, Bilal Muhammed, Soban Babu Beemaraj, Amol Dilip Joshi

机构 * Indian Institute of Science(印度科学学院) TCS Research and Innovation(塔塔咨询公司研究与创新)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于知识图谱的检索增强生成框架,用于自动推荐设施布局问题中的算法选择,通过多维检索机制和大语言模型实现数据驱动的算法推荐。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10121 2025-12-12 cs.CL cs.AI cs.CY q-fin.GN 62%

Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing

流程即一切:通过高熵信息觅食和对抗性节奏控制摆脱'统计平滑陷阱

Zhongjie Jiang

机构 * Zhongjie Jiang(江宗杰)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DeepNews框架,通过高熵信息觅食和对抗性节奏控制,解决LLMs在长文本生成中的幻觉、逻辑一致性和个性化表达难题,实验显示其在金融报道中表现优异。

Comments 22 pages, 8 figures. Includes an ecological validity blind test where the Agentic Workflow achieved a 25% acceptance rate in top-tier media, decisively outperforming the SOTA Zero-shot baseline (0%). Features the DNFO-v5 ontology

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15843 2025-12-11 cs.CL cs.AI 62%

Enhanced Sentiment Interpretation via a Lexicon-Fuzzy-Transformer Framework

通过词典-模糊-变换器框架提升情感解释

Shayan Rokhva, Mousa Alizadeh, Maryam Abdollahi Shamami

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合规则启发式、上下文深度学习和模糊逻辑的混合框架,用于提升领域特定文本中情感极性和强度的识别精度。

Comments The manuscript was uploaded in error and is scientifically invalid. It is an incomplete draft with major flaws. Co-authors were not aware of or consenting to this submission and do not endorse it

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00409 2025-12-05 cs.CL cs.AI 62%

Semantic Mastery: Enhancing LLMs with Advanced Natural Language Understanding

语义 mastery:通过高级自然语言理解增强大语言模型

Mohanakrishnan Hariharan

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过高级自然语言理解技术提升大语言模型的语义理解和推理能力,探讨了知识图谱、检索增强生成和对比学习等方法在解决复杂NLP任务中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02987 2025-12-03 cs.CL cs.AI 62%

Fine-Tuned Large Language Models for Logical Translation: Reducing Hallucinations with Lang2Logic

针对逻辑翻译的微调大型语言模型:通过Lang2Logic减少幻觉

Muyu Pan, Dheeraj Kodakandla, Mahfuza Farooque

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种通过微调大型语言模型来减少逻辑翻译中幻觉的框架,利用自定义语法和符号计算库生成可靠的合取范式。

Comments IEEE ISNCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17638 2025-11-25 cs.LG cs.AI 62%

Model-to-Model Knowledge Transmission (M2KT): A Data-Free Framework for Cross-Model Understanding Transfer

模型到模型知识传输(M2KT):一种无数据的跨模型理解迁移框架

Pratham Sorte

机构 * Department of Computer Science(计算机科学系) Engineering MIT-World Peace University, Pune, India(工程学院 MIT-世界和平大学 印度邦普尼)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 M2KT提出了一种无数据的跨模型知识传输方法,通过概念空间交换知识包,实现高效的知识迁移和模型自我改进。

Comments 8 pages including figures, prepared in IEEE conference style. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14334 2025-11-20 cs.AI cs.LG 62%

When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling

Alessio Pellegrino, Jacopo Mauro

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17053 2025-11-18 cs.LG cs.AI cs.CR 62%

DR-Encoder: Encode Low-rank Gradients with Random Prior for Large Language Models Differentially Privately

Huiwen Wu, Deyi Zhang, Xiaohan Li, Xiaogang Xu, Jiafei Wu, Zhe Liu

机构 * Zhejiang Laboratory(浙江实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09956 2025-11-17 cs.LG cs.AI cs.CV cs.ET 62%

DeepSeek-Inspired Exploration of RL-based LLMs and Synergy with Wireless Networks: A Survey

Yu Qiao, Phuong-Nam Tran, Ji Su Yoon, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * Kyung Hee University(韩国庆熙大学) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 45 pages, 12 figures

Journal ref ACM Computing Surveys, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18890 2025-11-17 cs.AI cs.LG cs.NE 62%

CoEvo: Continual Evolution of Symbolic Solutions Using Large Language Models

Ping Guo, Qingfu Zhang, Xi Lin

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Camera ready version for AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏