arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 16 篇

2506.15732 2026-02-05 cs.AI cs.LG 81%

Can LLMs Reconcile Knowledge Conflicts in Counterfactual Reasoning

大语言模型能否在反事实推理中调和知识冲突

Khurram Yamin, Gaurav Ghosal, Bryan Wilder

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了大语言模型在反事实推理中整合参数知识的能力,发现其普遍挣扎并存在知识退化问题。

Comments ICML 2025 Workshop on Scaling up Intervention Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04640 2026-02-05 cs.SE cs.AI 79%

Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents

面向结构化、状态感知和执行导向的软件工程代理推理

Tse-Hsun, Chen

机构 * Concordia University(康科德大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出通过结构化、状态感知和执行导向的推理方法,提升软件工程代理在长周期任务中的推理能力和可靠性。

Comments Position paper accepted in BoatSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17923 2026-02-05 cs.CL 79%

Language models can learn implicit multi-hop reasoning, but only if they have lots of training data

语言模型可以学习隐式多跳推理,但只有在有大量训练数据的情况下

Yuekun Yao, Yupei Du, Dawei Zhu, Michael Hahn, Alexander Koller

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了语言模型通过大量训练数据学习隐式多跳推理的能力,并发现训练数据量随推理跳数呈指数增长,但通过课程学习可部分缓解这一需求。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04690 2026-02-05 cs.IR 78%

Multi-Source Retrieval and Reasoning for Legal Sentencing Prediction

多源检索与推理用于法律判决预测

Junjie Chen, Haitao Li, Qilei Zhang, Zhenghua Li, Ya Zhang, Quan Zhou, Cheng Luo, Yiqun Liu, Dongsheng Guo, Qingyao Ai

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出MSR²框架,通过多源检索与强化学习提升法律判决预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09100 2026-02-05 cs.LG cs.AI 62%

Towards Universal Neural Likelihood Inference

面向通用神经似然推断

Shreyas Bhat Brahmavar, Yang Li, Qiyang Liu, Shashank Srivastava, Junier Oliva

机构 * Department of Computer Science, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(计算机科学系,北卡罗来纳大学教堂山分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通用神经似然推断框架ASPIRE,通过异构表格数据推理引擎实现跨领域零样本学习,提升预测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13697 2026-02-05 cs.LG cs.AI 62%

RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs

仅名义上的强化学习?分析在LLM中post-training强化学习的结构假设

Soumya Rani Samineni, Durgesh Kalwar, Karthik Valmeekam, Kaya Stechly, Subbarao Kambhampati

机构 * SCAI, Arizona State University(SCAI,亚利桑那州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了LLM post-training强化学习的结构假设,发现其退化为过滤迭代SFT,且激励生成更长的中间token序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04540 2026-02-05 cs.HC cs.CL 57%

PersoPilot: An Adaptive AI-Copilot for Transparent Contextualized Persona Classification and Personalized Response Generation

PersoPilot: 一种适应性AI助手用于透明的上下文化人格分类和个性化响应生成

Saleh Afzoon, Amin Beheshti, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 PersoPilot是一种集成人格理解和上下文分析的AI助手,通过透明可解释的界面实现个性化服务推荐和适应性个性化。

Comments Accepted for the Demo Track at the IEEE International Conference on Data Mining (ICDM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04118 2026-02-05 cs.LG 57%

Learning to Reason in 13 Parameters

在13个参数中学习推理

John X. Morris, Niloofar Mireshghallah, Mark Ibrahim, Saeed Mahloujifar

机构 * FAIR at Meta(Meta 的 FAIR) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 TinyLoRA通过仅训练13个参数实现高效推理学习,显著提升模型性能并降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03708 2026-02-05 cs.CL cs.PF 57%

Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States

超越标记:基于语义的推测解码用于通过探测内部状态实现高效的推理

Ximing Dong, Shaowei Wang, Dayi Lin, Boyuan Chen, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei, Canada(华为加拿大软件 excellence 中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 SemanticSpec通过探测模型内部状态,实现基于语义的高效推测解码,提升大型推理模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02164 2026-02-05 cs.LG cs.CR 57%

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam: 基于LLM代理的协同安全发现与利用

Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

机构 * Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究) Michigan State University(密歇根州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Co-RedTeam通过整合安全知识、代码分析和执行反馈,提升漏洞发现与利用的自动化水平,实现超过60%的漏洞利用成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07464 2026-02-05 cs.CV cs.AI 57%

DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO

DeepVideo-R1: 通过难度感知的回归GRPO实现视频强化微调

Jinyoung Park, Jeehye Na, Jinyoung Kim, Hyunwoo J. Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Korea University(韩国大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepVideo-R1通过回归GRPO和难度感知数据增强,提升视频大语言模型的推理能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04877 2026-02-05 cs.CV 50%

CoWTracker: Tracking by Warping instead of Correlation

CoWTracker: 通过形变而非相关性进行跟踪

Zihang Lai, Eldar Insafutdinov, Edgar Sucar, Andrea Vedaldi

专题命中 其他推理 :reasoning(abstract)

AI总结 CoWTracker通过形变替代相关性进行密集点跟踪,结合Transformer架构实现高效且高精度的跟踪与光流估计。

Comments Project website: cowtracker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04598 2026-02-05 cs.HC 50%

AI in Education Beyond Learning Outcomes: Cognition, Agency, Emotion, and Ethics

人工智能在教育中的应用超越学习成果:认知、自主性、情感与伦理

Lucile Favero, Juan Antonio Pérez-Ortiz, Tanja Käser, Nuria Oliver

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了AI在教育中的社会影响,强调通过整合认知、自主性、情感和伦理维度,提出负责任的AI设计以支持学习并维护教育的社会目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04225 2026-02-05 cs.IR 50%

Following the TRAIL: Predicting and Explaining Tomorrow's Hits with a Fine-Tuned LLM

跟随TRAIL:利用微调LLM预测和解释明天的爆款

Yinan Zhang, Zhixi Chen, Jiazheng Jing, Zhiqi Shen

专题命中 其他推理 :reasoning(abstract)

AI总结 TRAIL通过微调LLM联合预测短期物品流行度并生成自然语言解释,提升推荐系统的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04072 2026-02-05 quant-ph 50%

Data Verification is the Future of Quantum Computing Copilots

数据验证是量子计算copilot的未来

Junhao Song, Ziqian Bi, Xinliang Chia, William Knottenbelt, Yudong Cao

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出数据验证在量子计算copilot和AI自动化中的重要性,强调验证作为架构基础的必要性,通过实验表明未验证的LLMs在电路优化中准确率仅为79%。

Comments 13 Pages, 20 Figures. Accepted to AAAI 2026 Workshop on AI4Research. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20276 2026-02-05 eess.SY cs.SY 50%

LLM-Driven Transient Stability Assessment: From Automated Simulation to Neural Architecture Design

基于大语言模型的暂态稳定评估:从自动化仿真到神经网络架构设计

Lianzhe Hu, Yu Wang, Bikash Pal

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出利用大语言模型驱动的神经网络设计流程,实现电力系统暂态稳定评估的自动化和智能化,提升准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏