arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-23 至 2025-12-23 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2512.05387 2025-12-23 cs.CL 57%

Learning from Self Critique and Refinement for Faithful LLM Summarization

从自我批评与完善学习以实现忠实的大语言模型摘要

Ting-Yao Hu, Hema Swetha Koppula, Hadi Pouransari, Cem Koc, Oncel Tuzel, Raviteja Vemulapalli

机构 * Apple(苹果公司)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 本文提出SCRPO方法,通过自监督训练框架提升大语言模型摘要的忠实度,实验表明其在忠实度和整体质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 14 篇

2512.18605 2025-12-23 cs.AI 89%

Reflective Confidence: Correcting Reasoning Flaws via Online Self-Correction

反思性信心:通过在线自我纠正修正推理缺陷

Qinglin Zeng, Jing Yang, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出反思性信心框架,通过在线自我纠正修正推理缺陷,提升数学推理任务的准确性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19206 2025-12-23 cs.LG cs.AI 86%

MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning

MixKVQ: 为长上下文推理的查询感知混合精度KV缓存量化

Tao Zhang, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Pazhou Laboratory(琶洲实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 MixKVQ通过查询感知的混合精度量化策略,提升长上下文推理性能并降低内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09566 2025-12-23 cs.CL 85%

Syzygy of Thoughts: Improving LLM CoT with the Minimal Free Resolution

思想的syzygy:通过最小自由分解改进LLM的CoT

Chenghao Li, Chaoning Zhang, Yi Lu, Jiaquan Zhang, Qigan Sun, Xudong Wang, Jiwei Wei, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * UESTC(乌东德科技大学) CNU(中国矿业大学) KHU(韩国大学) Tongji Univ(同济大学)

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 Syzygy of Thoughts通过引入最小自由分解方法,改进LLM的链式思维推理,提升复杂问题的解决能力和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02341 2025-12-23 cs.CV cs.AI cs.LG 81%

GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning

GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估

Zhun Mou, Bin Xia, Zhengchao Huang, Wenming Yang, Jiaya Jia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) Department of Computer Science(计算机科学系) Engineering, The Hong Kong University of Science(工程,香港科学大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19247 2025-12-23 cs.CL cs.AI 79%

Auto-Prompting with Retrieval Guidance for Frame Detection in Logistics

基于检索引导的自动提示法用于物流帧检测

Do Minh Duc, Quan Xuan Truong, Nguyen Tat Dat, Nguyen Van Vinh

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于检索引导的自动提示法,通过优化提示提升物流文本帧检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19414 2025-12-23 cs.CR cs.CL 74%

From Retrieval to Reasoning: A Framework for Cyber Threat Intelligence NER with Explicit and Adaptive Instructions

从检索到推理:一个面向网络威胁情报实体识别的框架,具有显式和自适应指令

Jiaren Peng, Hongda Sun, Xuan Tian, Cheng Huang, Zeqing Li, Rui Yan

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, Ministry of Education, China(教育部下一代智能搜索与推荐工程研究中心)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

AI总结 本文提出TTPrompt框架,通过显式指令和反馈驱动细化,提升网络威胁情报实体识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18730 2025-12-23 cs.LG 70%

A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models

通过能量模型的理论视角提升强化学习调优语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 本文通过能量模型视角,揭示了强化学习调优语言模型的理论基础,证明了其在指令遵循和推理任务中的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16214 2025-12-23 cs.AI 70%

PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving

PDE-Agent:一种增强工具链的多智能体框架用于PDE求解

Jianming Liu, Ren Zhu, Jian Xu, Kun Ding, Xu-Yao Zhang, Gaofeng Meng, Cheng-Lin Liu

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PDE-Agent通过增强工具链的多代理协作框架,实现从自然语言描述中自动化的PDE求解。

Comments Adding Affiliation Information on arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19250 2025-12-23 cs.LG cs.PL 57%

Small Language Models as Compiler Experts: Auto-Parallelization for Heterogeneous Systems

小型语言模型作为编译器专家:异构系统的自动并行化

Prathamesh Devadiga

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用小型语言模型提升异构系统自动并行化性能,通过多种模型和策略在科学计算等领域实现显著加速。

Comments Accepted at NeurIPS 2025 ML for Systems Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19084 2025-12-23 cs.AI 57%

$γ(3,4)$ `Attention' in Cognitive Agents: Ontology-Free Knowledge Representations With Promise Theoretic Semantics

$γ(3,4)$ 注意力在认知代理中的应用:基于承诺理论语义的知识表示

Mark Burgess

机构 * Oslo University College Chitek-i AS(奥斯陆大学学院奇特克-艾公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于承诺理论语义的$γ(3,4)$图表示方法,通过特征角色分类替代复杂本体,提升不确定性条件下的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18779 2025-12-23 cs.CL physics.acc-ph 57%

From Natural Language to Control Signals: A Conceptual Framework for Semantic Channel Finding in Complex Experimental Infrastructure

从自然语言到控制信号:复杂实验基础设施中语义通道寻找的概念框架

Thorsten Hellert, Nikolay Agladze, Alex Giovannone, Jan Jug, Frank Mayet, Mark Sherwin, Antonin Sulc, Chris Tennant

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California Santa Barbara(加州大学圣巴巴拉分校) Deutsches Elektronen-Synchrotron DESY(德意志电子同步辐射研究中心DESY) Thomas Jefferson National Accelerator Facility(托马斯·杰斐逊国家加速器设施) Cosylab USA(Cosylab美国分公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种概念框架,用于在复杂实验基础设施中通过语义方法寻找控制信号,通过四个范式指导架构选择,实现了90-97%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18094 2025-12-23 cs.AI cs.MA 57%

Rethinking Multi-Agent Intelligence Through the Lens of Small-World Networks

通过小世界网络的视角重新思考多智能体智能

Boxuan Wang, Zhuoyun Li, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool(计算机科学与信息学院,利物浦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过小世界网络视角重新思考多智能体智能,提出基于不确定性引导的重 wiring 方案,实现稳定且可扩展的多智能体系统设计。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02800 2025-12-23 cs.CL 57%

Survey and Experiments on Mental Disorder Detection via Social Media: From Large Language Models and RAG to Agents

面向社交媒体的抑郁症检测综述与实验:从大型语言模型和RAG到代理

Zhuohan Ge, Darian Li, Yubo Wang, Nicole Hu, Xinyi Zhu, Haoyang Li, Xin Zhang, Mingtao Zhang, Shihao Qi, Yuming Xu, Han Shi, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文综述并实验了基于社交媒体的抑郁症检测方法,探讨了LLM、RAG和代理系统在提升检测可靠性与推理能力中的应用。

Comments 20 pages, 10 figures. This is an extension of ICDEW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00908 2025-12-23 cs.CV cs.GR 50%

GraphGeo: Multi-Agent Debate Framework for Visual Geo-localization with Heterogeneous Graph Neural Networks

GraphGeo: 多智能体辩论框架用于具有异构图神经网络的视觉地定位

Heng Zheng, Yuling Shi, Xiaodong Gu, Haochen You, Zijian Zhang, Lubin Gan, Hao Zhang, Wenjun Huang, Jin Huang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 GraphGeo通过异构图神经网络的多智能体辩论框架,提升视觉地定位的准确性与鲁棒性。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 21 篇

2512.17911 2025-12-23 cs.CL cs.AI cs.LG 85%

Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models

面向多模态大语言模型的推理保留反学习

Hongji Li, Junchi yao, Manjiang Yu, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) University of Queensland(昆士兰大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology (KAUST)(卡塔尔科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出R-MUSE框架,通过子空间指导和自适应引导,在推理过程中有效消除多模态大语言模型中的推理痕迹,同时保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19317 2025-12-23 cs.AI 83%

SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models

SafeMed-R1: 为视觉-语言模型中的通用性和鲁棒性医疗推理设计的对抗强化学习

A. A. Gde Yogi Pramana, Jason Ray, Anthony Jaya, Michael Wijaya

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 SafeMed-R1通过对抗训练与组相对策略优化提升视觉-语言模型在医疗推理中的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19526 2025-12-23 cs.AI 79%

QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models

QuantiPhy:一种评估视觉-语言模型物理推理能力的定量基准

Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei-fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 QuantiPhy通过定量评估视觉-语言模型的物理推理能力,揭示其在运动学属性推断中的数值准确性与定性合理性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18906 2025-12-23 cs.CL 79%

Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations

Remedy-R:无错误标注的机器翻译评估生成推理

Shaomu Tan, Ryosuke Mitani, Ritvik Choudhary, Qiyu Wu, Toshiyuki Sekiya, Christof Monz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Remedy-R是一种无需错误标注的生成式机器翻译评估方法,通过强化学习训练,提供可解释的评估和翻译改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17602 2025-12-23 cs.CL 79%

LexChain: Modeling Legal Reasoning Chains for Chinese Tort Case Analysis

LexChain:为中文侵权案件分析建模法律推理链

Huiyuan Xie, Chenyang Li, Huining Zhu, Chubin Zhang, Yuxiao Ye, Zhenghao Liu, Zhiyuan Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LexChain框架,用于显式建模中国侵权案件中的法律推理过程,通过构建评估基准和基线方法,提升了语言模型在民事侵权分析中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15210 2025-12-23 cs.CL cs.IR 79%

Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs

对先验的探讨:大型语言模型在知识图谱上的可信推理

Jie Ma, Ning Qu, Zhitao Gao, Rui Xing, Jun Liu, Hongbin Pei, Jiang Xie, Linyun Song, Pinghui Wang, Jing Tao, Zhou Su

机构 * MOE KLINNS Lab, Xi’an Jiaotong University(MOE KLINNS实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) School of Artificial Intelligence, Chongqing University of Post and Telecommunications(人工智能学院,重庆邮电大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出DP框架,通过整合知识图谱的结构和约束先验,提升大型语言模型在知识图谱上的推理准确性和响应可靠性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 74%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17436 2025-12-23 cs.CV 67%

Xiaomi MiMo-VL-Miloco Technical Report

小米 MiMo-VL-Miloco 技术报告

Jiaze Li, Jingyang Chen, Yuxun Qu, Shijie Xu, Zhenru Lin, Junyou Zhu, Boshen Xu, Wenhui Tan, Pei Fu, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Xiaomi(小米)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18014 2025-12-23 cs.CL cs.AI cs.LG 67%

ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India

ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索

Shubham Kumar Nigam, Tanuj Tyagi, Siddharth Shukla, Aditya Kumar Guru, Balaramamahanthi Deepak Patnaik, Danush Khanna, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。

Comments Accepted in AILaw @ AAAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19428 2025-12-23 cs.LG cs.AI math.AG 62%

Attention Is Not What You Need

注意力不是你需要的

Zhang Chong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于格拉斯曼流的无注意力架构,通过低秩子空间操作实现更结构化的神经推理,实验显示其在语言建模和自然推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18309 2025-12-23 cs.LG cs.AI 62%

Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings

通过可微内部对齐嵌入实现嵌入式安全对齐智能

Harsh Rathva, Ojas Srivastava, Pruthwik Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。

Comments 32 pages, 1 figure. Theoretical framework; no empirical results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19210 2025-12-23 cs.AI 61%

Observer, Not Player: Simulating Theory of Mind in LLMs through Game Observation

观察者,而非玩家:通过游戏观察模拟大语言模型中的理论心理论

Jerry Wang, Ting Yiu Liu

机构 * Department of Management Information Systems, National ChengChi University(管理信息系,国立中正大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI

AI总结 通过游戏观察模拟大语言模型中的理论心理论,评估其在顺序行为中的推理能力。

Comments Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL 57%

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 57%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18658 2025-12-23 cs.CL 57%

Does It Tie Out? Towards Autonomous Legal Agents in Venture Capital

是否会平局?迈向风险投资领域的自主法律代理

Pierre Colombo, Malik Boudiaf, Allyn Sweet, Michael Desa, Hongxi Wang, Kevin Candra, Syméon del Marmol

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种世界模型架构,旨在实现风险投资领域资本表核对的自动化,为法律智能提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏