arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-01 至 2025-12-01 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2511.12861 2025-12-01 cs.CL cs.CV 85%

From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models

从感知到推理:深度思考赋能多模态大语言模型

Wenxin Zhu, Andong Chen, Yuchen Song, Kehai Chen, Conghui Zhu, Ziyan Chen, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Global Tone Communication Technology(全球语音通信技术)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出多模态链式思维方法,旨在提升多模态大语言模型的推理能力,通过系统性综述分析其理论基础、实现方法及未来发展方向。

Comments Survey; 7 figures, 3 tables, 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23476 2025-12-01 cs.AI 79%

Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction

通过多轮交互构建高效的LLM世界模型推理:WMAct

Bao Shu, Yan Cai, Jianjian Sun, Chunrui Han, En Yu, Liang Zhao, Jingcheng Hu, Yinmin Zhang, Haoran Lv, Yuang Peng, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学MMLab) Peking University(北京大学) StepFun Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 WMAct通过高效交互和主动推理机制,使LLM在复杂环境中实现高效世界模型推理,提升任务解决能力和迁移性能。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22903 2025-12-01 cs.CV cs.AI 79%

Leveraging Textual Compositional Reasoning for Robust Change Captioning

利用文本组合推理实现鲁棒的变更描述

Kyu Ri Park, Jiyoung Park, Seong Tae Kim, Hong Joo Lee, Jung Uk Kim

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 CORTEX通过整合文本线索和组合推理,提升图像变化描述的鲁棒性与准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09222 2025-12-01 cs.CL 79%

Toward Honest Language Models for Deductive Reasoning

迈向演绎推理中的诚实语言模型

Jiarui Liu, Kaustubh Dhole, Yingheng Wang, Haoyang Wen, Sarah Zhang, Haitao Mao, Gaotang Li, Neeraj Varshney, Jingguo Liu, Xiaoman Pan

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) Emory University(埃默里大学) Cornell University(康奈尔大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ACNCHOR方法,通过注入真实轨迹防止训练崩溃,提升语言模型在演绎推理中的诚实推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22832 2025-12-01 cs.DB 78%

Structured Multi-Step Reasoning for Entity Matching Using Large Language Model

基于大语言模型的结构化多步推理实体匹配

Rohan Bopardikar, Jin Wang, Jia Zou

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出基于结构化多步推理的实体匹配框架,通过分解匹配过程为多个推理阶段,提升大语言模型在实体匹配任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16901 2025-12-01 cs.CV 78%

R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios

R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景

Lu Zhu, Tiantian Geng, Yangye Chen, Teng Wang, Ping Lu, Feng Zheng

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。

Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04195 2025-12-01 cs.CR 75%

AutoPatch: Multi-Agent Framework for Patching Real-World CVE Vulnerabilities

AutoPatch:多智能体框架用于修补现实世界中的CVE漏洞

Minjae Seo, Wonwoo Choi, Myoungsung You, Seungwon Shin

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 AutoPatch通过多智能体框架高效修补LLM生成代码中的CVE漏洞,实现高准确率和低成本的漏洞修复

Comments 19 pages, double column, 9 figures. Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14222 2025-12-01 cs.AI cs.CL cs.LG stat.OT 75%

A Survey on Large Language Model-based Agents for Statistics and Data Science

关于基于大型语言模型的统计与数据科学代理的综述

Maojun Sun, Ruijian Han, Binyan Jiang, Houduo Qi, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。

Journal ref Am. Statist. (2025) 1-14

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22232 2025-12-01 cs.CV cs.AI cs.CL 62%

From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation

从复合图形到综合理解:开发一种从生物医学文献中基于医疗多图像基准测试和验证的多模态大语言模型

Zhen Chen, Yihang Fu, Gabriel Madera, Mauro Giuffre, Serina Applebaum, Hyunjae Kim, Hua Xu, Qingyu Chen

机构 * Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, CT 06510, USA(耶鲁医学院生物医学信息学与数据科学系,耶鲁大学,新 Haven,CT 06510,USA) School of Medicine, University of Puerto Rico, San Juan, PR 00921, USA(波多黎各大学医学院,波多黎各,San Juan,PR 00921,USA)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M3LLM,一种基于生物医学文献中复合图像的多模态大语言模型,通过分而治之策略提升多图像理解能力,实验证明其在多图像、单图像等场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10068 2025-12-01 cs.CV cs.AI cs.CL 62%

Mavors: Multi-granularity Video Representation for Multimodal Large Language Model

Mavors:多粒度视频表示用于多模态大语言模型

Yang Shi, Jiaheng Liu, Yushuo Guan, Zhenhua Wu, Yuanxing Zhang, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, Bohan Zeng, Wentao Zhang, Fuzheng Zhang, Wenjing Yang, Di Zhang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Mavors通过多粒度视频表示方法,提升多模态大语言模型在长视频理解中的时空模式保留与计算效率平衡能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22955 2025-12-01 cs.LG 57%

Experts are all you need: A Composable Framework for Large Language Model Inference

专家足矣:一种用于大语言模型推理的可组合框架

Shrihari Sridharan, Sourjya Roy, Anand Raghunathan, Kaushik Roy

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 Comp-LLM通过可组合的推理框架实现跨专家协作,提升大语言模型的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02789 2025-12-01 cs.CL 57%

Strong Memory, Weak Control: An Empirical Study of Executive Functioning in LLMs

强记忆,弱控制:对大语言模型执行功能的实证研究

Karin de Langis, Jong Inn Park, Bin Hu, Khanh Chi Le, Andreas Schramm, Michael C. Mensink, Andrew Elfenbein, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of Psychology, University of Wisconsin-Stout(心理学系,威斯尼斯托大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型在工作记忆方面表现优异,但执行功能和问题解决能力存在不足,提示需进一步改进注意力控制和认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏