arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-18 至 2025-12-18 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4 篇

2512.15358 2025-12-18 cs.CL 83%

Dual-Density Inference for Efficient Language Model Reasoning

双密度推理用于高效语言模型推理

Zhengyi Zhao, Shubo Zhang, Yuxi Zhang, Huimin Wang, Binyang Li, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Shenzhen University(深圳大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 Denser通过双密度推理框架,优化语言模型在推理和回答阶段的信息密度,减少token消耗达62%,提升复杂推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14235 2025-12-18 cs.CL 79%

Towards Robust Knowledge Representations in Multilingual LLMs for Equivalence and Inheritance based Consistent Reasoning

多语言大语言模型中基于等价与继承的稳健知识表示研究

Gaurav Arora, Srujana Merugu, Shreya Jain, Vaibhav Saxena

机构 * Amazon(亚马逊公司) IIT Jammu(印度理工学院贾姆鲁)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过引入多语言任务和基准,评估LLMs在等价和继承推理中的稳健性,并提出组合表示以提升跨语言一致性。

Journal ref NAACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15312 2025-12-18 cs.CL cs.AI 62%

Evaluating LLMs for Zeolite Synthesis Event Extraction (ZSEE): A Systematic Analysis of Prompting Strategies

评估用于沸石合成事件提取(ZSEE)的LLM:对提示策略的系统分析

Charan Prakash Rathore, Saumi Ray, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(巴尔·印度技术科学学院,比兰利,印度)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了不同提示策略在沸石合成事件提取中的效果,发现零样本方法在事件分类上表现优异,但细粒度提取任务需领域适应模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07400 2025-12-18 cs.MA cs.AI cs.CV cs.LG 62%

MedChat: A Multi-Agent Framework for Multimodal Diagnosis with Large Language Models

MedChat: 一种基于大语言模型的多智能体多模态诊断框架

Philip R. Liu, Sparsh Bansal, Jimmy Dinh, Aditya Pawar, Ramani Satishkumar, Shail Desai, Neeraj Gupta, Xin Wang, Shu Hu

机构 * University at Albany, State University of New York(纽约州立大学阿布扎克分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MedChat通过多智能体框架结合专用视觉模型和角色特定LLM代理,提升多模态诊断的可靠性与交互性。

Journal ref Proc. 2025 IEEE 8th International Conference on Multimedia Information Processing and Retrieval (MIPR), pp. 456-462, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 13 篇

2512.14691 2025-12-18 cs.CL cs.CV 83%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09677 2025-12-18 cs.CV cs.AI 83%

Benchmarking Gaslighting Negation Attacks Against Reasoning Models

对抗性否定攻击下推理模型的基准测试

Bin Zhu, Hailong Yin, Jingjing Chen, Yu-Gang Jiang

机构 * Singapore Management University, Singapore College of Computer Science(新加坡国立管理学院计算机科学学院) Artificial Intelligence, Fudan University, China(人工智能,复旦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了三种顶级推理模型在对抗性否定攻击下的表现,发现其准确率显著下降,并提出了GaslightingBench-R基准以进一步研究模型对这类攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14766 2025-12-18 cs.AI cs.LG 81%

GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge

GR-Agent: 在不完整知识图谱下适应性图推理代理

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Jiaoyan Chen, Steffen Staab, Yuan He, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Oxford(牛津大学) Amazon(亚马逊) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GR-Agent通过构建交互环境并利用图推理工具,在不完整知识图谱中实现更有效的推理,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15442 2025-12-18 cs.LG 79%

Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting

通过链式推理和任务指令提示降低版权侵权风险

Neeraj Sarna, Yuanyuan Li, Michael von Gablenz

机构 * Munich RE(慕尼黑RE)

专题命中 推理评测 :chain-of-thought(title,abstract);分类 cs.LG

AI总结 本文通过链式推理和任务指令提示结合负提示和提示重写,降低生成图像的版权侵权风险,并评估不同模型复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15634 2025-12-18 cs.CL cs.AI cs.LG 67%

How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness

过多的幅度有多大?探索LoRA秩的权衡以保留知识和领域鲁棒性

Darshita Rathore, Vineet Kumar, Chetna Bansal, Anindya Moitra

机构 * PayPal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨LoRA秩配置在保留知识和领域鲁棒性方面的权衡,通过多任务评估展示LoRA在推理任务中的竞争力。

Comments Accepted at AACL IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10422 2025-12-18 cs.CL cs.AI 62%

Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers

协作检索增强生成用于问答:通过对比层进行互信息交换和排序

Youmin Ko, Sungjong Seo, Hyunjoon Kim

机构 * Department of Artificial Intelligence, Hanyang University(人工智能学院,翰阳大学) Department of Data Science, Hanyang University(数据科学学院,翰阳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CoopRAG通过协作检索与生成机制,提升问答任务中检索与生成的准确性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15699 2025-12-18 cs.LG cs.SE 57%

FrontierCS: Evolving Challenges for Evolving Intelligence

FrontierCS: 蒸馏智能面临的挑战

Qiuyang Mang, Wenhao Chai, Zhifei Li, Huanzhi Mao, Shang Zhou, Alexander Du, Hanchen Li, Shu Liu, Edwin Chen, Yichuan Wang, Xieting Chu, Zerui Cheng, Yuan Xu, Tian Xia, Zirui Wang, Tianneng Shi, Jianzhu Yao, Yilong Zhao, Qizheng Zhang, Charlie Ruan, Zeyu Shen, Kaiyuan Liu, Runyuan He, Dong Xing, Zerui Li, Zirong Zeng, Yige Jiang, Lufeng Cheng, Ziyi Zhao, Youran Sun, Wesley Zheng, Meiyuwang Zhang, Ruyi Ji, Xuechang Tu, Zihan Zheng, Zexing Chen, Kangyang Zhou, Zhaozi Wang, Jingbang Chen, Aleksandra Korolova, Peter Henderson, Pramod Viswanath, Vijay Ganesh, Saining Xie, Zhuang Liu, Dawn Song, Sewon Min, Ion Stoica, Joseph E. Gonzalez, Jingbo Shang, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) UCSD(加州大学圣迭戈分校) X-camp Academy(X-camp学院) Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学) University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) New York University(纽约大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 FrontierCS是一个针对未知最优解的计算机科学开放性问题基准测试,旨在评估模型在算法和研究任务中的推理能力,发现现有模型在复杂问题上仍需提升。

Comments Code with instruction: https://github.com/FrontierCS/Frontier-CS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 57%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 57%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14797 2025-12-18 eess.IV cs.AI cs.CV 57%

Artificial Intelligence for the Assessment of Peritoneal Carcinosis during Diagnostic Laparoscopy for Advanced Ovarian Cancer

人工智能在诊断腹腔镜手术中评估腹膜癌性病变的应用

Riccardo Oliva, Farahdiba Zarin, Alice Zampolini Faustini, Armine Vardazaryan, Andrea Rosati, Vinkle Srivastav, Nunzia Del Villano, Jacques Marescaux, Giovanni Scambia, Pietro Mascagni, Nicolas Padoy, Anna Fagotti

机构 * IRCAD, Research Institute against Digestive Cancer, Strasbourg, France(IRCAD消化道癌症研究机构,法国斯特拉斯堡) University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国) Bioimage Analysis Center, Fondazione Policlinico Universitario A. Gemelli IRCCS, Rome, Italy(生物图像分析中心,意大利罗马)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度学习的AI模型,用于自动评估诊断腹腔镜手术视频中的腹膜癌性病变,提高FS评分的可重复性和临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 50%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05195 2025-12-18 cs.CE 50%

Using Large Language Models for Solving Thermodynamic Problems

利用大语言模型解决热力学问题

Rebecca Loubet, Pascal Zittlau, Luisa Vollmer, Marco Hoffmann, Sophie Fellenz, Fabian Jirasek, Heike Leitte, Hans Hasse

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了大语言模型在解决热力学问题中的能力,发现其在简单问题上表现良好,但在复杂问题上存在理解不足和推理能力有限的问题,需进一步整合领域知识。

Comments This document is the unedited Author's version of a Submitted Work to Computers and Chemical Engineering. 19 pages, 2 figures, SI available (15 pages)

Journal ref Comput. Chem. Eng. 204 (2026) 109333

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 4 篇

2512.15219 2025-12-18 cs.CL cs.AI 84%

RFKG-CoT: Relation-Driven Adaptive Hop-count Selection and Few-Shot Path Guidance for Knowledge-Aware QA

RFKG-CoT: 基于关系的自适应步数选择与少样本路径引导用于知识感知问答

Chao Zhang, Minghan Li, Tianrui Lv, Guodong Zhou

机构 * Chao Zhang, Minghan Li, Tianrui Lv, Guodong Zhou(张超,李明翰,吕天睿,周国栋)

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RFKG-CoT通过关系驱动的自适应步数选择和少样本路径引导,提升知识感知问答的准确性与可靠性。

Comments 9pages, 5 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14982 2025-12-18 cs.LG cs.AI cs.CL 82%

Prompt Repetition Improves Non-Reasoning LLMs

提示重复提升非推理LLMs性能

Yaniv Leviathan, Matan Kalman, Yossi Matias

机构 * Google Research(谷歌研究)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过重复输入提示提升非推理LLMs性能,无需增加生成token数量或延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15176 2025-12-18 cs.LG cs.AI 62%

DEER: Draft with Diffusion, Verify with Autoregressive Models

DEER:通过扩散模型草稿,通过自回归模型验证

Zicong Cheng, Guo-Wei Yang, Jia Li, Zhijie Deng, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DEER通过扩散模型草稿和自回归模型验证,实现高效推测解码,大幅提升解码速度和草稿长度。

Comments Homepage : https://czc726.github.io/DEER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14884 2025-12-18 cs.CV 50%

Vibe Spaces for Creatively Connecting and Expressing Visual Concepts

通过 vibe 空间创造性连接和表达视觉概念

Huzheng Yang, Katherine Xu, Andrew Lu, Michael D. Grossberg, Yutong Bai, Jianbo Shi

机构 * UPenn(宾夕法尼亚大学) CUNY(纽约大学) UC Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract)

AI总结 Vibe Space 通过学习低维测地线实现视觉概念的创造性连接与表达,生成更具创造性和连贯性的混合体。

Comments Project page: https://huzeyann.github.io/VibeSpace-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏