arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-18 至 2025-12-18 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 13 篇

2512.14691 2025-12-18 cs.CL cs.CV 83%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09677 2025-12-18 cs.CV cs.AI 83%

Benchmarking Gaslighting Negation Attacks Against Reasoning Models

对抗性否定攻击下推理模型的基准测试

Bin Zhu, Hailong Yin, Jingjing Chen, Yu-Gang Jiang

机构 * Singapore Management University, Singapore College of Computer Science(新加坡国立管理学院计算机科学学院) Artificial Intelligence, Fudan University, China(人工智能,复旦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了三种顶级推理模型在对抗性否定攻击下的表现,发现其准确率显著下降,并提出了GaslightingBench-R基准以进一步研究模型对这类攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14766 2025-12-18 cs.AI cs.LG 81%

GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge

GR-Agent: 在不完整知识图谱下适应性图推理代理

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Jiaoyan Chen, Steffen Staab, Yuan He, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Oxford(牛津大学) Amazon(亚马逊) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GR-Agent通过构建交互环境并利用图推理工具,在不完整知识图谱中实现更有效的推理,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15442 2025-12-18 cs.LG 79%

Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting

通过链式推理和任务指令提示降低版权侵权风险

Neeraj Sarna, Yuanyuan Li, Michael von Gablenz

机构 * Munich RE(慕尼黑RE)

专题命中 推理评测 :chain-of-thought(title,abstract);分类 cs.LG

AI总结 本文通过链式推理和任务指令提示结合负提示和提示重写,降低生成图像的版权侵权风险,并评估不同模型复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15634 2025-12-18 cs.CL cs.AI cs.LG 67%

How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness

过多的幅度有多大?探索LoRA秩的权衡以保留知识和领域鲁棒性

Darshita Rathore, Vineet Kumar, Chetna Bansal, Anindya Moitra

机构 * PayPal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨LoRA秩配置在保留知识和领域鲁棒性方面的权衡,通过多任务评估展示LoRA在推理任务中的竞争力。

Comments Accepted at AACL IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10422 2025-12-18 cs.CL cs.AI 62%

Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers

协作检索增强生成用于问答:通过对比层进行互信息交换和排序

Youmin Ko, Sungjong Seo, Hyunjoon Kim

机构 * Department of Artificial Intelligence, Hanyang University(人工智能学院,翰阳大学) Department of Data Science, Hanyang University(数据科学学院,翰阳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CoopRAG通过协作检索与生成机制,提升问答任务中检索与生成的准确性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15699 2025-12-18 cs.LG cs.SE 57%

FrontierCS: Evolving Challenges for Evolving Intelligence

FrontierCS: 蒸馏智能面临的挑战

Qiuyang Mang, Wenhao Chai, Zhifei Li, Huanzhi Mao, Shang Zhou, Alexander Du, Hanchen Li, Shu Liu, Edwin Chen, Yichuan Wang, Xieting Chu, Zerui Cheng, Yuan Xu, Tian Xia, Zirui Wang, Tianneng Shi, Jianzhu Yao, Yilong Zhao, Qizheng Zhang, Charlie Ruan, Zeyu Shen, Kaiyuan Liu, Runyuan He, Dong Xing, Zerui Li, Zirong Zeng, Yige Jiang, Lufeng Cheng, Ziyi Zhao, Youran Sun, Wesley Zheng, Meiyuwang Zhang, Ruyi Ji, Xuechang Tu, Zihan Zheng, Zexing Chen, Kangyang Zhou, Zhaozi Wang, Jingbang Chen, Aleksandra Korolova, Peter Henderson, Pramod Viswanath, Vijay Ganesh, Saining Xie, Zhuang Liu, Dawn Song, Sewon Min, Ion Stoica, Joseph E. Gonzalez, Jingbo Shang, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) UCSD(加州大学圣迭戈分校) X-camp Academy(X-camp学院) Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学) University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) New York University(纽约大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 FrontierCS是一个针对未知最优解的计算机科学开放性问题基准测试,旨在评估模型在算法和研究任务中的推理能力,发现现有模型在复杂问题上仍需提升。

Comments Code with instruction: https://github.com/FrontierCS/Frontier-CS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 57%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 57%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14797 2025-12-18 eess.IV cs.AI cs.CV 57%

Artificial Intelligence for the Assessment of Peritoneal Carcinosis during Diagnostic Laparoscopy for Advanced Ovarian Cancer

人工智能在诊断腹腔镜手术中评估腹膜癌性病变的应用

Riccardo Oliva, Farahdiba Zarin, Alice Zampolini Faustini, Armine Vardazaryan, Andrea Rosati, Vinkle Srivastav, Nunzia Del Villano, Jacques Marescaux, Giovanni Scambia, Pietro Mascagni, Nicolas Padoy, Anna Fagotti

机构 * IRCAD, Research Institute against Digestive Cancer, Strasbourg, France(IRCAD消化道癌症研究机构,法国斯特拉斯堡) University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国) Bioimage Analysis Center, Fondazione Policlinico Universitario A. Gemelli IRCCS, Rome, Italy(生物图像分析中心,意大利罗马)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度学习的AI模型,用于自动评估诊断腹腔镜手术视频中的腹膜癌性病变,提高FS评分的可重复性和临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 50%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05195 2025-12-18 cs.CE 50%

Using Large Language Models for Solving Thermodynamic Problems

利用大语言模型解决热力学问题

Rebecca Loubet, Pascal Zittlau, Luisa Vollmer, Marco Hoffmann, Sophie Fellenz, Fabian Jirasek, Heike Leitte, Hans Hasse

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了大语言模型在解决热力学问题中的能力,发现其在简单问题上表现良好,但在复杂问题上存在理解不足和推理能力有限的问题,需进一步整合领域知识。

Comments This document is the unedited Author's version of a Submitted Work to Computers and Chemical Engineering. 19 pages, 2 figures, SI available (15 pages)

Journal ref Comput. Chem. Eng. 204 (2026) 109333

详情

展开后加载摘要…

URL PDF HTML 收藏