arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-17 至 2025-12-17 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 13 篇

2508.01977 2025-12-17 cs.CL cs.AI 92%

TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models

TIBSTC-CoT:一种用于语言模型链式推理的多领域指令数据集

Fan Gao, Cheng Huang, Nyima Tashi, Yutong Liu, Xiangxiang Wang, Thupten Tsering, Ban Ma-bao, Renzeg Duojie, Gadeng Luosang, Rinchen Dongrub, Dorje Tashi, Xiao Feng, Hao Wang, Yongbin Yu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

AI总结 TIBSTC-CoT通过链式推理提示法构建多领域藏语数据集,开发出具备推理能力的藏语LLM,提升低资源语言处理性能。

Comments We will merge this paper with arXiv:2503.18288

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13573 2025-12-17 cs.CV 82%

MMhops-R1: Multimodal Multi-hop Reasoning

MMhops-R1: 多模态多跳推理

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 MMhops-R1通过动态规划和多模态知识整合,提升多跳推理能力,提出新型mRAG框架并提供挑战性基准。

Comments Acceped by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20935 2025-12-17 cs.AI 79%

GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine

GALAX:图增强语言模型用于可解释的强化引导子图推理在精准医学中

Heming Zhang, Di Huang, Wenyu Li, Michael Province, Yixin Chen, Philip Payne, Fuhai Li

机构 * I2DB, Washington University School of Medicine(I2DB,华盛顿大学医学学院) Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校) Department of Genetics, Washington University School of Medicine(遗传学系,华盛顿大学医学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GALAX通过整合图神经网络与大语言模型,利用强化学习实现子图推理,提升精准医学中目标发现的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07553 2025-12-17 cs.AI 70%

COMMA: A Communicative Multimodal Multi-Agent Benchmark

COMMA:一种基于通信的多模态多智能体基准

Timothy Ossowski, Danyal Maqbool, Jixuan Chen, Zefan Cai, Tyler Bradshaw, Junjie Hu

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13741 2025-12-17 cs.LG cs.AI 62%

The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models

层流假说:通过大语言模型中的语义湍流检测对抗性突破

Md. Hasib Ur Rahman

机构 * Brac University(布拉克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13713 2025-12-17 cs.AI cs.LG cs.MA 62%

LoopBench: Discovering Emergent Symmetry Breaking Strategies with LLM Swarms

LoopBench: 通过LLM群体发现涌现的对称性打破策略

Ali Parsaee, Yashar Talebirad, Csongor Szepesvári, Vishwajeet Ohal, Eden Redman

机构 * University of Alberta(阿尔伯塔大学) Network for Applied Technology(应用技术网络)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LoopBench通过LLM群体研究分布式对称性打破策略,揭示先进模型在解决死锁问题上的能力。

Comments 11 pages, 3 figures, submitted to ANTS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08743 2025-12-17 cs.AI cs.MA 57%

Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence

单智能体扩展无法实现多智能体智能:迈向具有原生多智能体智能的基础模型

Shuyue Hu, Haoyang Yan, Yiqun Zhang, Yang Chen, Dongzhan Zhou, Lei Bai

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文指出单智能体扩展无法实现多智能体智能,提出构建具有原生多智能体智能的基础模型的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11162 2025-12-17 cs.CV cs.LG 57%

VIBE: Can a VLM Read the Room?

VIBE:视觉语言模型能否读懂房间?

Tania Chakraborty, Eylon Caplan, Dan Goldwasser

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。

Comments Findings of EMNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14312 2025-12-17 cs.CV cs.AI 57%

From YOLO to VLMs: Advancing Zero-Shot and Few-Shot Detection of Wastewater Treatment Plants Using Satellite Imagery in MENA Region

从YOLO到VLMs:利用卫星图像在中东和北非地区推进零样本和少样本废水处理厂检测

Akila Premarathna, Kanishka Hewageegana, Garcia Andarcia Mariangel

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用VLMs替代YOLOv8,通过零样本和少样本方法高效识别中东和北非地区废水处理厂,提升遥感应用的可扩展性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14233 2025-12-17 cs.SE cs.AI cs.CR 57%

PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design

PentestEval: 一种基于模块化和阶段级设计的LLM渗透测试基准测试

Ruozhao Yang, Mingfei Cheng, Gelei Deng, Tianwei Zhang, Junjie Wang, Xiaofei Xie

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) School of Cyber Security, Tianjin University(网络安全学院,天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PentestEval通过模块化和阶段级设计,评估LLM在渗透测试各阶段的性能,揭示其在自动化测试中的局限性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14141 2025-12-17 cs.CV cs.AI 57%

TorchTraceAP: A New Benchmark Dataset for Detecting Performance Anti-Patterns in Computer Vision Models

TorchTraceAP: 一种新的基准数据集,用于检测计算机视觉模型中的性能反模式

Hanning Chen, Keyu Man, Kevin Zhu, Chenguang Zhu, Haonan Li, Tongbo Luo, Xizhou Feng, Wei Sun, Sreen Tallam, Mohsen Imani, Partha Kanuparthy

机构 * University of California, Irvine(加州大学尔湾分校) Meta University of California, Riverside(加州大学河滨分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TorchTraceAP提出了一种新的基准数据集和迭代方法,用于提升ML模型检测计算机视觉模型轨迹中反模式的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14014 2025-12-17 cs.AI 57%

MobileWorldBench: Towards Semantic World Modeling For Mobile Agents

MobileWorldBench: 向移动智能体的语义世界建模迈进

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07961 2025-12-17 quant-ph cs.DS cs.LG stat.ML 57%

QCircuitBench: A Large-Scale Dataset for Benchmarking Quantum Algorithm Design

QCircuitBench:用于量子算法设计的大型数据集

Rui Yang, Ziruo Wang, Yuntian Gu, Tianyi Chen, Yitao Liang, Tongyang Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Anderson School of Management, University of California, Los Angeles(美国加州大学洛杉矶分校安德森管理学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QCircuitBench是一个用于评估AI在量子算法设计中能力的大型数据集,包含多种任务和算法,揭示了大语言模型在此领域的局限性。

Comments 45 pages, 17 figures, 15 tables, GitHub repository: https://github.com/EstelYang/QCircuitBench

详情

展开后加载摘要…

URL PDF HTML 收藏