arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2509.03906 2026-03-03 cs.AI 79%

Toward Clinically Explainable AI for Medical Diagnosis: A Foundation Model with Human-Compatible Reasoning via Reinforcement Learning

迈向临床可解释的AI:通过强化学习实现人友好的推理基础模型

Qika Lin, Yifan Zhu, Bin Pu, Ling Huang, Haoran Luo, Jingying Ma, Feng Wu, Kai He, Jiaxing Xu, Zhen Peng, Tianzhe Zhao, Fangzhi Xu, Jian Zhang, Zhonghong Ou, Erik Cambria, Swapnil Mishra, Mengling Feng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeepMedix-R1通过强化学习实现临床可解释的AI,生成透明推理过程,优于现有模型,提升医学诊断的可解释性和实用性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02404 2026-03-03 cs.CL 79%

AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs

AnesSuite: 一个用于LLM麻醉推理的全面基准和数据集套件

Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心和多媒体与网络通信工程湖北省重点实验室、武汉大学) Department of Anesthesiology, Zhejiang Cancer Hospital, China(麻醉科、浙江省癌症医院) Institute of Medicine, Chinese Academy of Sciences, Hangzhou, Zhejiang, China(医学研究所、中国科学院、杭州、浙江) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光耀医学院、南洋理工大学、新加坡) Centre of AI in Medicine, Nanyang Technological University, Singapore(医学人工智能中心、南洋理工大学、新加坡) Department of Anesthesiology, First People’s Hospital of Yunnan Province, China(麻醉科、云南第一人民医院) Kunming University of Science and Technology, China(昆明理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AnesSuite为LLM麻醉推理提供首个全面基准和数据集,开发Morpheus模型在麻醉领域实现显著性能提升。

Comments Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00686 2026-03-03 cs.CL 79%

RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis

RAVEL: 用于验证和评估大语言模型文本合成的推理代理

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Bosi Wen, Yidong Wang, Lin Fan, Yilin Zhou, Zikang Wang, Wenbo Yu, Lindong Wu, Hongning Wang, Minlie Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 RAVEL通过引入智能体框架和C3EBench基准,评估LLM在文本合成中的推理能力,发现推理能力比生成能力更重要。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15332 2026-03-03 cs.LG 79%

Directional Reasoning Trajectory Change (DRTC): Identifying Critical Trace Segments in Reasoning Models

方向性推理轨迹变化(DRTC):在推理模型中识别关键轨迹段

Waldemar Chang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 DRTC通过过程因果方法识别推理模型中的关键轨迹段,揭示特定上下文元素如何引导推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00206 2026-03-03 cs.CV cs.AI 79%

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT基准:一个生成和判别模型的程序化视觉推理基准

Daniel Nobrega Medeiros

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04506 2026-03-02 cs.CL 79%

Modeling Clinical Uncertainty in Radiology Reports: from Explicit Uncertainty Markers to Implicit Reasoning Pathways

在放射学报告中建模临床不确定性:从显式不确定性标记到隐式推理路径

Paloma Rabaey, Jong Hak Moon, Jung-Oh Lee, Min Gwan Kim, Hangyul Yoon, Thomas Demeester, Edward Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出Lunguage++基准,通过显式和隐式不确定性建模方法,提升放射学报告中不确定性分析的准确性和应用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23199 2026-02-27 cs.AI 79%

SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation

SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准

Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang

机构 * Software College, Northeastern University(东北大学软件学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) University of California, Irvine(加州大学 Irvine 分校) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SC-Arena通过知识增强评估框架,为单细胞生物学中的LLM提供统一且可解释的评估方法,提升生物正确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17072 2026-02-27 cs.CL 79%

BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios

BankMathBench: 一个用于银行场景数值推理的基准测试

Yunseung Lee, Subin Kim, Youngjun Kwak, Jaegul Choo

机构 * KakaoBank Corp.(Kakao银行公司) Korea Advanced Institute of Science(韩国先进科学研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BankMathBench是一个专门针对银行场景的数值推理基准测试,通过多难度层级的任务设计提升LLMs在金融计算中的准确性和推理能力。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI 79%

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21706 2026-02-26 cs.CV cs.AI 79%

SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video

SurGo-R1:手术视频中操作区的上下文推理基准测试与建模

Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin

机构 * National University of Singapore, Singapore(新加坡国立大学) Southern Medical University, China(南方医科大学) Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SurGo-R1通过RLHF优化的多阶段架构,在手术视频中实现了高精度的操作区识别,显著优于通用视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21650 2026-02-26 cs.SI cs.AI 79%

PPCR-IM: A System for Multi-layer DAG-based Public Policy Consequence Reasoning and Social Indicator Mapping

PPCR-IM:一个多层DAG基础的公共政策后果推理与社会指标映射系统

Zichen Song, Weijia Li

机构 * Lanzhou University(兰州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PPCR-IM通过多层DAG推理和指标映射,实现公共政策后果的结构化分析与社会影响评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07667 2026-02-26 cs.AI 79%

1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning

1-2-3 Check: 通过多智能体推理增强LLM的上下文隐私

Wenkai Li, Liwen Sun, Zhenxiang Guan, Xuhui Zhou, Maarten Sap

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过多智能体推理,有效减少LLM中的私有信息泄露,提升上下文隐私保护效果。

Comments Accepted at the International Association for AI Safety and Ethics AI (IASEAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20878 2026-02-25 cs.AI 79%

Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs

通过结构化相关性图诊断视觉-语言模型中的因果推理

Dhita Putri Pratama, Soyeon Caren Han, Yihao Ding

机构 * University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ViLCaR基准,通过结构化相关性图评估视觉-语言模型的因果推理能力,发现其局限性源于结构指导不足而非推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19914 2026-02-24 cs.AI 79%

Watson & Holmes: A Naturalistic Benchmark for Comparing Human and LLM Reasoning

沃森与霍尔姆斯:一种自然情境下比较人类和大语言模型推理能力的基准

Thatchawin Leelawat, Lewis D Griffin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出沃森与霍尔姆斯桌游作为自然情境下比较人类与大语言模型推理能力的基准,展示AI模型性能随时间显著提升,特别是在解决复杂案件时的推理能力进步。

Comments 51 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 79%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18459 2026-02-24 cs.CY cs.AI 79%

From Bias Mitigation to Bias Negotiation: Governing Identity and Sociocultural Reasoning in Generative AI

从偏见缓解到偏见协商:在生成式AI中治理身份与社会文化推理

Zackary Okun Dunivin, Bingyi Han, John Bollenbocher

机构 * Institute for Social Science, University of Stuttgart(斯图加特大学社会科学研究所) Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) Department of Linguistics, University of Texas Austin TX USA(德克萨斯大学语言学系) Department of Linguistics, University of Texas(德克萨斯大学语言学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出偏见协商作为生成式AI治理身份与社会文化推理的新框架,通过实证研究探讨其在缓解偏见和提升社会公正中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17592 2026-02-23 astro-ph.IM cs.LG 79%

AstroMLab 4: Benchmark-Topping Performance in Astronomy Q&A with a 70B-Parameter Domain-Specialized Reasoning Model

AstroMLab 4: 在天文学问答中通过700亿参数领域专用模型实现基准顶级性能

Tijmen de Haan, Yuan-Sen Ting, Tirthankar Ghosal, Tuan Dung Nguyen, Alberto Accomazzi, Emily Herron, Vanessa Lama, Rui Pan, Azton Wells, Nesar Ramachandra

机构 * Institute of Particle Nuclear Studies (IPNS), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan International Center for Quantum-field Measurement Systems for Studies of the Universe Particles (QUP-WPI), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan Department of Astronomy, The Ohio State University, Columbus, OH, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH, USA National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, TN, USA Department of Computer Information Science, University of Pennsylvania, Philadelphia, PA, USA Center for Astrophysics, Harvard \& Smithsonian, Cambridge, MA, USA Siebel School of Computing Data Science, University of Illinois at Urbana-Champaign, Urbana-Champaign, IL, USA Computational Science Division, Argonne National Laboratory, Lemont, IL, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 AstroSage-Llama-3.1-70B通过700亿参数领域专用模型在天文学问答中实现顶级性能,优于GPT-5.2等通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17183 2026-02-20 cs.SE cs.AI 79%

Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering

大语言模型在长上下文代码问答中的鲁棒性与推理可信度

Kishan Maharaj, Nandakishore Menon, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在长上下文代码问答中的鲁棒性和推理可信度,通过不同设置测试发现模型在面对干扰信息时表现脆弱,揭示了现有评估的局限性。

Comments 11 pages, 4 Figures, 5 Tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14160 2026-02-17 cs.AI 79%

Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning

过程监督多智能体强化学习用于可靠的临床推理

Chaeeun Lee, T. Michael Yates, Pasquale Minervini, T. Ian Simpson

机构 * School of Informatics, University of Edinburgh, UK(信息学院,爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种过程监督的多智能体强化学习框架,用于提升基因-疾病有效性校准的临床推理准确性与过程忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13313 2026-02-17 cs.CV cs.AI 79%

Agentic Spatio-Temporal Grounding via Collaborative Reasoning

基于协作推理的代理时空 grounding

Heng Zhao, Yew-Soon Ong, Joey Tianyi Zhou

机构 * CFAR, IHPC, Agency for Science, Technology and Research(A*STAR)(CFAR、IHPC、新加坡科技研究局) CCDS, Nanyang Technological University(CCDS、南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ASTG框架,通过协作推理实现开放世界下的时空视频grounding,提升检索效率并优于现有弱监督和零样本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10246 2026-02-16 cs.DC cs.AI 79%

KORAL: Knowledge Graph Guided LLM Reasoning for SSD Operational Analysis

KORAL: 基于知识图谱的LLM推理用于SSD运维分析

Mayur Akewar, Sandeep Madireddy, Dongsheng Luo, Janki Bhimani

机构 * Florida International University, Miami, FL, USA(佛罗里达国际大学) Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KORAL结合LLM和知识图谱,实现SSD的端到端推理分析,提供专家级诊断和可解释的运维建议。

Journal ref Proc. IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14746 2026-02-16 cs.LG 79%

MissionHD: Hyperdimensional Refinement of Distribution-Deficient Reasoning Graphs for Video Anomaly Detection

MissionHD: 分布匮乏的推理图超维度细化用于视频异常检测

Sanggeon Yun, Raheeb Hassan, Ryozo Masukawa, Nathaniel D. Bastian, Mohsen Imani

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维奇分校) Department of Electrical Engineering & Computer Science United States Military Academy, West Point(电气工程与计算机科学系美国军事学院西点分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MissionHD通过超维度计算优化任务对齐的图表示,提升视频异常检测与识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 79%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15414 2026-02-13 cs.AI 79%

MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs

通过战略性大语言模型的自我对战激励多智能体推理的MARSHAL

Huining Yuan, Zelai Xu, Zheyue Tan, Xiangmin Yi, Mo Guang, Kaiwen Long, Haojia Hui, Boxun Li, Xinlei Chen, Bo Zhao, Xiao-Ping Zhang, Chao Yu, Yu Wang

机构 * SIGS, Tsinghua University(清华大学信号与系统系) EE, Tsinghua University(清华大学电子工程系) Aalto University(阿alto大学) Li Auto Inc.(李汽车公司) Infinigence AI Project Page Code Models(Infinigence AI项目页面代码模型)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MARSHAL通过战略性LLM的自我对战激励多智能体推理,实现多智能体系统的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11451 2026-02-13 cs.CL 79%

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation

LoopFormer: 基于快捷键调制的弹性深度循环变换器用于潜在推理

Ahmadreza Jeddi, Marco Ciccone, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University Health Network(大学健康网络)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 LoopFormer通过弹性深度循环变换器实现基于快捷键调制的潜在推理,具备适应不同计算预算的鲁棒性与扩展性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10787 2026-02-12 cs.SE cs.AI cs.CR cs.IR 79%

VulReaD: Knowledge-Graph-guided Software Vulnerability Reasoning and Detection

VulReaD: 基于知识图谱的软件漏洞推理与检测

Samal Mukhtar, Yinghua Yao, Zhu Sun, Mustafa Mustafa, Yew Soon Ong, Youcheng Sun

机构 * The University of Manchester(曼彻斯特大学) Agency for Science, Technology and Research(科技研究局) Singapore University of Technology and Design(新加坡科技设计大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VulReaD通过知识图谱引导的推理方法,在软件漏洞检测中实现CWE级别的分类,提升二元和多类检测性能,增强可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 79%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10210 2026-02-12 cs.LG 79%

How Much Reasoning Do Retrieval-Augmented Models Add beyond LLMs? A Benchmarking Framework for Multi-Hop Inference over Hybrid Knowledge

检索增强模型在大语言模型之上添加多少推理能力?一种用于混合知识多跳推理的基准评估框架

Junhong Lin, Bing Zhang, Song Wang, Ziyan Liu, Dan Gutfreund, Julian Shun, Yada Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 HybridRAG-Bench通过混合知识和多跳推理评估框架,有效区分真实检索与参数回忆,为混合知识增强推理系统提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17667 2026-02-12 cs.AI 79%

PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level

PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试

Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Michigan State University(密歇根州立大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏