Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning
笔算谜题基准:多步骤可验证推理的基准
机构 * Approximate Labs
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
笔算谜题基准:多步骤可验证推理的基准
机构 * Approximate Labs
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。
MMR-Life: 组合真实场景以进行多模态多图像推理
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。
Comments Accepted by ICLR 2026, 78 pages, 60 figures
用于金融技术分析的时间序列推理
机构 * National University of Singapore(国立新加坡大学) ; Technical University of Munich(慕尼黑技术大学) ; Singapore Management University(新加坡管理学院) ; City University of Hong Kong(香港城市大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 VTA通过结合语言和潜在推理,生成准确且可解释的股票时间序列预测,展示了在金融技术分析中的优越性能。
Comments ICLR 2026
在推理模型中基准污染检测的脆弱性
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Washington(华盛顿大学)
专题命中 推理评测 :reasoning(title);CoT(abstract);分类 cs.AI、cs.LG
AI总结 研究发现LRMs在基准污染检测中存在脆弱性,通过简单方法可轻易污染模型以提升排行榜表现,威胁评估公平性。
Comments Accepted by ICLR 2026
当推理遇见压缩:理解LLMs压缩对大推理模型的影响
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了压缩对大推理模型的影响,通过基准测试和机制解释,发现权重数量对知识记忆的影响大于推理,并揭示了蒸馏模型中关键组件的重要性。
Comments ICLR 2026
ToolDreamer: 将大语言模型推理能力注入工具检索器
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Bosch Research North America(博世北美研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 ToolDreamer通过合成工具描述来改进工具检索,提升稀疏和密集检索器性能,减少LLM上下文窗口压力。
Comments Accepted to EACL 2026 (main/oral)
马尔可夫ODE引导的评分可以评估语言模型离线推理轨迹的质量
机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(电子工程系,印度理工学院德里) ; Indian Institute of Technology Delhi(印度理工学院德里) ; Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(人工智能学院,印度理工学院德里)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 MarODE通过马尔可夫模型和常微分方程评估语言模型推理轨迹质量,有效提升评估性能。
DIVA-GRPO:通过难度自适应变体优势增强多模态推理
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; Kuaishou Technology, Beijing, China(快手科技,北京,中国)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 DIVA-GRPO通过难度自适应变体优势方法提升多模态推理能力,解决GRPO在困难问题上的奖励稀疏性和优势消失问题,提升训练稳定性与推理性能。
Comments Accepted to ICLR 2026. Code and models are available at https://github.com/Siaaaaaa1/DIVA-GRPO
迈向临床可解释的AI:通过强化学习实现人友好的推理基础模型
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 DeepMedix-R1通过强化学习实现临床可解释的AI,生成透明推理过程,优于现有模型,提升医学诊断的可解释性和实用性。
Comments 35 pages
AnesSuite: 一个用于LLM麻醉推理的全面基准和数据集套件
机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心和多媒体与网络通信工程湖北省重点实验室、武汉大学) ; Department of Anesthesiology, Zhejiang Cancer Hospital, China(麻醉科、浙江省癌症医院) ; Institute of Medicine, Chinese Academy of Sciences, Hangzhou, Zhejiang, China(医学研究所、中国科学院、杭州、浙江) ; Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光耀医学院、南洋理工大学、新加坡) ; Centre of AI in Medicine, Nanyang Technological University, Singapore(医学人工智能中心、南洋理工大学、新加坡) ; Department of Anesthesiology, First People’s Hospital of Yunnan Province, China(麻醉科、云南第一人民医院) ; Kunming University of Science and Technology, China(昆明理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 AnesSuite为LLM麻醉推理提供首个全面基准和数据集,开发Morpheus模型在麻醉领域实现显著性能提升。
Comments Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;
RAVEL: 用于验证和评估大语言模型文本合成的推理代理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 RAVEL通过引入智能体框架和C3EBench基准,评估LLM在文本合成中的推理能力,发现推理能力比生成能力更重要。
Comments 35 pages, 7 figures
方向性推理轨迹变化(DRTC):在推理模型中识别关键轨迹段
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 DRTC通过过程因果方法识别推理模型中的关键轨迹段,揭示特定上下文元素如何引导推理轨迹。
TACIT基准:一个生成和判别模型的程序化视觉推理基准
机构 * Independent Researcher(独立研究者)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。
Comments 10 pages, 4 figures, 5 tables
SportR:多模态大语言模型在体育中的推理基准
机构 * Department of Computer Science, Rice University(Rice大学计算机科学系) ; Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) ; Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系) ; College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院) ; Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) ; Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 SportR是一个多体育大规模基准,旨在训练和评估多模态大语言模型在体育推理中的能力,通过精细的视觉感知和规则推理任务提升模型性能。
SToLa:具有触觉常识推理的自适应触觉-语言框架在开放性场景中
专题命中 推理评测 :reasoning(title,abstract)
AI总结 SToLa通过专家混合架构实现触觉与语言模态的自适应统一,解决开放性场景中触觉常识推理的挑战,提升多模态推理性能。
Comments Accepted by AAAI 2026
揭示认知罗盘:基于理论of-Mind的多模态情感推理
机构 * National University of Singapore(新加坡国立大学) ; Huazhong University of Science and Technology(华中科技大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出HitEmotion基准和TMPO方法,通过理论of-Mind引导多模态情感推理,提升模型情感理解和认知能力。
Comments Accepted by ICLR 2026
通过探索进行推理:一种统一的图检索与生成方法
专题命中 推理评测 :reasoning(title,abstract)
AI总结 RoE通过统一检索与生成过程,利用图探索机制提升大型语言模型在结构化图推理中的性能与泛化能力。
CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程
机构 * Northeastern University(东北大学) ; Brookhaven National Laboratory(布鲁克海文国家实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。
前沿模型能够以低概率采取行动
机构 * MATS ; Google DeepMind(谷歌DeepMind)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 前沿模型在低概率下执行目标行动时表现良好,但缺乏熵源时难以保持校准。
多模态强化学习中的token感知聚焦
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Wuhan University(武汉大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。
Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL
CityLens:评估大型视觉-语言模型用于城市社会经济感知
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) ; School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。
Comments Accepted by ICLR 2026
思考模型能否通过思考来检测仇恨言论?
机构 * Qatar University(卡塔尔大学) ; Qatar Computing Research Institute(卡塔尔计算研究中心)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出基于强化学习的后训练框架,通过任务特定奖励和GRPO目标提升基于思考的多模态模型在检测仇恨言论中的推理能力,实验表明在准确性、F1值和解释质量上均有显著提升。
Journal ref In Companion Proceedings of the ACM Web Conference 2026 (WWW Companion 26), April 13-17, 2026, Dubai, United Arab Emirates
SPARE:基于参考引导评估的单次标注用于自动过程监督与奖励建模
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SPARE通过单次生成与参考引导评估,实现高效过程标注,提升LLM多步推理中的奖励建模与微调效果。
Comments Accepted to AAAI 2026 (Oral)
ScholarEval: 基于文献的研究思想评估
机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) ; Division of Medicinal Chemistry and Pharmacognosy, The Ohio State University(俄亥俄州立大学药物化学与药理学系) ; Department of Wildlife, Fisheries, and Conservation Biology, The University of Maine(缅因大学野生动物、渔业与保育生物学系) ; McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦格尼恩脑研究 institute) ; Center for Cognitive and Behavioral Brain Imaging, The Ohio State University(俄亥俄州立大学认知与行为脑成像中心) ; Department of Chemistry, University of Wisconsin-Madison(威斯康星大学麦迪逊分校化学系) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ScholarEval通过基于文献的评估框架,有效评估研究思想的实证有效性与创新性,优于现有基线方法。
EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力
机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) ; Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) ; Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) ; School of Humanities, Tallinn University(塔林大学人文学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。
根据我:长期个性化参照记忆问答
机构 * Department of Engineering, University of Cambridge, United Kingdom(剑桥大学工程系) ; Department of Physics, University of Cambridge, United Kingdom(剑桥大学物理系) ; Independent Researcher(独立研究者)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ATM-Bench,首个多模态多来源个性化参照记忆问答基准,并提出Schema-Guided Memory方法提升记忆推理性能
Comments Preprint
法律RAG基准:法律RAG的端到端评估基准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 Legal RAG Bench通过评估法律RAG系统端到端性能,发现信息检索是性能的主要驱动因素,Kanon 2嵌入器显著提升了正确性和基础性。
Comments 13 pages, 3 figures, 4 tables
PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准
机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) ; Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) ; Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) ; Allen Institute for AI(Allen人工智能研究所) ; Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) ; Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。
SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距
机构 * Allen Institute for AI(艾伦人工智能研究所) ; NVIDIA(英伟达) ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。
Comments ICLR 2026
LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准
机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。