An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Under review
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Under review
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Accepted in COLING 2025
专题命中 推理评测 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024 Findings
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
小型视觉-语言模型在定性力学问题上的评估
机构 * Louisiana State University of New Orleans(新奥尔良路易斯安那州立大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract,journal_ref);分类 cs.AI
AI总结 本研究评估Gemma-3和Qwen-VL两个多模态模型解读力学问题图像的能力,通过思维链评估其推理过程,对比答案测准确率,为小型视觉-语言模型在定性力学问题上的应用提供评估依据。
Comments 8 pages, 11 figures
Journal ref Proceedings of the IJCAI Workshop on 38th International Workshop on Qualitative Reasoning (QR 2025). 2025
VizAnchor:通过双锚推理从篡改可视化中解码操纵意图
机构 * School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) ; Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域分部) ; School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出VizAnchor框架,通过双锚构建与VLM推理实现可视化操纵理解,含三个专用智能体,构建相关数据集,可准确定位篡改并生成忠实解释。
Comments 39 pages
DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; University of Macau(澳门大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。
Comments Accepted by BMVC2026
空间-DisE:评估视觉语言模型空间推理能力的统一基准
机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。
Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/
IntentQA:基于认知上下文推理的视频意图问答
机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) ; Beijing Jiaotong University(北京交通大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。
Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 9, pp. 11044-11061, September 2026
WADE:面向紧凑视觉-语言模型的多实例漂浮垃圾定位推理标注基准
机构 * United International University(联合国际大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对内陆漂浮垃圾监测需求,研究推出WADE基准并评估6种VLMs,微调Qwen3-VL-2B可提升性能但仍有大量实例未被检测,为紧凑VLMs的漂浮垃圾定位提供挑战基准。
UR²-MLLM:面向放射科报告生成的多模态大语言模型中基于不确定性感知的重访推理
机构 * MedVisAI Lab(MedVisAI实验室) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) ; Centre of AI in Medicine, Singapore(新加坡医学人工智能中心) ; AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)AI方向) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究针对放射科报告生成任务,提出UR²-MLLM框架,通过动态重访不确定区域的机制实现最优性能,提升报告的可靠性与临床适配性。
Comments EMNLP 2026 Findings
无文档移动数据库中的结构推断:用于评估数字取证中智能体推理能力的可复现基准
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究构建了可复现基准,评估智能体对无文档移动数据库的结构推断能力,发现其在规则模式下可靠,模式模糊时性能骤降,需额外验证以确保推断关系可作为可靠取证证据。
Comments 10 pages, 2 figures. Published in Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, July 2026
Journal ref Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, 2026
面向安全关键工业过程异常状况管理的大型推理模型
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究提出通用大型推理模型,通过有界经程序验证的动作接口管理安全关键工业过程的异常状况,在39种异常测试中表现优于基础调节控制,可实现无需人类参与的运行时异常状况管理。
CAViAR:用于真实场景细粒度事故推理的因果视频数据集
机构 * NEC Laboratories, America(美国NEC实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。
Comments Accepted to ECCV 2026 Workshop DriveX
PathoArgus:推进千兆像素全切片与多切片病例语境下基于证据的长上下文视觉推理
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 研究针对病理视觉推理的证据基础评估缺口,构建PathoArgus-Bench基准与ESG受控集,发现现有模型准确率高但证据基础弱,提出PathoArgus阅读器,呼吁转向证据导向的评估。
ChainSpace:面向空间智能的链式推理范式
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Li Auto Inc.(理想汽车有限公司)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。
AeroGround:用于空-地协同推理的综合基准
机构 * Shanghai Innovation Institute(上海创新研究院) ; College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Chongqing Technology and Business University(重庆工商大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。
RingMo-Agent: 多平台多模态遥感基础模型
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 RingMo-Agent是一种多平台多模态遥感基础模型,通过大规模数据集和任务特定标记提升遥感图像的感知与推理能力。
Comments 24 pages, 5 figures, 20 tables
ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。
基础模型在纵向MRI疾病进展推理中的表现如何?
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Department of Health Abu Dhabi(阿布扎比卫生部) ; Fatima College of Health Sciences(法蒂玛健康科学学院) ; Linköping University(林雪平大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究推出Time-Aware Multi-View MRI基准,评估16个视觉-语言模型在纵向MRI疾病进展推理中的表现,发现模型在变化方向识别等方面存在缺陷,多视角输入对模型性能有特定影响。
Comments Accepted at MICCAI 2026 (Early Accept). 11 pages, 3 figures, 2 tables
Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。
Comments 8 pages, 3 figures
ExpertVerse:知识密集型视觉合成中专家级推理的通用基准
专题命中 推理评测 :reasoning(title,abstract)
AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。
Comments 14 pages, 6 figures
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
机构 * New York University(纽约大学) ; Sensetime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; New York University Shanghai(上海纽约大学) ; University of Georgia(佐治亚大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。
Comments 33 pages, 16 figures
OneEmo:用于情感感知、理解与交互的统一多模态推理模型
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。
超越相关性:面向智能体的全切片图像推理的贝叶斯证据获取
机构 * A*STAR(新加坡科技研究局)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究提出BEACON框架,将WSI推理建模为贝叶斯证据获取问题,通过最大化预期信息增益减少诊断不确定性,在五个WSI-VQA基准的零样本实验中,其性能优于同类无训练智能体框架,提升了证据获取效率。
基于双加工推理风险的多智能体AI课堂:面向未来物理教师的试点研究
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究构建基于双加工理论风险框架的多智能体AI模拟课堂,用于培养未来物理教师回应学生推理的能力,发现其能显著提升诊断分数,且可揭示教师知与行的发展差距,为物理教师培养提供支持。
Comments 16 pages, 4 figures, 3 tables