arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-08 至 2025-12-08 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2511.16334 2025-12-08 cs.AI cs.CL 81%

OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe

OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方

Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Ziwei Liu, Xingxuan Li, Lidong Bing

机构 * MiroMind AI Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) LMMs-Lab Team(多模态实验室团队)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05954 2025-12-08 cs.AI 79%

SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code

SymPyBench: 一个用于可执行Python代码科学推理的动态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SymPyBench是一个用于科学推理的动态基准,通过可执行Python代码测试不同推理技能,提供新的评估指标以量化推理的不确定性和变化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 79%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05371 2025-12-08 cs.AI cs.AR 79%

ChipMind: Retrieval-Augmented Reasoning for Long-Context Circuit Design Specifications

ChipMind:基于检索的长上下文电路设计规范推理

Changwen Xing, SamZaak Wong, Xinlai Wan, Yanfeng Lu, Mengli Zhang, Zebin Ma, Lei Qi, Zhengxiong Li, Nan Guan, Zhe Jiang, Xi Wang, Jun Yang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChipMind通过构建领域知识图谱并结合信息论检索与意图过滤,实现对长上下文电路规范的高效推理,提升LLM在硬件设计中的应用效果。

Comments Accepted by the AAAl26 Conference Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15718 2025-12-08 cs.AI 79%

ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset

ToolMind技术报告:一个大规模、推理增强的工具使用数据集

Chen Yang, Ran Le, Yun Xing, Zhenwei An, Zongchao Chen, Wayne Xin Zhao, Yang Song, Tao Zhang

机构 * Nanbeige Lab, BOSS Zhipin(纳米白实验室,BOSS智聘) Gaoling School of Artificial Intelligence, Renmin University of China(甘露人工智能学院,中国人民大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ToolMind是一个大规模、高质量的工具使用数据集,通过合成和增强数据提升LLM代理的推理能力和工具使用性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16402 2025-12-08 cs.AI cs.CL cs.CV cs.LG cs.RO 75%

IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks

IS-Bench:评估由视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性

Xiaoya Lu, Zeren Chen, Xuhao Hu, Yijin Zhou, Weichen Zhang, Dongrui Liu, Lu Sheng, Jing Shao

机构 * Xiaoya Lu 1, 2(某大学) Zeren Chen 2, 3(某大学) Xuhao Hu 2, 4(某大学) Yijin Zhou 2(某大学) Weichen Zhang 2(某大学) Dongrui Liu 2(某大学) Lu Sheng 3(某研究所) Jing Shao 2(某研究所)

专题命中 推理评测 :chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IS-Bench通过多模态基准评估视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性,揭示现有智能体缺乏安全意识的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12208 2025-12-08 cs.AI 74%

Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering

混合知识辩论:一种用于不完整知识图谱问答的鲁棒多智能体推理框架

Jilong Liu, Pengyang Shao, Wei Qin, Fei Liu, Yonghui Yang, Richang Hong

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出DoM框架,通过多智能体辩论机制整合结构化和非结构化知识,解决不完整知识图谱问答中的知识互补性问题,并引入新数据集提升基准挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG 70%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05179 2025-12-08 cs.CL cs.AI 62%

Fine-Tuning BERT for Domain-Specific Question Answering: Toward Educational NLP Resources at University Scale

针对特定领域的问题回答微调BERT:迈向大学规模的自然语言处理资源

Aurélie Montfrond

机构 * Dept. of Electronic & Computer Engineering, University of Limerick(电子与计算机工程系,利默里克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过微调BERT模型,针对大学课程材料开发了首个领域特定问答系统,展示了基础模型在教育领域的应用潜力。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18491 2025-12-08 cs.CL cs.AI 62%

MindEval: Benchmarking Language Models on Multi-turn Mental Health Support

MindEval: 在多轮心理健康支持中对语言模型进行基准测试

José Pombal, Maya D'Eon, Nuno M. Guerreiro, Pedro Henrique Martins, António Farinhas, Ricardo Rei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MindEval通过与临床心理学家合作,提出了一种自动评估语言模型在多轮心理健康对话中表现的框架,评估了12种先进模型,发现其在复杂交互中表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11222 2025-12-08 cs.SE cs.AI cs.CL cs.IR 62%

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal

ORFuzz: 测试LLM安全的'另一面' -- 检测过度拒绝

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Jiashui Wang, Xinlei Ying, Long Liu, Wenhai Wang

机构 * Zhejiang University(浙江大学) Zhejiang University Huzhou Institute of Industrial Control Technology(浙江大学湖州工业控制技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ORFuzz通过进化测试框架系统检测LLM的过度拒绝现象,生成高覆盖率的测试用例并建立新基准,提升LLM安全性。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05557 2025-12-08 cs.CV cs.AI 57%

2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency

2K角色-10K故事:一个具有解耦控制和序列一致性的质量门控风格化叙事数据集

Xingxi Yin, Yicheng Li, Gong Yan, Chenglin Li, Jian Zhao, Cong Huang, Yue Deng, Yin Zhang

机构 * Zhejiang University(浙江大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出2K-Characters-10K-Stories数据集,通过解耦控制和质量门控机制,实现高质量的风格化叙事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05537 2025-12-08 cs.CL 57%

Automated Identification of Incidentalomas Requiring Follow-Up: A Multi-Anatomy Evaluation of LLM-Based and Supervised Approaches

自动识别需要随访的偶发瘤:基于LLM和监督方法的多解剖评估

Namu Park, Farzad Ahmed, Zhaoyi Sun, Kevin Lybarger, Ethan Breinhorst, Julie Hu, Ozlem Uzuner, Martin Gunn, Meliha Yetisgen

机构 * Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, WA, USA(生物医学信息学与医学教育系,华盛顿大学,西雅图,华盛顿州,美国) Department of Information Sciences and Technology, George Mason University, Fairfax, VA, USA(信息科学与技术系,乔治·马歇尔大学,弗吉尼亚州,美国) Department of Radiology, Te Whatu Ora Health New Zealand, Te Toka Tumai Auckland, Auckland, New Zealand(放射学系,新西兰Te Whatu Ora健康机构,奥克兰,新西兰) Department of Radiology, School of Medicine, University of Washington, Seattle, WA, USA(放射学系,医学院,华盛顿大学,西雅图,华盛顿州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于LLM和监督方法的多解剖评估,通过结构化病变标记和解剖学上下文提升偶发瘤检测性能,达到与人类专家相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI 57%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16567 2025-12-08 cs.CV cs.AI 57%

V-CECE: Visual Counterfactual Explanations via Conceptual Edits

V-CECE:通过概念编辑生成视觉反事实解释

Nikolaos Spanos, Maria Lymperaiou, Giorgos Filandrianos, Konstantinos Thomas, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(国家技术大学雅典)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 V-CECE通过概念编辑生成反事实解释,无需训练即可产生人类水平的可解释性结果。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17948 2025-12-08 cs.IR cs.AI 57%

VERIRAG: A Post-Retrieval Auditing of Scientific Study Summaries

VERIRAG:一种科学研究摘要的后检索审计

Shubham Mohole, Hongjun Choi, Shusen Liu, Christine Klymko, Shashank Kushwaha, Derek Shi, Wesam Sakla, Sainyam Galhotra, Ruben Glatt

机构 * Cornell University(康奈尔大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Illinois Urbana‑Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 VERIRAG通过后检索审计框架检测科学摘要的方法学漏洞,提升宏F1值19个百分点,提供结构化审计轨迹支持负责任的科学实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 50%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏