arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-11 至 2025-12-11 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2512.09092 2025-12-11 cs.CV 71%

Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters

解释未见的:多模态视觉-语言推理用于地下矿难中的情境感知

Mizanur Rahman Jewel, Mohamed Elmahallawy, Sanjay Madria, Samuel Frimpong

机构 * Missouri University of Science and Technology(密苏里科学与技术大学) Washington State University(华盛顿州立大学)

专题命中 推理评测 :reasoning(title)

AI总结 本文提出MDSE框架,通过多模态视觉-语言推理提升地下矿难情境感知能力,实现更准确的描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04221 2025-12-11 cs.CV 71%

MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

MoReGen:基于代码领域的文本到视频合成多智能体运动-推理引擎

Xiangyu Bai, He Liang, Bishoy Galoaa, Utsav Nandi, Shayda Moezzi, Yuhang He, Sarah Ostadabbas

机构 * Northeastern University(东北大学) University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(title)

AI总结 MoReGen通过整合多智能体大语言模型、物理模拟器和渲染器,实现了基于代码领域的文本到视频合成,强调物理精度和运动一致性,为生成符合物理原理的视频提供了一种新的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 67%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23083 2025-12-11 cs.AI cs.LG cs.SE 66%

Smaller Models, Smarter Rewards: A Two-Sided Approach to Process and Outcome Rewards

更小的模型,更聪明的奖励:一种双面方法来处理和结果奖励

Jan Niklas Groeneveld, Xi Qin, Alexander Schaefer, Yaad Oren

机构 * University of California, Irvine(加州大学尔湾分校) SAP Lab(SAP实验室) Stanford Human-Centered AI Institution(斯坦福人本AI机构)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出了一种双面方法,利用小型语言模型生成高质量代码,通过融合过程和结果奖励,提升了代码生成的搜索能力。

Comments Accepted and presented at NeurIPS 2025 Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11927 2025-12-11 cs.AI cs.CL 62%

Transparent and Coherent Procedural Mistake Detection

透明且一致的程序性错误检测

Shane Storks, Itamar Bar-Yossef, Yayuan Li, Zheyuan Zhang, Jason J. Corso, Joyce Chai

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种透明且一致的程序性错误检测方法,通过生成视觉自我对话的合理性来提高检测性能,并利用NLI模型制定自动化指标以评估生成的合理性一致性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 57%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08352 2025-12-11 cs.CV cs.AI 57%

Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception

评估小型视觉-语言模型在距离依赖性交通感知中的表现

Nikos Theodoridis, Tim Brophy, Reenu Mohandas, Ganesh Sistu, Fiachra Collins, Anthony Scanlan, Ciaran Eising

机构 * University of Limerick(利默里克大学) Data Driven Computer Engineering Research Centre(数据驱动计算机工程研究中心) Lero, The Irish Software Research Centre(Lero爱尔兰软件研究中心) Valeo Vision Systems(瓦莱欧视觉系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了小型视觉-语言模型在距离依赖性交通感知任务中的表现,发现其在感知能力上显著弱于人类。

Comments Published in IEEE Open Journal of Vehicular Technology. Final version available at: https://ieeexplore.ieee.org/document/11230063

Journal ref IEEE Open Journal of Vehicular Technology, vol. 7, pp. 54-72, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24403 2025-12-11 cs.CL cs.DB 57%

Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling

Agentar-Scale-SQL: 通过协调的测试时扩展推进文本到SQL

Pengfei Wang, Baolin Sun, Xuemei Dong, Yaxun Dai, Hongwei Yuan, Mengdie Chu, Yingqi Gao, Xiang Qi, Peng Zhang, Ying Yan

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Soochow University(苏州大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Agentar-Scale-SQL通过协调的测试时扩展策略,结合内部扩展、顺序扩展和并行扩展,提升文本到SQL的性能,在BIRD基准上达到81.67%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09913 2025-12-11 cs.CV 50%

NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway

NordFKB:挪威地理空间AI的细粒度基准数据集

Sander Riisøen Jyhne, Aditya Gupta, Ben Worsley, Marianne Andersen, Ivar Oveland, Alexander Salveson Nossum

机构 * Kartverket Kristiansand(挪威地图局克里斯蒂安桑分部) University of Agder(阿格德大学) Norkart Kristiansand(挪威地图公司克里斯蒂安桑分部)

专题命中 推理评测 :planning(abstract)

AI总结 NordFKB为挪威地理空间AI提供细粒度基准数据集,包含高分辨率影像和详细注释,支持语义分割和目标检测的标准化评估。

Comments 8 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23981 2025-12-11 cs.CV 50%

TeleEgo: Benchmarking Egocentric AI Assistants in the Wild

TeleEgo:在真实场景中评估第一人称AI助手的基准测试

Jiaqi Yan, Ruilong Ren, Jingren Liu, Shuning Xu, Ling Wang, Yiheng Wang, Xinlin Zhong, Yun Wang, Long Zhang, Xiangyu Chen, Changzhi Sun, Jixiang Luo, Dell Zhang, Hao Sun, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 推理评测 :reasoning(abstract)

AI总结 TeleEgo是一个用于评估第一人称AI助手在真实场景中多模态处理能力的基准测试,通过长持续时间流媒体数据和严格评估指标,推动未来具有更强流媒体记忆能力的助手发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02022 2025-12-11 cs.CV 50%

Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs

你看见我:一个多维基准用于评估多模态大语言模型的视觉感知

Aditya Kanade, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出‘你看见我’基准,评估多模态大语言模型的视觉感知能力,发现其在复杂任务中表现远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏