arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2601.13539 2026-01-21 cs.SD 50%

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

LongSpeech: 一种可扩展的基准,用于长语音的转录、翻译和理解

Fei Yang, Xuanfan Ni, Renyi Yang, Jiahui Geng, Qing Li, Chenyang Lyu, Yichao Du, Longyue Wang, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) Shanghai Jiao Tong University(上海交通大学) Delft University of Technology(代尔夫特理工大学) Linköping University(林肯大学) University of Groningen(格罗宁根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 LongSpeech是一个大规模可扩展的语音基准,旨在评估和推动语音模型在长音频转录、翻译和理解上的能力,揭示了现有模型在多任务和高阶推理上的不足。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13299 2026-01-21 cs.CV 50%

Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams

Enginuity:构建一个复杂的工程图多领域开放数据集

Ethan Seefried, Prahitha Movva, Naga Harshita Marupaka, Tilak Kasturi, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12826 2026-01-21 cs.CV 50%

Seeing Isn't Always Believing: Analysis of Grad-CAM Faithfulness and Localization Reliability in Lung Cancer CT Classification

看见不总是相信:肺癌CT分类中Grad-CAM可信度与局部化可靠性的分析

Teerapong Panboonyuen

机构 * Chulalongkorn University(朱拉隆功大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究分析了Grad-CAM在肺癌CT分类中的可信度与局部化可靠性,揭示了其在不同模型中的表现差异及局限性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12652 2026-01-21 cs.CY 50%

Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking

大语言模型部署中的伦理风险:医疗伦理“ Jailbreak”评估

Chutian Huang, Dake Cao, Jiacheng Ji, Yunlou Fan, Chengze Yan, Hanhui Xu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了大语言模型在医疗伦理领域面临的安全风险,发现七种主流模型在对抗测试中表现不一,其中Claude-Sonnet-4-Reasoning表现最稳健,而其他五种模型几乎全部失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21772 2026-01-21 econ.GN q-fin.EC 50%

A Unified Metric Architecture for AI Infrastructure: A Cross-Layer Taxonomy Integrating Performance, Efficiency, and Cost

面向AI基础设施的统一度量架构:整合性能、效率和成本的跨层分类

Qi He

专题命中 推理评测 :planning(abstract)

AI总结 本文提出统一度量架构,整合性能、效率和成本,通过跨层分类和分解,建立6x3分类学以优化AI基础设施的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14880 2026-01-21 cs.SD 50%

From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition

从 hype 到 insight:重新思考大型语言模型在视觉语音识别中的整合

Rishabh Jain, Naomi Harte

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过系统评估发现,LLM解码器通过优化上下文推理提升性能,而非依赖视觉特征,强调需强化视觉编码器以推动VSR进展。

Comments Accepted for publication in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11633 2026-01-21 cs.CV 50%

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images

超越准确率:评估图像推理中的 grounded 视觉证据

Xuchen Li, Xuzhao Li, Renjie Pi, Shiyu Hu, Jian Zhao, Jiahui Gao

机构 * ZGCA(中钢集团自动化研究院) NTU(国立.ntu) HKUST(香港科技大学) HKU(香港大学) ZGCI(中钢集团信息院)

专题命中 推理评测 :reasoning(abstract)

AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11540 2026-01-21 cs.HC 50%

Exploring General-Purpose Autonomous Multimodal Agents for Pathology Report Generation

探索通用型自主多模态代理用于病理报告生成

Marc Aubreville, Taryn A. Donovan, Christof A. Bertram

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探索通用型自主多模态代理在病理报告生成中的应用,发现其在无额外信息时诊断准确率较低,但提供形态学描述时表现更佳,但仍不及人类专家。

Comments 6 pages, 1 figure, accepted paper for BVM 2026

Journal ref BVM 2026, https://bvm-conf.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11537 2026-01-21 cs.HC 50%

Building AI-based advisory services for smallholder farmers: Technical learnings from the AIEP Initiative

为小农户建设基于AI的咨询服务:AIEP计划的技术经验

Stewart Collis, Florence Kinyua, Vikram Kumar, Howard Lakougna, Christian Merz, Kirti Pandey, Christian Resch

专题命中 推理评测 :reasoning(abstract)

AI总结 AIEP计划通过AI技术为小农户提供农业咨询服务,发现多语言语音交互和语料库编纂是关键挑战,同时强调数据共享和评估基准的重要性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11525 2026-01-21 cs.HC 50%

PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple Libraries

PlotGen-Bench: 评估VLMs在从多样化图表生成可视化代码的能力 across 多个库

Yi Zhao, Zhen Yang, Shuaiqi Duan, Wenmeng Yu, Zhe Su, Jibing Gong, Jie Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 PlotGen-Bench评估VLMs在多库场景下生成可视化代码的能力,发现开源模型在视觉和语义一致性上表现欠佳,需进一步提升。

Comments 30 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV 50%

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 50%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10909 2026-01-19 cs.CV 50%

FrankenMotion: Part-level Human Motion Generation and Composition

FrankenMotion: 部位级人类动作生成与组合

Chuqiao Li, Xianghui Xie, Yong Cao, Andreas Geiger, Gerard Pons-Moll

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校区)

专题命中 推理评测 :reasoning(abstract)

AI总结 FrankenMotion通过原子性、时间感知的部位级动作标注,实现了对身体部位和原子动作的双重控制,首次在动作生成中引入细粒度部位级标注。

Comments Project page: https://coral79.github.io/frankenmotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06204 2026-01-19 cs.CV cs.MA 50%

Cascading multi-agent anomaly detection in surveillance systems via vision-language models and embedding-based classification

通过视觉-语言模型和基于嵌入的分类实现监视系统中的级联多代理异常检测

Tayyab Rehman, Giovanni De Gasperis, Aly Shmahell

机构 * University of L’Aquila(拉奎拉大学) SPEE S.R.L(SPEE公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种级联多代理框架,结合视觉-语言模型和嵌入分类,实现高效且可解释的异常检测,减少延迟并提升监控系统性能。

Comments Author email changed, Acknowlegement changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01166 2026-01-19 cs.SD 50%

Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR

听更清晰,用更少:多模态检索与选择增强的对话式LLM基于ASR

Bingshen Mu, Hexin Liu, Hongfei Xue, Kun Wei, Lei Xie

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MARS方法,通过多模态检索与选择提升对话式LLM-ASR的准确性,仅用1.5K小时数据即可超越训练于179K小时数据的顶级系统。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08779 2026-01-19 cs.CV 50%

BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models

BBQ-V:评估大型多模态模型中视觉刻板印象偏见的基准

Vishal Narnaware, Ashmal Vayani, Rohit Gupta, Sirnam Swetha, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,中央佛罗里达大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 BBQ-V通过真实多演员图像和多样类别评估LMMs的刻板印象偏见,揭示了主流模型在推理链中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10592 2026-01-16 cs.CV 50%

Action100M: A Large-scale Video Action Dataset

Action100M:一个大规模视频动作数据集

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade Yu, Allen Bolourchi, Theo Moutakanni, Pascale Fung

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Action100M通过自动化流程生成大规模视频动作数据集,用于提升视频理解和世界建模的可扩展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09216 2026-01-15 cs.DB 50%

Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions

面向数字精神科问诊医生-患者交互的诚实意识多智能体框架:高保真合成数据生成

Xinyuan Zhang, Zijian Wang, Chang Dao, Juexiao Zhou

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本研究提出一种多智能体框架,通过建模患者欺骗行为生成高保真合成数据,用于研究精神科评估中的诚实意识及训练适应性对话代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 50%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 50%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07812 2026-01-13 cs.CV 50%

More Images, More Problems? A Controlled Analysis of VLM Failure Modes

更多图像,更多问题?对VLV失败模式的受控分析

Anurag Das, Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Bernt Schiele, Georgios Tzimiropoulos, Brais Martinez

机构 * MPI for Informatics Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰信息学校区) Samsung AI Cambridge(三星人工智能(剑桥)) Technical University of Iași Romania(罗文扎大学(罗马尼亚)) Queen Mary University of London UK(伦敦女王大学(英国))

专题命中 推理评测 :reasoning(abstract)

AI总结 MIMIC基准通过诊断实验揭示LVLM在多图像任务中的失败模式,并提出数据生成和注意力遮罩方案以提升跨图像信息聚合能力。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07484 2026-01-13 cs.GR 50%

R3-RECON: Radiance-Field-Free Active Reconstruction via Renderability

R3-RECON:通过可渲染性进行无辐射场主动重建

Xiaofeng Jin, Matteo Frosi, Yiran Guo, Matteo Matteucci

专题命中 推理评测 :planning(abstract)

AI总结 R3-RECON通过无辐射场的可渲染性场实现高效主动重建,提升新视角质量和3DGS重建精度。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25263 2026-01-13 cs.CV 50%

LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation

LangHOPS: 语言引导的层次开放词汇部件分割

Yang Miao, Jan-Nico Zaech, Xi Wang, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。

Comments 10 pages, 5 figures, 14 tables, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06419 2026-01-13 cs.CR cs.PL 50%

Lightweight Yet Secure: Secure Scripting Language Generation via Lightweight LLMs

轻量却安全:通过轻量LLM实现安全脚本语言生成

Keyang Zhang, Zeyu Chen, Xuan Feng, Dongliang Fang, Yaowen Zheng, Zhi Li, Limin Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出PSSec框架,通过数据合成与微调提升轻量LLM在生成安全PowerShell脚本方面的能力,显著降低推理成本。

Comments 19 pages,8 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 50%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06177 2026-01-13 cs.CR cs.SE 50%

AutoVulnPHP: LLM-Powered Two-Stage PHP Vulnerability Detection and Automated Localization

AutoVulnPHP: 基于LLM的两阶段PHP漏洞检测与自动定位

Zhiqiang Wang, Yizhong Ding, Zilong Xiao, Jinyu Lu, Yan Jia, Yanjun Li

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 AutoVulnPHP通过结合两阶段漏洞检测与细粒度自动定位,利用LLM提升PHP漏洞检测的准确性和定位精度,首次构建大规模PHP漏洞数据集并验证其实际应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05927 2026-01-12 cs.CV 50%

Adapting Vision Transformers to Ultra-High Resolution Semantic Segmentation with Relay Tokens

适应于超高分辨率语义分割的视觉变换器:通过中继标记

Yohann Perron, Vladyslav Sydorov, Christophe Pottier, Loic Landrieu

专题命中 推理评测 :reasoning(abstract)

AI总结 通过引入中继标记,该方法在视觉变换器中实现多尺度推理,提升超高清语义分割的性能,实现局部细节与全局意识的平衡。

Comments 13 pages +3 pages of suppmat

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21272 2026-01-12 cs.CV 50%

Co-Training Vision Language Models for Remote Sensing Multi-task Learning

联合训练遥感多任务学习的视觉语言模型

Qingyun Li, Shuran Ma, Junwei Luo, Yi Yu, Yue Zhou, Fengxiang Wang, Xudong Lu, Xiaoxing Wang, Xin He, Yushi Chen, Xue Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) East China Normal University(东华大学) Wuhan University(武汉大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05632 2026-01-12 eess.SY cs.SY 50%

LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery

基于大语言模型的电力系统动态模型发现:LLM-DMD

Chao Shen, Zihan Guo, Ke Zuo, Wenqi Huang, Mingyang Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05039 2026-01-09 cs.MA 50%

FinDeepForecast: A Live Multi-Agent System for Benchmarking Deep Research Agents in Financial Forecasting

FinDeepForecast:一个用于在金融预测中基准测试深度研究代理的实时多智能体系统

Xiangyu Li, Xuan Yao, Guohao Qi, Fengbin Zhu, Kelvin J. L. Koa, Xiang Yao Ng, Ziyang Liu, Xingyu Ni, Chang Liu, Yonghui Yang, Yang Zhang, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Xiaofen Xing, Xiangmin Xu, Tat-Seng Chua, Ke-Wei Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 FinDeepForecast是一个实时多智能体系统,用于评估深度研究代理在金融预测中的表现,通过生成研究导向的金融预测任务,提供了一个公开的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏