arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2603.05515 2026-03-09 cs.HC 50%

Enhancing Tool Calling in LLMs with the International Tool Calling Dataset

通过国际工具调用数据集增强大语言模型的工具调用能力

Zuoyu Zhang, Yancheng Zhu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出国际工具调用数据集ITC,用于提升大语言模型在多语言、多地区工具调用场景中的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15481 2026-03-09 cs.CV 50%

FunnyNodules: A Customizable Medical Dataset Tailored for Evaluating Explainable AI

FunnyNodules: 一种可定制的医学数据集,用于评估可解释AI

Luisa Gallée, Yiheng Xiong, Meinrad Beer, Michael Götz

机构 * Ulm University Medical Center(乌尔姆大学医学中心) XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD——实验放射学人工智能合作) Department of Diagnostic and Interventional Radiology(诊断与介入放射学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 FunnyNodules是一种可定制的医学数据集,用于评估可解释AI模型的属性推理能力。

Comments accepted at Medical Imaging with Deep Learning (MIDL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15625 2026-03-09 cs.CV 50%

EarthScape: A Multimodal Dataset for Surficial Geologic Mapping and Earth Surface Analysis

EarthScape:一种用于地表地质制图和地表分析的多模态数据集

Matthew Massey, Nusrat Munia, Abdullah-Al-Zubaer Imran

机构 * Kentucky Geological Survey(肯塔基地质调查局) University of Kentucky(肯塔基大学) Department of Computer Science(计算机科学系)

专题命中 推理评测 :planning(abstract)

AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV 50%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04598 2026-03-06 cs.CV 50%

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

专题命中 推理评测 :reasoning(abstract)

AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。

Comments Accepted for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04306 2026-03-05 stat.CO 50%

Theory Discovery in Social Networks: Automating ERGM Specification with Large Language Models

社交网络中的理论发现:利用大语言模型自动化ERGM规范

Yidan Sun, Mayank Kejriwal

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04176 2026-03-05 cs.DB 50%

Scalable Join Inference for Large Context Graphs

大规模上下文图的可扩展连接推断

Shivani Tripathi, Ravi Shetye, Shi Qiao, Alekh Jindal

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合统计剪枝与LLM推理的可扩展连接推断方法,用于提升大规模上下文图构建的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 50%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 推理评测 :reasoning(abstract)

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01154 2026-03-05 cs.CR 50%

vEcho: A Paradigm Shift from Vulnerability Verification to Proactive Discovery with Large Language Models

vEcho:从漏洞验证到大语言模型主动发现的范式转变

Mingcheng Jiang, Jiancheng Huang, Jiangfei Wang, Zhengzhu Xie, Nan Fang, Guang Cheng, Xiaoyan Hu, Hua Wu

专题命中 推理评测 :reasoning(abstract)

AI总结 vEcho利用大语言模型主动发现漏洞,显著提升检测率并降低误报率,同时发现新的0日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11371 2026-03-05 cs.IR 50%

RAG vs. GraphRAG: A Systematic Evaluation and Key Insights

RAG与GraphRAG:系统评估与关键洞察

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02658 2026-03-04 cs.CV 50%

OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning

OmniFashion: 通过多任务视觉-语言学习实现通用时尚智能

Zhengwei Yang, Andi Long, Hao Li, Zechao Hu, Kui Jiang, Zheng Wang

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心、人工智能研究院、计算机科学学院、武汉大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 OmniFashion通过多任务视觉-语言学习,构建百万级时尚数据集,实现统一的时尚对话范式,提升多任务推理和交互能力,推动通用时尚智能发展。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14176 2026-03-03 cs.DB cs.IR 50%

ReSearch: A Multi-Stage Machine Learning Framework for Earth Science Data Discovery

ReSearch:一种用于地球科学数据发现的多阶段机器学习框架

Youran Sun, Yixin Wen, Haizhao Yang

专题命中 推理评测 :reasoning(abstract)

AI总结 ReSearch通过多阶段推理增强搜索框架,提升地球科学数据检索的召回率和排序性能,支持科学发现的可重复性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01547 2026-03-03 cs.CV 50%

PathMoE: Interpretable Multimodal Interaction Experts for Pediatric Brain Tumor Classification

PathMoE:用于儿童脑肿瘤分类的可解释多模态交互专家

Jian Yu, Joakim Nguyen, Jinrui Fang, Awais Naeem, Zeyuan Cao, Sanjay Krishnan, Nicholas Konz, Tianlong Chen, Chandra Krishnan, Hairong Wang, Edward Castillo, Ying Ding, Ankita Shukla

机构 * University of Texas(德克萨斯大学) Dell Children’s Medical Center(德尔儿童医学中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Nevada, Reno(内华达大学里诺分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 PathMoE通过整合多模态信息提升儿童脑肿瘤分类性能,揭示了不同模态间的交互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01417 2026-03-03 cs.IR 50%

ReFeed: Retrieval Feedback-Guided Dataset Construction for Style-Aware Query Rewriting

ReFeed: 基于检索反馈的领域感知查询重写数据集构建

Jiyoon Myung, Jungki Son, Kyungro Lee, Jihyeon Park, Joohyung Han

专题命中 推理评测 :reasoning(abstract)

AI总结 ReFeed通过检索反馈驱动数据集构建,提升查询重写模型对文档风格的感知能力,改进领域特定场景下的检索效果。

Comments Accepted at the Workshop on New Frontiers in Information Retrieval (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 50%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01108 2026-03-03 cs.CV 50%

GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation

GroundedSurg: 一种多手术流程的语言条件手术工具分割基准

Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir

机构 * King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院) Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院) The University of Queensland(昆士兰大学) Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 GroundedSurg提出了一种多手术流程的语言条件手术工具分割基准,通过实例级接地和空间注释评估视觉-语言模型在临床真实场景中的性能。

Comments https://github.com/gaash-lab/GroundedSurg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01083 2026-03-03 cs.CV 50%

Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective

视觉语言模型能否评估图形设计的审美?一个基准、评估和数据集的视角

Arctanx An, Shizhao Sun, Danqing Huang, Mingxi Cheng, Yan Gao, Ji Li, Yu Qiao, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院) Microsoft(微软) Central South University(中南大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AesEval-Bench基准,系统评估视觉语言模型在图形设计审美评估中的性能,并构建训练数据集以提升模型在该领域的表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01082 2026-03-03 cs.CV cs.IR 50%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07367 2026-03-03 cs.SD 50%

FOCAL: A Novel Benchmarking Technique for Multi-modal Agents

FOCAL:多模态代理的新型基准测试技术

Anupam Purwar, Aditya Choudhary

专题命中 推理评测 :reasoning(abstract)

AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。

Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00994 2026-03-03 cs.HC 50%

VizQStudio: Iterative Visualization Literacy MCQs Design with Simulated Students

VizQStudio: 基于模拟学生的迭代可视化素养多选题设计

Zixin Chen, Yuhang Zeng, Sicheng Song, Yanna Lin, Xian Xu, Huamin Qu, Meng Xia

专题命中 推理评测 :reasoning(abstract)

AI总结 VizQStudio通过模拟学生帮助教师迭代设计高质量可视化素养多选题,提升评估设计的灵活性和适应性。

Comments TVCG fast track (PVIS 2026 TVCG Track) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00595 2026-03-03 cs.CV 50%

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract)

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23711 2026-03-02 cs.CV 50%

Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?

统一的生成与理解模型能否在不同输出模态间保持语义等价性?

Hongbo Jiang, Jie Li, Yunhang Shen, Pingyang Dai, Xing Sun, Haoyu Cao, Liujuan Cao

机构 * Tencent Youtu Lab(腾讯云图实验室) Xiamen University(厦门大学) Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23299 2026-03-02 cs.CV cs.MM 50%

MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection

MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测

Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04026 2026-03-02 cs.HC 50%

VeriWeb: Verifiable Long-Chain Web Benchmark for Agentic Information-Seeking

VeriWeb: 可验证的长链网络基准测试用于代理信息检索

Shunyu Liu, Minghao Liu, Huichi Zhou, Zhenyu Cui, Yang Zhou, Yuhao Zhou, Jialiang Gao, Heng Zhou, Yunhao Yang, Wendong Fan, puzhen zhang, Ge Zhang, Jiajun Shi, Weihao Xuan, Jiaxing Huang, Shuang Luo, Fang Wu, Heli Qi, Qingcheng Zeng, Junjie Wang, Aosong Feng, Jindi Lv, Sicong Jiang, Ziqi Ren, Wangchunshu Zhou, Zhenfei Yin, Wenlong Zhang, Guohao Li, Wenhao Yu, Lei Ma, Lei Bai, Qunshu Lin, Mingli Song, Dacheng Tao

专题命中 推理评测 :reasoning(abstract)

AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22759 2026-02-27 cs.CV 50%

Beyond Detection: Multi-Scale Hidden-Code for Natural Image Deepfake Recovery and Factual Retrieval

超越检测:多尺度隐藏码用于自然图像深度伪造恢复与事实检索

Yuan-Chih Chen, Chun-Shien Lu

机构 * IIS, Academia Sinica(中科院研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出多尺度隐藏码框架,用于自然图像深度伪造恢复与事实检索,通过语义编码和条件Transformer模块提升检索与重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 50%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22374 2026-02-27 cs.HC 50%

VoiceAlign: A Shimming Layer for Enhancing the Usability of Legacy Voice User Interface Systems

VoiceAlign:一种增强传统语音用户界面系统可用性的 shim 层

Md Ehtesham-Ul-Haque, Syed Masum Billah

专题命中 推理评测 :planning(abstract)

AI总结 VoiceAlign 通过适应性 shim 层提升传统语音用户界面系统的可用性,减少命令失败并降低用户认知负担。

Comments Accepted at IUI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03447 2026-02-26 cs.RO cs.CV 50%

HetroD: A High-Fidelity Drone Dataset and Benchmark for Autonomous Driving in Heterogeneous Traffic

HetroD:一种用于异质交通中自动驾驶的高保真无人机数据集和基准

Yu-Hsiang Chen, Wei-Jer Chang, Christian Kotulla, Thomas Keutgens, Steffen Runde, Tobias Moers, Christoph Klas, Wei Zhan, Masayoshi Tomizuka, Yi-Ting Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) UC Berkeley(伯克利大学) fka GmbH

专题命中 推理评测 :planning(abstract)

AI总结 HetroD通过高保真无人机数据集和基准,解决异质交通中自动驾驶面临的复杂行为预测与规划挑战。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21099 2026-02-25 cs.IR 50%

Turning Semantics into Topology: LLM-Driven Attribute Augmentation for Collaborative Filtering

将语义转化为拓扑:基于LLM的属性增强协同过滤

Junjie Meng, Ranxu zhang, Wei Wu, Rui Zhang, Chuan Qin, Qi Zhang, Qi Liu, Hui Xiong, Chao Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 基于LLM的属性增强协同过滤框架,通过拓扑连接性转换语义知识,提升协同过滤效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20446 2026-02-25 cs.CR 50%

Understanding Human-AI Collaboration in Cybersecurity Competitions

理解网络安全竞赛中的人机协作

Tingxuan Tang, Nicolas Janis, Kalyn Asher Montague, Kevin Eykholt, Dhilung Kirat, Youngja Park, Jiyong Jang, Adwait Nadkarni, Yue Xiao

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探讨了网络安全竞赛中人类与AI协作的有效性,发现AI代理在自主引导提示和工具使用时能超越多数人类团队。

详情

展开后加载摘要…

URL PDF HTML 收藏