arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2505.07266 2025-05-13 cs.RO 50%

BETTY Dataset: A Multi-modal Dataset for Full-Stack Autonomy

Micah Nye, Ayoub Raji, Andrew Saba, Eidan Erlich, Robert Exley, Aragya Goyal, Alexander Matros, Ritesh Misra, Matthew Sivaprakasam, Marko Bertogna, Deva Ramanan, Sebastian Scherer

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Waterloo(滑铁卢大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :planning(abstract)

Comments 8 pages. 5 figures. ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06296 2025-05-13 eess.SP 50%

Q-Heart: ECG Question Answering via Knowledge-Informed Multimodal LLMs

Hung Manh Pham, Jialu Tang, Aaqib Saeed, Dong Ma

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15816 2025-05-13 cs.CV 50%

A Vision Centric Remote Sensing Benchmark

Abduljaleel Adejumo, Faegheh Yeganli, Clifford Broni-bediako, Aoran Xiao, Naoto Yokoya, Mennatullah Siam

机构 * AMMI/AIMS Senegal(AMMI/AIMS塞内加尔) University of British Columbia(不列颠哥伦比亚大学) RIKEN AIP(理化学研究所AIP) the University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract)

Comments Eval-FoMo2 Workshop in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02569 2025-05-06 cs.RO cs.HC 50%

HapticVLM: VLM-Driven Texture Recognition Aimed at Intelligent Haptic Interaction

Muhammad Haris Khan, Miguel Altamirano Cabrera, Dmitrii Iarchuk, Yara Mahmoud, Daria Trinitatova, Issatay Tokmurziyev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室、数字工程中心、斯克尔科沃科学与技术研究所)

专题命中 推理评测 :reasoning(abstract)

Comments Submitted to IEEE conf

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02782 2025-05-05 cs.CV 50%

GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation

Zhiyuan Yan, Junyan Ye, Weijia Li, Zilong Huang, Shenghai Yuan, Xiangyang He, Kaiqing Lin, Jun He, Conghui He, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Sun Yat-sen University(中山大学) Rabbitpre AI Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University(深圳大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10603 2025-05-01 cs.CR 50%

Demo: ViolentUTF as An Accessible Platform for Generative AI Red Teaming

Tam n. Nguyen

专题命中 推理评测 :reasoning(abstract)

Comments 3 pages, 1 figure, 1 table. This is a demo paper for CyberWarrior2025. The video demo is at https://youtu.be/c-UCYXq0rfY. Codes will be shared when the competition concludes in June 2025 due to embargo requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14845 2025-04-22 cs.IR 50%

Enhancing the Patent Matching Capability of Large Language Models via the Memory Graph

Qiushi Xiong, Zhipeng Xu, Zhenghao Liu, Mengjia Wang, Zulong Chen, Yue Sun, Yu Gu, Xiaohua Li, Ge Yu

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09732 2025-04-22 cs.CV 50%

LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models

Junyan Ye, Baichuan Zhou, Zilong Huang, Junan Zhang, Tianyi Bai, Hengrui Kang, Jun He, Honglin Lin, Zihao Wang, Tong Wu, Zhizheng Wu, Yiping Chen, Dahua Lin, Conghui He, Weijia Li

专题命中 推理评测 :reasoning(abstract)

Comments ICLR 2025 SPOTLIGHT, 83 pages, 63 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13474 2025-04-21 cs.CR 50%

Everything You Wanted to Know About LLM-based Vulnerability Detection But Were Afraid to Ask

Yue Li, Xiao Li, Hao Wu, Minghui Xu, Yue Zhang, Xiuzhen Cheng, Fengyuan Xu, Sheng Zhong

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10107 2025-04-15 cs.IR 50%

Enhancing LLM-based Recommendation through Semantic-Aligned Collaborative Knowledge

Zihan Wang, Jinghao Lin, Xiaocui Yang, Yongkang Liu, Shi Feng, Daling Wang, Yifei Zhang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09979 2025-04-15 cs.CV 50%

Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision-Language Models

Teppei Suzuki, Keisuke Ozawa

机构 * SB Intuitions

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09823 2025-04-15 cs.IR 50%

RAKG:Document-level Retrieval Augmented Knowledge Graph Construction

Hairong Zhang, Jiaheng Si, Guohang Yan, Boyuan Qi, Pinlong Cai, Song Mao, Ding Wang, Botian Shi

专题命中 推理评测 :reasoning(abstract)

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08111 2025-04-14 cs.CV 50%

POEM: Precise Object-level Editing via MLLM control

Marco Schouten, Mehmet Onurcan Kaya, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to SCIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08003 2025-04-14 cs.CV 50%

Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability

Ning Li, Jingran Zhang, Justin Cui

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract)

Comments Early work, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04659 2025-04-10 cs.CV 50%

ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models

Ziyue Wang, Chi Chen, Fuwen Luo, Yurui Dong, Yuanchi Zhang, Yuzhuang Xu, Xiaolong Wang, Peng Li, Yang Liu

机构 * Tsinghua University(清华大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03641 2025-04-08 cs.CV 50%

MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models

Wulin Xie, Yi-Fan Zhang, Chaoyou Fu, Yang Shi, Bingyan Nie, Hongkai Chen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * CASIA(中国科学院自动化研究所) NJU(南京大学) PKU(北京大学) Vivo(维沃公司) M-M-E

专题命中 推理评测 :reasoning(abstract)

Comments Project page: https://mme-unify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17238 2025-04-08 cs.CR cs.PL cs.SE 50%

IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities

Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13597 2025-04-04 cs.CR cs.SE 50%

APPATCH: Automated Adaptive Prompting Large Language Models for Real-World Software Vulnerability Patching

Yu Nong, Haoran Yang, Long Cheng, Hongxin Hu, Haipeng Cai

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01472 2025-04-03 cs.CV 50%

ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction

Yuejiao Su, Yi Wang, Qiongyang Hu, Chuang Yang, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract)

Comments Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05939 2025-04-03 cs.IR 50%

Direct Preference Optimization for LLM-Enhanced Recommendation Systems

Chao Sun, Yaobo Liang, Yaming Yang, Shilin Xu, Tianmeng Yang, Yunhai Tong

专题命中 推理评测 :reasoning(abstract)

Comments This paper has been accepted to ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23771 2025-04-01 cs.CV 50%

XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?

Fengxiang Wang, Hongzhen Wang, Mingshuo Chen, Di Wang, Yulin Wang, Zonghao Guo, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, Zhiyuan Liu, Maosong Sun

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 推理评测 :reasoning(abstract)

Comments It has been accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22952 2025-04-01 cs.CV 50%

OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts

Yuxuan Wang, Yueqian Wang, Bo Chen, Tong Wu, Dongyan Zhao, Zilong Zheng

机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室)

专题命中 推理评测 :reasoning(abstract)

Comments To appear at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22251 2025-03-31 cs.CV 50%

Efficient Building Roof Type Classification: A Domain-Specific Self-Supervised Approach

Guneet Mutreja, Ksenia Bittner

机构 * Remote Sensing Technology Institute, German Aerospace Center (DLR)(德国航空航天中心遥感技术研究所)

专题命中 推理评测 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21836 2025-03-31 cs.CV 50%

iMedImage Technical Report

Ran Wei, ZhiXiong Lan, Qing Yan, Ning Song, Ming Lv, LongQing Ye

机构 * Hangzhou Diagens Biotechnology Co., Ltd.(杭州迪恩杰生物技术有限公司)

专题命中 推理评测 :CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19606 2025-03-26 eess.IV cs.CV q-bio.QM q-bio.TO 50%

Single Shot AI-assisted quantification of KI-67 proliferation index in breast cancer

Deepti Madurai Muthu, Priyanka S, Lalitha Rani N, P. G. Kubendran Amos

机构 * KAP Viswanatham Government Medical College(KAP·维斯瓦纳坦政府医学院) Vellore Institute of Technology-AP(韦洛尔理工大学-AP分校) National Institute of Technology(印度国家理工学院)

专题命中 推理评测 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07752 2025-03-26 cs.CV 50%

Lost in Time: A New Temporal Benchmark for VideoLLMs

Daniel Cores, Michael Dorkenwald, Manuel Mucientes, Cees G. M. Snoek, Yuki M. Asano

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15024 2025-03-25 cs.CV 50%

Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models

Jin Wang, Chenghui Lv, Xian Li, Shichao Dong, Huadong Li, kelu Yao, Chao Li, Wenqi Shao, Ping Luo

机构 * The University of Hong Kong(香港大学) HKU Shanghai Intelligent Computing Research Center(港大上海智能计算研究中心) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang Laboratory(浙江实验室) Hangzhou Institute for Advanced Study(杭州高等研究院) Zhejiang University(浙江大学) Alibaba(阿里巴巴) MEGVII Technology(旷视科技)

专题命中 推理评测 :reasoning(abstract)

Comments 31 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08326 2025-03-25 cs.CV 50%

Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks

Miran Heo, Min-Hung Chen, De-An Huang, Sifei Liu, Subhashree Radhakrishnan, Seon Joo Kim, Yu-Chiang Frank Wang, Ryo Hachiuma

机构 * NVIDIA(英伟达) Yonsei University(延世大学) National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract)

Comments CVPR 2025, Project page: https://miranheo.github.io/omni-rgpt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16566 2025-03-24 cs.CV 50%

REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models

Jie Zhang, Zheng Yuan, Zhongqi Wang, Bei Yan, Sibo Wang, Xiangkui Cao, Zonghui Guo, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

Comments 45 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09230 2025-03-24 cs.CV 50%

Surgical Text-to-Image Generation

Chinedu Innocent Nwoye, Rupak Bose, Kareem Elgohary, Lorenzo Arboit, Giorgio Carlino, Joël L. Lavanchy, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) Fondazione Policlinico Universitario Agostino Gemelli IRCCS(阿戈斯蒂诺·杰梅里基金会天主教大学综合医院) IHU Strasbourg(斯特拉斯堡大学医院研究所) University of Basel(巴塞尔大学)

专题命中 推理评测 :reasoning(abstract)

Comments 13 pages, 13 figures, 3 tables, published in Pattern Recognition Letters 2025, project page at https://camma-public.github.io/endogen/

Journal ref Pattern Recognition Letters, Volume 190, April 2025, Pages 73-80

详情

展开后加载摘要…

URL PDF HTML 收藏