arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2507.11525 2025-07-16 cs.RO cs.HC 50%

LLM-based ambiguity detection in natural language instructions for collaborative surgical robots

Ana Davila, Jacinto Colan, Yasuhisa Hasegawa

机构 * Institutes of Innovation for Future Society, Nagoya University(未来社会创新研究所,名古屋大学) Department of Micro-Nano Mechanical Science and Engineering, Nagoya University(微纳米机械科学与工程系,名古屋大学)

专题命中 推理评测 :chain-of-thought(abstract)

Comments Accepted at 2025 IEEE International Conference on Robot and Human Interactive Communication (ROMAN)

Journal ref 2025 IEEE International Conference on Robot and Human Interactive Communication (ROMAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09491 2025-07-15 cs.CV 50%

GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?

Yiyang Zhou, Linjie Li, Shi Qiu, Zhengyuan Yang, Yuyang Zhao, Siwei Han, Yangfan He, Kangqi Li, Haonian Ji, Zihao Zhao, Haibo Tong, Lijuan Wang, Huaxiu Yao

专题命中 推理评测 :reasoning(abstract)

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01933 2025-07-11 cs.CV 50%

E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models

Wenyan Cong, Yiqing Liang, Yancheng Zhang, Ziyi Yang, Yan Wang, Boris Ivanovic, Marco Pavone, Chen Chen, Zhangyang Wang, Zhiwen Fan

专题命中 推理评测 :reasoning(abstract)

Comments Project Page: https://e3dbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06815 2025-07-10 cs.SD eess.AS 50%

Data-Balanced Curriculum Learning for Audio Question Answering

Gijs Wijngaard, Elia Formisano, Michele Esposito, Michel Dumontier

机构 * Maastricht University(马斯特里赫特大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04670 2025-07-10 cs.CV 50%

Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs

Yikang Zhou, Tao Zhang, Shilin Xu, Shihao Chen, Qianyu Zhou, Yunhai Tong, Shunping Ji, Jiangning Zhang, Lu Qi, Xiangtai Li

机构 * Wuhan University(武汉大学) Bytedance Seed(字节跳动种子) Peking University(北京大学) Zhejiang University(浙江大学) SJTU(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02664 2025-07-08 cs.CV 50%

AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models

Ziyin Zhou, Yunpeng Luo, Yuanchen Wu, Ke Sun, Jiayi Ji, Ke Yan, Shouhong Ding, Xiaoshuai Sun, Yunsheng Wu, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01949 2025-07-03 cs.CV 50%

Kwai Keye-VL Technical Report

Kwai Keye Team, Biao Yang, Bin Wen, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Hao Peng, Haojie Ding, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Jin Ouyang, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yang Zhou, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zhenhua Wu, Zhenyu Li, Zhixin Ling, Ziming Li, Dehua Ma, Di Xu, Haixuan Gao, Hang Li, Jiawei Guo, Jing Wang, Lejian Ren, Muhao Wei, Qianqian Wang, Qigen Hu, Shiyao Wang, Tao Yu, Xinchen Luo, Yan Li, Yiming Liang, Yuhang Hu, Zeyi Lu, Zhuoran Yang, Zixing Zhang

专题命中 推理评测 :reasoning(abstract)

Comments Technical Report: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23481 2025-07-01 cs.CV eess.IV 50%

Evaluation of Geolocation Capabilities of Multimodal Large Language Models and Analysis of Associated Privacy Risks

Xian Zhang, Xiang Cheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(信息工程测绘遥感国家重点实验室)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23368 2025-07-01 eess.SP 50%

Optimizing Solar Energy Production in the USA: Time-Series Analysis Using AI for Smart Energy Management

Istiaq Ahmed, Md Asif Ul Hoq Khan, MD Zahedul Islam, Md Sakibul Hasan, Tanaya Jakir, Arat Hossain, Joynal Abed, Muhammad Hasanuzzaman, Sadia Sharmeen Shatyi, Kazi Nehal Hasnain

专题命中 推理评测 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23088 2025-07-01 cs.CV 50%

Where, What, Why: Towards Explainable Driver Attention Prediction

Yuchen Zhou, Jiayu Tang, Xiaoyan Xiao, Yueyao Lin, Linkai Liu, Zipeng Guo, Hao Fei, Xiaobo Xia, Chao Gou

机构 * Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22843 2025-07-01 cs.CV 50%

AG-VPReID 2025: Aerial-Ground Video-based Person Re-identification Challenge Results

Kien Nguyen, Clinton Fookes, Sridha Sridharan, Huy Nguyen, Feng Liu, Xiaoming Liu, Arun Ross, Dana Michalski, Tamás Endrei, Ivan DeAndres-Tame, Ruben Tolosana, Ruben Vera-Rodriguez, Aythami Morales, Julian Fierrez, Javier Ortega-Garcia, Zijing Gong, Yuhao Wang, Xuehu Liu, Pingping Zhang, Md Rashidunnabi, Hugo Proença, Kailash A. Hambarde, Saeid Rezaei

机构 * Queensland University of Technology(昆士兰理工大学) Drexel University(德雷塞尔大学) Michigan State University(密歇根州立大学) Department of Defence(国防部) Universidad Autónoma de Madrid(马德里自治大学) Pázmány Péter Catholic University(帕兹马尼彼得天主教大学) Dalian University of Technology(大连理工大学) Wuhan University of Technology(武汉理工大学) IT: Instituto de Telecomunicações, University of Beira Interior(IT:电信研究所,贝拉内里大学) University College Cork(科克大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05040 2025-07-01 cs.CV 50%

InstructionBench: An Instructional Video Understanding Benchmark

Haiwan Wei, Yitian Yuan, Xiaohan Lan, Wei Ke, Lin Ma

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24007 2025-06-30 cs.CV 50%

Preemptive Hallucination Reduction: An Input-Level Approach for Multimodal Language Model

Nokimul Hasan Arif, Shadman Rabby, Md Hefzul Hossain Papon, Sabbir Ahmed

专题命中 推理评测 :reasoning(abstract)

Comments Submitted for review in NCAA Springer, 21 pages, 4 figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04778 2025-06-30 cs.CV 50%

MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)

Shih-Han Chou, Shivam Chandhok, James J. Little, Leonid Sigal

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21317 2025-06-27 cs.CV 50%

LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning

Dewen Zhang, Tahir Hussain, Wangpeng An, Hayaru Shouno

机构 * Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications(信息学院、信息工程研究生院、东京电波通信大学)

专题命中 推理评测 :reasoning(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2409.09306

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20574 2025-06-27 cs.MA physics.chem-ph physics.comp-ph 50%

xChemAgents: Agentic AI for Explainable Quantum Chemistry

Can Polat, Mehmet Tuncel, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 推理评测 :reasoning(abstract)

Comments Accepted Paper at ICML 2025 Workshop on MAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18564 2025-06-24 cs.CV 50%

VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning

Xuanyu Zhang, Weiqi Li, Shijie Zhao, Junlin Li, Li Zhang, Jian Zhang

专题命中 推理评测 :reasoning(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17311 2025-06-24 cs.CY 50%

Can Large Language Models Be Trusted Paper Reviewers? A Feasibility Study

Chuanlei Li, Xu Hu, Minghui Xu, Kun Li, Yue Zhang, Xiuzhen Cheng

专题命中 推理评测 :chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17244 2025-06-24 q-fin.ST cs.CE 50%

Transformers Beyond Order: A Chaos-Markov-Gaussian Framework for Short-Term Sentiment Forecasting of Any Financial OHLC timeseries Data

Arif Pathan

专题命中 推理评测 :reasoning(abstract)

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12992 2025-06-17 cs.CV 50%

SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models

Xinyi Zhao, Congjing Zhang, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * University of Washington(华盛顿大学) Wyze Labs, Inc.(Wyze实验室)

专题命中 推理评测 :reasoning(abstract)

Comments CVPR 2025 Workshop: VAND 3.0 - Visual Anomaly and Novelty Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00868 2025-06-17 cs.MM cs.CV 50%

Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations

Parul Gupta, Shreya Ghosh, Tom Gedeon, Thanh-Toan Do, Abhinav Dhall

机构 * Monash University(墨尔本大学) Curtin University(Curtin大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10474 2025-06-13 cs.CV 50%

LLMs Are Not Yet Ready for Deepfake Image Detection

Shahroz Tariq, David Nguyen, M. A. P. Chamikara, Tingmin Wu, Alsharif Abuadbba, Kristen Moore

机构 * CSIRO’s Data61(澳大利亚CSIRO数据61研究所)

专题命中 推理评测 :reasoning(abstract)

Comments 6 pages, 3 figures, and 2 tables. paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10365 2025-06-13 cs.SE 50%

AutoGEEval++: A Multi-Level and Multi-Geospatial-Modality Automated Evaluation Framework for Large Language Models in Geospatial Code Generation on Google Earth Engine

Shuyang Hou, Zhangxiao Shen, Huayi Wu, Haoyue Jiao, Ziqi Liu, Lutong Xie, Chang Liu, Jianyuan Liang, Yaxian Qing, Xiaopu Zhang, Dehua Peng, Zhipeng Gui, Xuefeng Guan

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04715 2025-06-13 cs.CV 50%

Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model

Zelu Qi, Ping Shi, Chaoyang Zhang, Shuqi Wang, Fei Zhao, Da Pan, Zefeng Ying

机构 * Communication University of China(中国通信大学)

专题命中 推理评测 :reasoning(abstract)

Comments This paper has been accepted by CVPR Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03601 2025-06-13 cs.CV 50%

GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest

Shilong Zhang, Peize Sun, Shoufa Chen, Min Xiao, Wenqi Shao, Wenwei Zhang, Yu Liu, Kai Chen, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract)

Comments ECCV2024-Workshop, Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03651 2025-06-12 cs.CR cs.SE 50%

Mono: Is Your "Clean" Vulnerability Dataset Really Solvable? Exposing and Trapping Undecidable Patches and Beyond

Zeyu Gao, Junlin Zhou, Bolun Zhang, Yi He, Chao Zhang, Yuxin Cui, Hao Wang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00369 2025-06-11 cs.SD 50%

Are you really listening? Boosting Perceptual Awareness in Music-QA Benchmarks

Yongyi Zang, Sean O'Brien, Taylor Berg-Kirkpatrick, Julian McAuley, Zachary Novack

专题命中 推理评测 :reasoning(abstract)

Comments ISMIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06928 2025-06-10 cs.CV 50%

How Important are Videos for Training Video LLMs?

George Lydakis, Alexander Hermans, Ali Athar, Daan de Geus, Bastian Leibe

机构 * RWTH Aachen University(亚琛RWTH大学) ByteDance Seed(字节跳动种子) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理评测 :reasoning(abstract)

Comments Project page on https://visualcomputinginstitute.github.io/videollm-pseudovideo-training/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04964 2025-06-10 cs.CV 50%

CAG-VLM: Fine-Tuning of a Large-Scale Model to Recognize Angiographic Images for Next-Generation Diagnostic Systems

Yuto Nakamura, Satoshi Kodera, Haruki Settai, Hiroki Shinohara, Masatsugu Tamura, Tomohiro Noguchi, Tatsuki Furusawa, Ryo Takizawa, Tempei Kabayama, Norihiko Takeda

机构 * The University of Tokyo(东京大学) The University of Tokyo Hospital(东京大学医院)

专题命中 推理评测 :planning(abstract)

Comments The 4th Workshop on Computer Vision in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06218 2025-06-09 cs.CV 50%

STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving

Christian Fruhwirth-Reisinger, Dušan Malić, Wei Lin, David Schinagl, Samuel Schulter, Horst Possegger

专题命中 推理评测 :reasoning(abstract)

Comments Dataset: https://huggingface.co/datasets/ivc-lrp/STSBench, Code: https://github.com/LRP-IVC/STSBench

详情

展开后加载摘要…

URL PDF HTML 收藏