arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2506.06084 2025-06-09 cs.CV 50%

WisWheat: A Three-Tiered Vision-Language Dataset for Wheat Management

Bowen Yuan, Selena Song, Javier Fernandez, Yadan Luo, Mahsa Baktashmotlagh, Zijian Wang

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05939 2025-06-09 cs.IR 50%

Respecting Temporal-Causal Consistency: Entity-Event Knowledge Graphs for Retrieval-Augmented Generation

Ze Yu Zhang, Zitao Li, Yaliang Li, Bolin Ding, Bryan Kian Hsiang Low

专题命中 推理评测 :reasoning(abstract)

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03683 2025-06-05 cs.CV 50%

PRJ: Perception-Retrieval-Judgement for Generated Images

Qiang Fu, Zonglei Jing, Zonghao Ying, Xiaoqian Li

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03371 2025-06-05 cs.CV 50%

Toward Reliable VLM: A Fine-Grained Benchmark and Framework for Exposure, Bias, and Inference in Korean Street Views

Xiaonan Wang, Bo Shao, Hansaem Kim

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14984 2025-06-05 cs.SI 50%

S$^3$: Social-network Simulation System with Large Language Model-Empowered Agents

Chen Gao, Xiaochong Lan, Zhihong Lu, Jinzhu Mao, Jinghua Piao, Huandong Wang, Depeng Jin, Yong Li

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02555 2025-06-04 cs.CV 50%

SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence

Zhitao Zeng, Zhu Zhuo, Xiaojun Jia, Erli Zhang, Junde Wu, Jiaan Zhang, Yuxuan Wang, Chang Han Low, Jian Jiang, Zilong Zheng, Xiaochun Cao, Yutong Ban, Qi Dou, Yang Liu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01841 2025-06-03 eess.IV 50%

Beyond Pixel Agreement: Large Language Models as Clinical Guardrails for Reliable Medical Image Segmentation

Jiaxi Sheng, Leyi Yu, Haoyue Li, Yifan Gao, Xin Gao

专题命中 推理评测 :reasoning(abstract)

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00050 2025-06-03 cs.CY 50%

Distinguishing Fact from Fiction: Student Traits, Attitudes, and AI Hallucination Detection in Business School Assessment

Canh Thien Dang, An Nguyen

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23757 2025-05-30 cs.CV 50%

Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models

Haohan Chi, Huan-ang Gao, Ziming Liu, Jianing Liu, Chenyu Liu, Jinwei Li, Kaisen Yang, Yangcheng Yu, Zeda Wang, Wenyi Li, Leichen Wang, Xingtao Hu, Hao Sun, Hang Zhao, Hao Zhao

机构 * AIR, Tsinghua University(清华大學人工智能研究院) Bosch Research(博世研究) IIIS, Tsinghua University(清华大學人工智能研究院)

专题命中 推理评测 :planning(abstract)

Comments Project page: https://github.com/ahydchh/Impromptu-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23025 2025-05-30 econ.GN q-fin.EC 50%

Learning to Regulate: A New Event-Level Dataset of Capital Control Measures

Geyue Sun, Xiao Liu, Tomas Williams, Roberto Samaniego

专题命中 推理评测 :reasoning(abstract)

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22192 2025-05-29 cs.MA 50%

Efficient Leave-one-out Approximation in LLM Multi-agent Debate Based on Introspection

Yue Cui, Liuyi Yao, Zitao Li, Yaliang Li, Bolin Ding, Xiaofang Zhou

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21931 2025-05-29 eess.SY cs.SY 50%

Large Language Models for Solving Economic Dispatch Problem

Sina Mohammadi, Ali Hassan, Rouzbeh Haghighi, Van-Hai Bui, Wencong Su

专题命中 推理评测 :reasoning(abstract)

Comments 5 pages, 3 figures, Accepted, 2025 IEEE Energy Conversion Conference and Expo (ECCE 2025), Philadelphia, PA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20640 2025-05-28 cs.CV 50%

IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios

Yifan Li, Yuhang Chen, Anh Dao, Lichi Li, Zhongyi Cai, Zhen Tan, Tianlong Chen, Yu Kong

专题命中 推理评测 :reasoning(abstract)

Comments v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19828 2025-05-27 cs.SE 50%

SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection

Md Basim Uddin Ahmed, Nima Shiri Harzevili, Jiho Shin, Hung Viet Pham, Song Wang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19139 2025-05-27 cs.CV 50%

The Eye of Sherlock Holmes: Uncovering User Private Attribute Profiling via Vision-Language Model Agentic Framework

Feiran Liu, Yuzhe Zhang, Xinyi Huang, Yinan Peng, Xinfeng Li, Lixu Wang, Yutong Shen, Ranjie Duan, Simeng Qin, Xiaojun Jia, Qingsong Wen, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Technology(北京理工大学) Hengxin Tech(恒心科技) Alibaba Group(阿里巴巴集团) Squirrel Ai Learning(squirrel AI 学习)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18915 2025-05-27 cs.CV 50%

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

专题命中 推理评测 :reasoning(abstract)

Comments NeurIPS 2025 datasets&benchmarks track submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2025-05-27 cs.CV 50%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08695 2025-05-27 cs.CV 50%

Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping

Yue Yang, Shuibai Zhang, Wenqi Shao, Kaipeng Zhang, Yi Bin, Yu Wang, Ping Luo

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17979 2025-05-26 cs.SE 50%

Re-evaluation of Logical Specification in Behavioural Verification

Radoslaw Klimek, Jakub Semczyszyn

专题命中 推理评测 :reasoning(abstract)

Comments The paper has been peer-reviewed and accepted for publication to the 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04983 2025-05-23 cs.CV 50%

Leveraging Large Language Models For Scalable Vector Graphics Processing: A Review

Boris Malashenko, Ivan Jarsky, Valeria Efimova

机构 * ITMO University(ITMO大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12617 2025-05-23 cs.CV cs.CY cs.SI 50%

Can GPT-4 Models Detect Misleading Visualizations?

Jason Alexander, Priyal Nanda, Kai-Cheng Yang, Ali Sarvghad

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Network Science Institute, Northeastern University(东北大学网络科学研究所)

专题命中 推理评测 :reasoning(abstract)

Comments 5 pages, 2 figures; accepted by IEEE VIS 2024 (https://ieeevis.org/year/2024/program/paper_v-short-1177.html)

Journal ref 2024 IEEE Visualization and Visual Analytics (VIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15435 2025-05-22 cs.CV 50%

TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models

Zeqing Wang, Shiyuan Zhang, Chengpei Tang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract)

Comments 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14640 2025-05-21 cs.CV 50%

VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation

Wentao Ma, Weiming Ren, Yiming Jia, Zhuofeng Li, Ping Nie, Ge Zhang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) Shanghai University(上海大学)

专题命中 推理评测 :reasoning(abstract)

Comments Dataset: https://huggingface.co/datasets/TIGER-Lab/VideoEval-Pro, Project Webpage: https://tiger-ai-lab.github.io/VideoEval-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14321 2025-05-21 cs.CV 50%

Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?

Bo Feng, Zhengfeng Lai, Shiyu Li, Zizhen Wang, Simon Wang, Ping Huang, Meng Cao

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12589 2025-05-20 cs.CV 50%

SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models

Bo Liu, Pengfei Qiao, Minhan Ma, Xuange Zhang, Yinan Tang, Peng Xu, Kun Liu, Tongtong Yuan

机构 * Department of Computer Science, Beijing University of Technology(北京理工大学计算机科学系) Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) JD Explore Academy(京东探索研究院)

专题命中 推理评测 :reasoning(abstract)

Comments The dataset and code are publicly available at: https://huggingface.co/datasets/fei213/SurveillanceVQA-589K

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12000 2025-05-20 cs.CV 50%

IQBench: How "Smart'' Are Vision-Language Models? A Study with Human IQ Tests

Tan-Hanh Pham, Phu-Vinh Nguyen, Dang The Hung, Bui Trong Duong, Vu Nguyen Thanh, Chris Ngo, Tri Quang Truong, Truong-Son Hy

机构 * Harvard Medical School(哈佛医学院) Uppsala University(乌普萨拉大学) University of London(伦敦大学) Vietnam Military Medical University(越南军医大学) University of Technical Education Ho Chi Minh City(胡志明市技术大学) Knovel Engineering Lab(Knovel工程实验室) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 推理评测 :reasoning(abstract)

Comments IQ Test for Multimodal Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11852 2025-05-20 cs.CV 50%

MedSG-Bench: A Benchmark for Medical Image Sequences Grounding

Jingkun Yue, Siqi Zhang, Zinan Jia, Huihuan Xu, Zongbo Han, Xiaohong Liu, Guangyu Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) South China Hospital, Medical School, Shenzhen University(深圳大学医学院南方医院)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09990 2025-05-20 cs.CV 50%

PointArena: Probing Multimodal Grounding Through Language-Guided Pointing

Long Cheng, Jiafei Duan, Yi Ru Wang, Haoquan Fang, Boyang Li, Yushan Huang, Elvis Wang, Ainaz Eftekhar, Jason Lee, Wentao Yuan, Rose Hendrix, Noah A. Smith, Fei Xia, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) Anderson Collegiate Vocational Institute(安德森职业学院)

专题命中 推理评测 :reasoning(abstract)

Comments 10 Pages, Dataset and code:https://pointarena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07772 2025-05-13 cs.CY 50%

The Value of Disagreement in AI Design, Evaluation, and Alignment

Sina Fazelpour, Will Fleisher

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07689 2025-05-13 cs.CV 50%

Anatomical Attention Alignment representation for Radiology Report Generation

Quang Vinh Nguyen, Minh Duc Nguyen, Thanh Hoang Son Vo, Hyung-Jeong Yang, Soo-Hyung Kim

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏