arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2410.10491 2025-03-21 cs.CV 50%

TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning

Aritra Bhowmik, Mohammad Mahdi Derakhshani, Dennis Koelma, Yuki M. Asano, Martin R. Oswald, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) University of Technology Nuremberg(纽伦堡工业大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05957 2025-03-21 econ.TH 50%

Subjective Causality in Choice

Andrew Ellis, Heidi Christina Thysen

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14941 2025-03-20 cs.CV 50%

UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation

Qihui Zhang, Munan Ning, Zheyuan Liu, Yanbo Wang, Jiayi Ye, Yue Huang, Shuo Yang, Xiao Chen, Yibing Song, Li Yuan

机构 * School of Electrical and Computer Engineering, Peking University(北京大学电气与计算机工程学院) Hupan Lab(湖畔实验室) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of Notre Dame(圣母大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14933 2025-03-20 eess.IV cs.CV physics.med-ph 50%

A Language Vision Model Approach for Automated Tumor Contouring in Radiation Oncology

Yi Luo, Hamed Hooshangnejad, Xue Feng, Gaofeng Huang, Xiaojian Chen, Rui Zhang, Quan Chen, Wil Ngwa, Kai Ding

专题命中 推理评测 :planning(abstract)

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13646 2025-03-19 cs.CV 50%

Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos

Chiara Plizzari, Alessio Tonioni, Yongqin Xian, Achin Kulshrestha, Federico Tombari

机构 * Google(谷歌) Politecnico di Torino(都灵理工大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to CVPR 2025. Dataset and code are available at https://github.com/google-research-datasets/egotempo.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03586 2025-03-19 cs.CR 50%

Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories

Alperen Yildiz, Sin G. Teo, Yiling Lou, Yebo Feng, Chong Wang, Dinil M. Divakaran

专题命中 推理评测 :chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02304 2025-03-18 cs.CV 50%

A Token-level Text Image Foundation Model for Document Understanding

Tongkun Guan, Zining Wang, Pei Fu, Zhengtao Guo, Wei Shen, Kai Zhou, Tiezhu Yue, Chen Duan, Hao Sun, Qianyi Jiang, Junfeng Luo, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 推理评测 :reasoning(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18325 2025-03-18 cs.CV 50%

AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models

Kim Sung-Bin, Oh Hyun-Bin, JungMok Lee, Arda Senocak, Joon Son Chung, Tae-Hyun Oh

机构 * POSTECH(浦项科技大学) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08481 2025-03-14 cs.RO cs.CV 50%

PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability

Weijie Zhou, Manli Tao, Chaoyang Zhao, Haiyun Guo, Honghui Dong, Ming Tang, Jinqiao Wang

机构 * School of Traffic and Transportation, Beijing Jiaotong University(北京交通大学交通运输学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ObjectEye Inc.(奥森科技(ObjectEye公司)) Guangdong Polytechnic Normal University(广东技术师范大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20312 2025-03-13 cs.CV 50%

Learn "No" to Say "Yes" Better: Improving Vision-Language Models via Negations

Jaisidh Singh, Ishaan Shrivastava, Mayank Vatsa, Richa Singh, Aparna Bharati

机构 * IIT Jodhpur(焦特布尔印度理工学院) Lehigh University(利哈伊大学)

专题命中 推理评测 :reasoning(abstract)

Comments 14 pages + 6 figures in main manuscript (excluding references)

Journal ref WACV 2025 pages(7991-8001)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07302 2025-03-12 cs.CV 50%

CASC-AI: Consensus-aware Self-corrective Learning for Noise Cell Segmentation

Ruining Deng, Yihe Yang, David J. Pisapia, Benjamin Liechty, Junchao Zhu, Juming Xiong, Junlin Guo, Zhengyi Lu, Jiacheng Wang, Xing Yao, Runxuan Yu, Rendong Zhang, Gaurav Rudravaram, Mengmeng Yin, Pinaki Sarder, Haichun Yang, Yuankai Huo, Mert R. Sabuncu

机构 * Weill Cornell Medicine(威尔康奈尔医学院) Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心) University of Florida(佛罗里达大学) Cornell Tech(康奈尔科技学院)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07478 2025-03-11 cs.CV 50%

VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models

Jiacheng Ruan, Wenzhen Yuan, Xian Gao, Ye Guo, Daoxin Zhang, Zhe Xu, Yao Hu, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书科技有限公司)

专题命中 推理评测 :reasoning(abstract)

Comments 12 pages, 4 figures. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06885 2025-03-11 cs.CV 50%

ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks

Yan Yang, Dongxu Li, Haoning Wu, Bei Chen, Liu Liu, Liyuan Pan, Junnan Li

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06141 2025-03-11 cs.CV 50%

Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model

Mingxing Li, Rui Wang, Lei Sun, Yancheng Bai, Xiangxiang Chu

机构 * Amap, Alibaba Group(阿里巴巴集团高德) BUPT(北京邮电大学)

专题命中 推理评测 :CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04444 2025-03-07 cs.CV 50%

ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task

Vittorio Pippi, Matthieu Guillaumin, Silvia Cascianelli, Rita Cucchiara, Maximilian Jaritz, Loris Bazzani

机构 * University of Modena and Reggio Emilia(摩德纳与雷焦艾米利亚大学) Amazon(亚马逊公司)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16182 2025-03-07 cs.CV 50%

EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World

Yifei Huang, Guo Chen, Jilan Xu, Mingfang Zhang, Lijin Yang, Baoqi Pei, Hongjie Zhang, Lu Dong, Yali Wang, Limin Wang, Yu Qiao

机构 * OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室OpenGVLab) The University of Tokyo(东京大学) Nanjing University(南京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) USTC(中国科学技术大学) SIAT, CAS(中国科学院深圳先进技术研究院)

专题命中 推理评测 :planning(abstract)

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03609 2025-03-06 cs.SE 50%

Enhancing the Accuracy and Comprehensibility in Architectural Tactics Detection via Small Model-Augmented Prompt Engineering

Lingli Cao, He Zhang, Shanshan Li, Danyang Li, Yanjing Yang, Chenxing Zhong, Xin Zhou, Yue Xie

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02246 2025-03-05 cs.SE 50%

From Code to Courtroom: LLMs as the New Software Judges

Junda He, Jieke Shi, Terry Yue Zhuo, Christoph Treude, Jiamou Sun, Zhenchang Xing, Xiaoning Du, David Lo

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01376 2025-03-04 q-bio.BM 50%

Pushing the boundaries of Structure-Based Drug Design through Collaboration with Large Language Models

Bowen Gao, Yanwen Huang, Yiqiao Liu, Wenxuan Xie, Wei-Ying Ma, Ya-Qin Zhang, Yanyan Lan

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00761 2025-03-04 cs.RO cs.CV cs.MA cs.SY eess.SY 50%

TRACE: A Self-Improving Framework for Robot Behavior Forecasting with Vision-Language Models

Gokul Puthumanaillam, Paulo Padrao, Jose Fuentes, Pranay Thangeda, William E. Schafer, Jae Hyuk Song, Karan Jagdale, Leonardo Bobadilla, Melkior Ornik

机构 * University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Florida International University (FIU)(佛罗里达国际大学) Lucid Group, Inc.(lucid集团公司)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14917 2025-03-04 cs.RO 50%

Task-Aware Robotic Grasping by evaluating Quality Diversity Solutions through Foundation Models

Aurel X. Appius, Emiland Garrabe, Francois Helenon, Mahdi Khoramshahi, Mohamed Chetouani, Stephane Doncieux

机构 * Sorbonne Université(索邦大学) CNRS(法国国家科学研究中心) Institut des Systèmes Intelligents et de Robotique, ISIR(智能系统与机器人研究所)

专题命中 推理评测 :reasoning(abstract)

Comments 6 pages, 6 figures, submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025, Video: https://youtu.be/TCLXm8kPWz4

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20857 2025-03-03 eess.AS cs.SD 50%

JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection

Hyeonuk Nam, Yong-Hwa Park

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01492 2025-02-28 cs.CV 50%

EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark

Ming Li, Jike Zhong, Tianle Chen, Yuxiang Lai, Konstantinos Psounis

机构 * The University of Tokyo(东京大学) University of Southern California(南加州大学) Boston University(波士顿大学) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18992 2025-02-27 cs.IR 50%

OntologyRAG: Better and Faster Biomedical Code Mapping with Retrieval-Augmented Generation (RAG) Leveraging Ontology Knowledge Graphs and Large Language Models

Hui Feng, Yuntzu Yin, Emiliano Reynares, Jay Nanavati

专题命中 推理评测 :reasoning(abstract)

Comments This paper has been accepted as a workshop paper for KEIR@ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18757 2025-02-27 cs.IR 50%

Training Large Recommendation Models via Graph-Language Token Alignment

Mingdai Yang, Zhiwei Liu, Liangwei Yang, Xiaolong Liu, Chen Wang, Hao Peng, Philip S. Yu

专题命中 推理评测 :reasoning(abstract)

Comments 5 pages. Accepted by www'25 as short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17606 2025-02-26 cs.DB 50%

ELMo-Tune-V2: LLM-Assisted Full-Cycle Auto-Tuning to Optimize LSM-Based Key-Value Stores

Viraj Thakkar, Qi Lin, Kenanya Keandra Adriel Prasetyo, Raden Haryosatyo Wisjnunandono, Achmad Imam Kistijantoro, Reza Fuad Rachmadi, Zhichao Cao

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15506 2025-02-24 cs.CR 50%

Construction and Evaluation of LLM-based agents for Semi-Autonomous penetration testing

Masaya Kobayashi, Masane Fuchi, Amar Zanashir, Tomonori Yoneda, Tomohiro Takagi

专题命中 推理评测 :reasoning(abstract)

Comments 7 pages, 4 tables and 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15105 2025-02-24 cs.HC 50%

Schemex: Discovering Design Patterns from Examples through Iterative Abstraction and Refinement

Sitong Wang, Lydia B. Chilton

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13832 2025-02-20 cs.HC 50%

ArtMentor: AI-Assisted Evaluation of Artworks to Explore Multimodal Large Language Models Capabilities

Chanjin Zheng, Zengyi Yu, Yilin Jiang, Mingzi Zhang, Xunuo Lu, Jing Jin, Liteng Gao

专题命中 推理评测 :reasoning(abstract)

Comments 18 pages, 12 figures. Accepted by CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04780 2025-02-19 cs.CV 50%

Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention Causality

Guanyu Zhou, Yibo Yan, Xin Zou, Kun Wang, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏