arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2502.09818 2025-02-17 cs.CV 50%

On the robustness of multimodal language model towards distractions

Ming Liu, Hao Chen, Jindong Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Carnegie Mellon University(卡内基梅隆大学) William & Mary University(威廉玛丽大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08997 2025-02-14 cs.CV 50%

Hierarchical Vision Transformer with Prototypes for Interpretable Medical Image Classification

Luisa Gallée, Catharina Silvia Lisson, Meinrad Beer, Michael Götz

机构 * Ulm University Medical Center(乌尔姆大学医学中心) BGZ - Bildgebungszentrum(BGZ影像中心) i2SouI - Innovative Imaging in Surgical Oncology Ulm(乌尔姆外科肿瘤创新影像中心) XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD实验放射学人工智能合作中心)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08073 2025-02-13 cs.CY 50%

Large language models perpetuate bias in palliative care: development and analysis of the Palliative Care Adversarial Dataset (PCAD)

Naomi Akhras, Fares Antaki, Fannie Mottet, Olivia Nguyen, Shyam Sawhney, Sabrina Bajwah, Joanna M Davies

专题命中 推理评测 :planning(abstract)

Comments The complete PCAD datasets are available on Figshare: dx.doi.org/10.6084/m9.figshare.28396016

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04976 2025-02-10 cs.MM 50%

Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark

Han Zhang, Zixiang Meng, Meng Luo, Hong Han, Lizi Liao, Erik Cambria, Hao Fei

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by TheWebConf (WWW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04666 2025-02-10 cs.IR 50%

Enhancing Health Information Retrieval with RAG by Prioritizing Topical Relevance and Factual Accuracy

Rishabh Uapadhyay, Marco Viviani

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13206 2025-02-07 cs.CV 50%

Identity-free Artificial Emotional Intelligence via Micro-Gesture Understanding

Rong Gao, Xin Liu, Bohao Xing, Zitong Yu, Bjorn W. Schuller, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT)) Great Bay University(大湾区大学) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(abstract)

Comments We provide a link to the public release of the code and data in this new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01620 2025-02-06 cs.CV 50%

LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models

Zhenyue Qin, Yu Yin, Dylan Campbell, Xuansheng Wu, Ke Zou, Yih-Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen

专题命中 推理评测 :reasoning(abstract)

Comments 2025 NAACL: Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics Project Page: https://kfzyqin.github.io/lmod/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02449 2025-02-05 cs.CV 50%

TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes

Xingcheng Zhou, Konstantinos Larintzakis, Hao Guo, Walter Zimmer, Mingyu Liu, Hu Cao, Jiajie Zhang, Venkatnarayanan Lakshminarasimhan, Leah Strand, Alois C. Knoll

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16111 2025-01-28 cs.IR 50%

Options-Aware Dense Retrieval for Multiple-Choice query Answering

Manish Singh, Manish Shrivastava

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.03867 2025-01-22 cs.LO cs.MA 50%

Strategic Abilities of Asynchronous Agents: Semantic Side Effects and How to Tame Them

Wojciech Jamroga, Wojciech Penczek, Teofil Sidoruk

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09502 2025-01-17 cs.CV 50%

Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis

Qize Yang, Detao Bai, Yi-Xing Peng, Xihan Wei

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08799 2025-01-16 cs.CV cs.CR 50%

Exploring ChatGPT for Face Presentation Attack Detection in Zero and Few-Shot in-Context Learning

Alain Komaty, Hatef Otroshi Shahreza, Anjith George, Sebastien Marcel

专题命中 推理评测 :reasoning(abstract)

Comments Accepted in WACV workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06761 2025-01-14 cs.CV 50%

VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning

Ji Soo Lee, Jongha Kim, Jeehye Na, Jinyoung Park, Hyunwoo J. Kim

专题命中 推理评测 :reasoning(abstract)

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05733 2025-01-13 cs.CV 50%

TB-Bench: Training and Testing Multi-Modal AI for Understanding Spatio-Temporal Traffic Behaviors from Dashcam Images/Videos

Korawat Charoenpitaks, Van-Quang Nguyen, Masanori Suganuma, Kentaro Arai, Seiji Totsuka, Hiroshi Ino, Takayuki Okatani

专题命中 推理评测 :planning(abstract)

Comments Main Paper: 8 pages, Supplementary Materials: 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04985 2025-01-10 cs.CR 50%

SpaLLM-Guard: Pairing SMS Spam Detection Using Open-source and Commercial LLMs

Muhammad Salman, Muhammad Ikram, Nardine Basta, Mohamed Ali Kaafar

专题命中 推理评测 :chain-of-thought(abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04150 2025-01-09 cs.CV 50%

Benchmarking Large and Small MLLMs

Xuelu Feng, Yunsheng Li, Dongdong Chen, Mei Gao, Mengchen Liu, Junsong Yuan, Chunming Qiao

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01932 2025-01-06 cs.CV 50%

Bridging Classification and Segmentation in Osteosarcoma Assessment via Foundation and Discrete Diffusion Models

Manh Duong Nguyen, Dac Thai Nguyen, Trung Viet Nguyen, Homi Yamada, Huy Hieu Pham, Phi Le Nguyen

机构 * Hanoi University of Science and Technology(河内科学技术大学) Vinmec Times City International Hospital(Vinmec Times City国际医院) Vinmec Healthcare System(Vinmec医疗系统) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心) College of Health Sciences, VinUniversity(VinUniversity健康科学学院)

专题命中 推理评测 :planning(abstract)

Comments Accepted for presentation at the 2025 IEEE International Symposium on Biomedical Imaging (ISBI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19304 2024-12-30 cs.CV 50%

Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries

Roberto Amoroso, Gengyuan Zhang, Rajat Koner, Lorenzo Baraldi, Rita Cucchiara, Volker Tresp

机构 * University of Modena and Reggio Emilia(摩德纳-雷焦艾米利亚大学) LMU Munich(慕尼黑大学) MCML(慕尼黑计算与机器学习中心)

专题命中 推理评测 :reasoning(abstract)

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14209 2024-12-30 cs.SE 50%

Agents4PLC: Automating Closed-loop PLC Code Generation and Verification in Industrial Control Systems using LLM-based Agents

Zihan Liu, Ruinan Zeng, Dongxia Wang, Gengyun Peng, Jingyi Wang, Qiang Liu, Peiyu Liu, Wenhai Wang

专题命中 推理评测 :chain-of-thought(abstract)

Comments 12 pages (references included), 6 figures and 3 tables. New version updated with fixed site and github repo and along with some minor adjustements

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00717 2024-12-25 cs.RO cs.CV cs.MA 50%

End-to-End Autonomous Driving through V2X Cooperation

Haibao Yu, Wenxian Yang, Jiaru Zhong, Zhenwei Yang, Siqi Fan, Ping Luo, Zaiqing Nie

专题命中 推理评测 :planning(abstract)

Comments Accepted by AAAI 2025. Add more open-loop evaluation indicators

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08719 2024-12-25 cs.SE cs.CC 50%

CodeComplex: Dataset for Worst-Case Time Complexity Prediction

Seung-Yeop Baik, Joonghyuk Hahn, Jungin Kim, Mingi Jeon, Aditi, Yo-Sub Han, Sang-Ki Ko

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16583 2024-12-24 cs.CV 50%

REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation

Xizhe Xue, Guoting Wei, Hao Chen, Haokui Zhang, Feng Lin, Chunhua Shen, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学) Lighthouse Munich Center for Machine Learning(慕尼黑灯塔机器学习中心)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08231 2024-12-24 cs.IR 50%

DaRec: A Disentangled Alignment Framework for Large Language Model and Recommender System

Xihong Yang, Heming Jing, Zixing Zhang, Jindong Wang, Huakang Niu, Shuaiqiang Wang, Yu Lu, Junfeng Wang, Dawei Yin, Xinwang Liu, En Zhu, Defu Lian, Erxue Min

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14206 2024-12-20 cs.HC cs.AR 50%

Design of an AI-Enhanced Digital Stethoscope: Advancing Cardiovascular Diagnostics Through Smart Auscultation

Abraham G. Taye, Sador Yemane, Eshetu Negash, Yared Minwuyelet, Nebiha Tofik

专题命中 推理评测 :planning(abstract)

Comments 44 pages

Journal ref https://www.researchgate.net/publication/369693979_Design_for_Advanced_Digital_Stethoscope (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07498 2024-12-19 cs.CR 50%

Semantic Sleuth: Identifying Ponzi Contracts via Large Language Models

Cong Wu, Jing Chen, Ziwei Wang, Ruichao Liang, Ruiying Du

专题命中 推理评测 :chain-of-thought(abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12095 2024-12-18 cs.CV 50%

Causal Diffusion Transformers for Generative Modeling

Chaorui Deng, Deyao Zhu, Kunchang Li, Shi Guang, Haoqi Fan

机构 * ByteDance Research(字节跳动研究院)

专题命中 推理评测 :reasoning(abstract)

Comments 22 figures, 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12075 2024-12-17 cs.CV 50%

CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding

Guo Chen, Yicheng Liu, Yifei Huang, Yuping He, Baoqi Pei, Jilan Xu, Yali Wang, Tong Lu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract)

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10758 2024-12-17 cs.CV 50%

Optimizing Vision-Language Interactions Through Decoder-Only Models

Kaito Tanaka, Benjamin Tan, Brian Wong

机构 * SANNO University(神奈川大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11396 2024-12-11 cs.SE 50%

Towards an Understanding of Large Language Models in Software Engineering Tasks

Zibin Zheng, Kaiwen Ning, Qingyuan Zhong, Jiachi Chen, Wenqing Chen, Lianghong Guo, Weicheng Wang, Yanlin Wang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11255 2024-12-10 cs.SD cs.MM eess.AS 50%

M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models

Shansong Liu, Atin Sakkeer Hussain, Qilong Wu, Chenshuo Sun, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯平台与内容事业群ARC实验室) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏