arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2507.17467 2025-07-24 cs.CV cs.AI 57%

Probing Vision-Language Understanding through the Visual Entailment Task: promises and pitfalls

Elena Pitta, Tom Kouwenhoven, Tessa Verhoef

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, The Netherlands(莱顿先进计算机科学研究所(LIACS)、莱顿大学、荷兰)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments LUHME: 2nd Workshop on Language Understanding in the Human-Machine Era

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17147 2025-07-24 cs.CL 57%

CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards

Cheng Liu, Yifei Lu, Fanghua Ye, Jian Li, Xingyu Chen, Feiliang Ren, Zhaopeng Tu, Xiaolong Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16572 2025-07-23 cs.CL 57%

Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models

Mohamad Ballout, Serwan Jassim, Elia Bruni

机构 * Institute of Cognitive Science, University of Osnabrück(认知科学研究所,奥斯纳布吕克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16213 2025-07-23 cs.CV cs.AI 57%

Advancing Visual Large Language Model for Multi-granular Versatile Perception

Wentao Xiang, Haoxian Tan, Cong Wei, Yujie Zhong, Dengjie Li, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan Inc.(美团公司)

专题命中 推理评测 :CoT(abstract);分类 cs.AI

Comments To appear in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07939 2025-07-23 cs.CL 57%

SAGE: A Visual Language Model for Anomaly Detection via Fact Enhancement and Entropy-aware Alignment

Guoxin Zang, Xue Li, Donglin Di, Lanshun Nie, Dechen Zhan, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15759 2025-07-22 cs.CL 57%

Interaction as Intelligence: Deep Research With Human-AI Partnership

Lyumanshan Ye, Xiaojie Cai, Xinkai Wang, Junfei Wang, Xiangkun Hu, Jiadi Su, Yang Nan, Sihan Wang, Bohan Zhang, Xiaoze Fan, Jinbin Luo, Yuxiang Zheng, Tianze Xu, Dayuan Fu, Yunze Wu, Pengrui Lu, Zengzhi Wang, Yiwei Qin, Zhen Huang, Yan Ma, Zhulin Hu, Haoyang Zou, Tiantian Mi, Yixin Ye, Ethan Chern, Pengfei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15140 2025-07-22 cs.AI 57%

Clinical Semantic Intelligence (CSI): Emulating the Cognitive Framework of the Expert Clinician for Comprehensive Oral Disease Diagnosis

Mohammad Mashayekhi, Sara Ahmadi Majd, Arian AmirAmjadi, Parsa Hosseini

机构 * Gilan University of Medical Sciences(加兹万大学医学科学学院) University of Göttingen(哥廷根大学) University of Tehran(德黑兰大学) Hamadan University of Technology(哈马丹技术大学) Islamic Azad University(伊斯兰 Azad 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08297 2025-07-22 cs.CL 57%

KAT-V1: Kwai-AutoThink Technical Report

Zizheng Zhan, Ken Deng, Huaixi Tang, Wen Xiang, Kun Wu, Weihao Li, Wenqiang Zhu, Jingxuan Xu, Lecheng Huang, Zongxian Feng, Shaojie Wang, Shangpeng Yan, Xuxing Chen, Jiaheng Liu, Zhongyuan Peng, Zuchen Gao, Haoyang Huang, Xiaojiang Zhang, Jinghui Wang, Zheng Lin, Mengtong Li, Huiming Wang, Ziqi Zhan, Yanan Wu, Yuanxing Zhang, Jian Yang, Guang Chen, Haotian Zhang, Bin Chen, Bing Yu

机构 * Kuaishou(快手)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18023 2025-07-22 cs.CL 57%

DARE: Diverse Visual Question Answering with Robustness Evaluation

Hannah Sterz, Jonas Pfeiffer, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14586 2025-07-22 physics.app-ph cs.CE cs.CL 57%

What do Large Language Models know about materials?

Adrian Ehrenhofer, Thomas Wallmersperger, Gianaurelio Cuniberti

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14355 2025-07-22 cs.CL 57%

Can LLMs Infer Personality from Real World Conversations?

Jianfeng Zhu, Ruoming Jin, Karin G. Coifman

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10467 2025-07-22 cs.CR cs.AI 57%

Specification and Evaluation of Multi-Agent LLM Systems -- Prototype and Cybersecurity Applications

Felix Härer

机构 * University of Applied Sciences Northwestern Switzerland(西北瑞士应用科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments This work has been submitted for publication. Copyright may be transferred. In this case, this version will be updated with a notice, according to the publisher's guidelines

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10622 2025-07-22 physics.med-ph cs.AI 57%

A recent evaluation on the performance of LLMs on radiation oncology physics using questions of randomly shuffled options

Peilong Wang, Jason Holmes, Zhengliang Liu, Dequan Chen, Tianming Liu, Jiajian Shen, Wei Liu

机构 * Department of Radiation Oncology, Mayo Clinic, Phoenix, AZ 85054(放射肿瘤科,梅奥诊所,凤凰城,AZ 85054) School of Computing, University of Georgia, Athens, GA 30602(计算学院,佐治亚大学,阿瑟兹,GA 30602) Department of Radiology, Mayo Clinic, Rochester, MN 55905(放射科,梅奥诊所,罗切斯特,MN 55905)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08958 2025-07-21 astro-ph.IM astro-ph.CO cs.AI cs.MA 57%

Bridging Literature and the Universe Via A Multi-Agent Large Language Model System

Xiaowen Zhang, Zhenyu Bi, Patrick Lachance, Xuan Wang, Tiziana Di Matteo, Rupert A. C. Croft

机构 * Department of Physics, Carnegie Mellon University(卡内基梅隆大学物理系) Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13190 2025-07-18 cs.CL 57%

GEMMAS: Graph-based Evaluation Metrics for Multi Agent Systems

Jisoo Lee, Raeyoung Chang, Dongwook Kwon, Harmanpreet Singh, Nikhil Verma

机构 * Seoul National University(首尔国立大学) Sogang University(成均馆大学) Kwangwoon University(康武大学) LG Electronics, Toronto AI Lab(LG电子,多伦多AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 4 figures, 1 algorithm, 2 tables, 6 pages, under review at EMNLP Industry track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12845 2025-07-18 cs.CV cs.AI 57%

SEMT: Static-Expansion-Mesh Transformer Network Architecture for Remote Sensing Image Captioning

Khang Truong, Lam Pham, Hieu Tang, Jasmin Lampert, Martin Boyer, Son Phan, Truong Nguyen

机构 * Austrian Institute of Technology(奥地利技术研究院) University of Technology of Troyes(图卢兹技术大学) Ho Chi Minh University of Technology(胡志明技术大学) Ton Duc Thang University(-ton Duc Thang大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12372 2025-07-17 cs.CL 57%

Web-Browsing LLMs Can Access Social Media Profiles and Infer User Demographics

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei, Mohsen Mosleh

机构 * University of Zurich(苏黎世大学) IPM(伊朗科学院) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11730 2025-07-17 cs.CV cs.AI 57%

Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis

Maciej Szankin, Vidhyananth Venkatasamy, Lihang Ying

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21536 2025-07-17 cs.AI cs.HC 57%

PsyLite Technical Report

Fangjun Ding, Renyu Zhang, Xinyu Feng, Chengye Xie, Zheng Zhang, Yanting Zhang

机构 * Donghua University(东华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11538 2025-07-16 cs.AI 57%

How Many Instructions Can LLMs Follow at Once?

Daniel Jaroslawicz, Brendan Whiting, Parth Shah, Karime Maamari

机构 * Distyl AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11527 2025-07-16 cs.AI cs.CE 57%

DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering

Yinsheng Li, Zhen Dong, Yi Shao

机构 * McGill University(麦吉尔大学) UC Santa Barbara(圣巴巴拉大学) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Project page: https://github.com/Eason-Li-AIS/DrafterBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11457 2025-07-16 cs.LG eess.IV 57%

LRMR: LLM-Driven Relational Multi-node Ranking for Lymph Node Metastasis Assessment in Rectal Cancer

Yaoxian Dong, Yifan Gao, Haoyue Li, Yanfen Cui, Xin Gao

机构 * Shanxi Province Cancer Hospital, Chinese Academy of Medical Sciences(山西省肿瘤医院、中国医学科学院) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(苏州生物医学工程与技术研究所、中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11155 2025-07-16 cs.CR cs.AI 57%

Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities

Yiting Qu, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments To Appear in the 34th USENIX Security Symposium, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10911 2025-07-16 cs.AI 57%

Lessons Learned from Evaluation of LLM based Multi-agents in Safer Therapy Recommendation

Yicong Wu, Ting Chen, Irit Hochberg, Zhoujian Sun, Ruth Edry, Zhengxing Huang, Mor Peleg

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10182 2025-07-15 cs.SE cs.AI 57%

Breaking the Myth: Can Small Models Infer Postconditions Too?

Gehao Zhang, Zhenting Wang, Juan Zhai

机构 * University of Massachusetts(马萨诸塞大学) Rutgers University(罗格斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10098 2025-07-15 cs.CL 57%

Fusing Large Language Models with Temporal Transformers for Time Series Forecasting

Chen Su, Yuanhe Tian, Qinyu Liu, Jun Zhang, Yan Song

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学) Beijing Northern Computility InterConnection Co., Ltd.(北京北方计算互联有限公司) ENN Group Co., Ltd.(ENN集团有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22998 2025-07-15 cs.LG 57%

LLM Agents for Bargaining with Utility-based Feedback

Jihwan Oh

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09075 2025-07-15 cs.CL 57%

OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique

Wasi Uddin Ahmad, Somshubra Majumdar, Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Jocelyn Huang, Siddhartha Jain, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(英伟达圣克拉拉分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16899 2025-07-15 cs.CR cs.AI 57%

Towards Effective Complementary Security Analysis using Large Language Models

Jonas Wagner, Simon Müller, Christian Näther, Jan-Philipp Steghöfer, Andreas Both

机构 * Data Science Group \ Web \& Software Engineering Research Group Paderborn University Leipzig University of Applied Sciences Paderborn, Germany \ Leipzig, Germany \ Web \& Software Engineering Research Group Leipzig University of Applied Sciences Leipzig, Germany

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00947 2025-07-15 cs.CL cs.CV 57%

VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information

Ryo Kamoi, Yusen Zhang, Sarkar Snigdha Sarathi Das, Ranran Haoran Zhang, Rui Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments COLM 2025. VisOnlyQA dataset, code, and model responses are provided at https://github.com/psunlpgroup/VisOnlyQA. Please also refer to our project website at https://visonlyqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏