arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2510.19559 2025-10-23 cs.CV cs.AI cs.IR cs.MM 57%

A Matter of Time: Revealing the Structure of Time in Vision-Language Models

Nidham Tekaya, Manuela Waldner, Matthias Zeppelzauer

机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17501 2025-10-23 cs.CV cs.AI 57%

Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization

Yuanli Wu, Long Zhang, Yue Du, Bin Li

机构 * Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05571 2025-10-23 cs.CL 57%

Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations

Chengzhi Liu, Yuzhe Yang, Kaiwen Zhou, Zhen Zhang, Yue Fan, Yanan Xie, Peng Qi, Xin Eric Wang

专题命中 推理评测 :self-correction(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11857 2025-10-23 cs.DC cs.LG 57%

LLMBridge: Reducing Costs to Access LLMs in a Prompt-Centric Internet

Noah Martin, Abdullah Bin Faisal, Hiba Eltigani, Rukhshan Haroon, Swaminathan Lamelas, Fahad Dogar

机构 * Tufts University(塔夫茨大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18054 2025-10-22 cs.CV cs.CL 57%

HouseTour: A Virtual Real Estate A(I)gent

Ata Çelen, Marc Pollefeys, Daniel Barath, Iro Armeni

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Microsoft Spatial AI Lab(微软空间人工智能实验室) HUN-REN SZTAKI(匈牙利-罗马尼亚科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published on ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18043 2025-10-22 cs.AI 57%

CompactPrompt: A Unified Pipeline for Prompt Data Compression in LLM Workflows

Joong Ho Choi, Jiayang Zhao, Jeel Shah, Ritvika Sonawane, Vedant Singh, Avani Appalla, Will Flanagan, Filipe Condessa

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Workshop on LLMs and Generative AI for Finance at ACM ICAIF 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16263 2025-10-22 cs.RO cs.AI cs.CV 57%

NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?

Jierui Peng, Yanyan Zhang, Yicheng Duan, Tuo Liang, Vipin Chaudhary, Yu Yin

机构 * Department of Computer & Data Sciences(计算机与数据科学系) Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Homepage: https://vulab-ai.github.io/NEBULA-Alpha/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01042 2025-10-22 cs.LG cs.IR 57%

MatPROV: A Provenance Graph Dataset of Material Synthesis Extracted from Scientific Literature

Hirofumi Tsuruta, Masaya Kumagai

机构 * SAKURA internet Inc.(SAKURA互联网公司) Kyoto University(京都大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11442 2025-10-22 cs.SE cs.LG 57%

ReVeal: Self-Evolving Code Agents via Reliable Self-Verification

Yiyang Jin, Kunzhao Xu, Hang Li, Xueting Han, Yanmin Zhou, Cheng Li, Jing Bai

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16924 2025-10-21 cs.CL 57%

Does Visual Grounding Enhance the Understanding of Embodied Knowledge in Large Language Models?

Zhihui Yang, Yupei Wang, Kaijie Mo, Zhe Zhao, Renfen Hu

机构 * Beijing Normal University(北京师范大学) Tencent AI Lab(腾讯AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Findings). This version corrects a redundant sentence in the Results section that appeared in the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14605 2025-10-21 cs.CV cs.AI 57%

Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering

Yuyang Hong, Jiaqi Gu, Qi Yang, Lubin Fan, Yue Wu, Ying Wang, Kun Ding, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02921 2025-10-21 cs.CL 57%

A Controllable Examination for Long-Context Language Models

Yijun Yang, Zeyu Huang, Wenhao Zhu, Zihan Qiu, Fei Yuan, Jeff Z. Pan, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NeurIPS 2025 Dataset and Benchmark Track Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12575 2025-10-21 cs.AI 57%

RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics

Jie Zhang, Cezara Petrui, Kristina Nikolić, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15993 2025-10-21 q-fin.PM cs.LG q-fin.ST 57%

Aligning Language Models with Investor and Market Behavior for Financial Recommendations

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特兰理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11108 2025-10-21 cs.MA cs.AI cs.CR 57%

A Vision for Access Control in LLM-based Agent Systems

Xinfeng Li, Dong Huang, Jie Li, Hongyi Cai, Zhenhong Zhou, Wei Dong, XiaoFeng Wang, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) National University of Singapore, Singapore(国立新加坡大学,新加坡)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05909 2025-10-21 cs.AI 57%

Optimizing for Persuasion Improves LLM Generalization: Evidence from Quality-Diversity Evolution of Debate Strategies

Aksel Joonas Reedi, Corentin Léger, Julien Pourcel, Loris Gaven, Perrine Charriau, Guillaume Pourcel

机构 * University of Groningen(格罗宁根大学) Inria, Flowers team(法国国家信息与自动化研究所,Flowers团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Open-source code available at https://github.com/flowersteam/llm_persuasion

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25748 2025-10-21 cs.CV cs.AI 57%

Dolphin v1.0 Technical Report

Taohan Weng, Kaibing Hu, Henan Liu, Siya Liu, Xiaoyang Liu, Zhenyu Liu, Jiren Ren, Boyan Wang, Boyang Wang, Yiyu Wang, Yalun Wu, Chaoran Yan, Kaiwen Yan, Jinze Yu, Chi Zhang, Duo Zhang, Haoyun Zheng, Xiaoqing Guo, Jacques Souquet, Hongcheng Guo, Anjie Le

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12713 2025-10-21 cs.SE cs.CL 57%

Humanity's Last Code Exam: Can Advanced LLMs Conquer Human's Hardest Code Competition?

Xiangyang Li, Xiaopeng Li, Kuicai Dong, Quanhu Zhang, Rongju Ruan, Xinyi Dai, Xiaoshuang Liu, Shengchun Xu, Yasheng Wang, Ruiming Tang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15513 2025-10-20 cs.CL 57%

Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?

Ashutosh Bajpai, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) MongoDB, Inc.(MongoDB公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP Main Long Paper 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15406 2025-10-20 cs.CL 57%

VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency

Hongcheng Liu, Yixuan Hou, Heyang Liu, Yuhao Wang, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15162 2025-10-20 cs.CV cs.CL 57%

Train a Unified Multimodal Data Quality Classifier with Synthetic Data

Weizhi Wang, Rongmei Lin, Shiyang Li, Colin Lockard, Ritesh Sarkhel, Sanket Lokegaonkar, Jingbo Shang, Xifeng Yan, Nasser Zalmout, Xian Li

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Amazon Stores Foundational AI(亚马逊商店基础人工智能) UC San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03360 2025-10-20 cs.AI 57%

CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment

Rui Feng, Zhiyao Luo, Wei Wang, Yuting Song, Yong Liu, Tingting Zhu, Jianqing Li, Xingyao Wang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments 19 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13564 2025-10-20 cs.CV cs.AI 57%

HumorDB: Can AI understand graphical humor?

Vedaant Jain, Felipe dos Santos Alves Feitosa, Gabriel Kreiman

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of São Paulo(圣保罗大学) Harvard Medical School(哈佛医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 10 main figures, 4 additional appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14200 2025-10-17 cs.CL 57%

RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following

Zhichao Wang, Andy Wong, Ruslan Belkin

机构 * Inflection AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14115 2025-10-17 cs.SE cs.LG 57%

David vs. Goliath: A comparative study of different-sized LLMs for code generation in the domain of automotive scenario generation

Philipp Bauerfeind, Amir Salarpour, David Fernandez, Pedram MohajerAnsari, Johannes Reschke, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 推理评测 :CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13931 2025-10-17 cs.CL 57%

Robust or Suggestible? Exploring Non-Clinical Induction in LLM Drug-Safety Decisions

Siying Liu, Shisheng Zhang, Indu Bala

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Preprint of a paper accepted as a poster at the NeurIPS 2025 Workshop on Generative AI for Health (GenAI4Health). The final camera-ready workshop version may differ. Licensed under CC BY 4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03867 2025-10-17 cs.CL 57%

Drivel-ology: Challenging LLMs with Interpreting Nonsense with Depth

Yang Wang, Chenghao Xiao, Chia-Yi Hsiao, Zi Yan Chang, Chi-Li Chen, Tyler Loakman, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Durham University(杜伦大学) The University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted for oral presentation at the EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18668 2025-10-17 cs.CV cs.CL 57%

ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation

Zhen Li, Duan Li, Yukai Guo, Xinyuan Guo, Bowen Li, Lanxi Xiao, Shenyu Qiao, Jiashu Chen, Zijian Wu, Hui Zhang, Xinhuan Shu, Shixia Liu

机构 * Tsinghua University(清华大学) Newcastle University(新castle大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20934 2025-10-17 cs.SE cs.AI 57%

Leveraging LLMs, IDEs, and Semantic Embeddings for Automated Move Method Refactoring

Abhiram Bellur, Fraol Batole, Mohammed Raihan Ullah, Malinda Dilhara, Yaroslav Zharov, Timofey Bryksin, Kai Ishikawa, Haifeng Chen, Masaharu Morimoto, Shota Motoura, Takeo Hosomi, Tien N. Nguyen, Hridesh Rajan, Nikolaos Tsantalis, Danny Dig

机构 * University of Colorado(科罗拉多大学) Tulane University(路易斯安那州立大学) Amazon Web Services(亚马逊网络服务) JetBrains Research(JetBrains研究) NEC Corporation(日本电报电话公司) NEC Laboratories America(日本电报电话美洲实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) Concordia University(康科迪亚大学) University of Colorado, JetBrains Research(科罗拉多大学,JetBrains研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Published at the International Conference on Software Maintenance and Evolution (ICSME'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14471 2025-10-17 cs.CL 57%

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted as a spotlight at the 1st workshop on Multilingual and Equitable Language Technologies (MELT), COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏