arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2510.02340 2025-10-16 cs.CL cs.LG 62%

Can Prompts Rewind Time for LLMs? Evaluating the Effectiveness of Prompted Knowledge Cutoffs

Xin Gao, Ruiyi Zhang, Daniel Du, Saurabh Mahindre, Sai Ashish Somayajula, Pengtao Xie

机构 * UC San Diego(UC圣迭戈大学) SUNY Buffalo(纽约州立大学布法罗分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Published at EMNLP 2025; Code and data available at https://github.com/gxx27/time_unlearn

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04886 2025-10-16 cs.CL cs.AI 62%

Emergent Semantics Beyond Token Embeddings: Transformer LMs with Frozen Visual Unicode Representations

A. Bochkov

机构 * Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Published in Transactions on Machine Learning Research (10/2025). OpenReview: https://openreview.net/forum?id=Odh8IynO1o

Journal ref Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03173 2025-10-16 cs.CL cs.AI cs.CV 62%

MULTI: Multimodal Understanding Leaderboard with Text and Images

Zichen Zhu, Yang Xu, Lu Chen, Jingkai Yang, Yichuan Ma, Yiming Sun, Hailin Wen, Jiaqi Liu, Jinyu Cai, Yingzi Ma, Situo Zhang, Zihan Zhao, Liangtai Sun, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Key Laboratory of Artificial Intelligence\ of Education, Shanghai Jiao Tong University, Shanghai 200240 , China Jiangsu Key Lab of Language Computing, Suzhou 215123 , China College of Computing Data Science, Nanyang Technological University, Singapore 639798 , Singapore Suzhou Laboratory, Suzhou 215123 , China

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 19 figures, 10 tables. Details and access are available at: https://OpenDFM.github.io/MULTI-Benchmark/

Journal ref Sci. China Inf. Sci. 68, 200107 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12750 2025-10-15 cs.CV cs.AI cs.LG 62%

VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage

A. Alfarano, L. Venturoli, D. Negueruela del Castillo

机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12633 2025-10-15 cs.LG cs.AI cs.DC 62%

Laminar: A Scalable Asynchronous RL Post-Training Framework

Guangming Sheng, Yuxuan Tong, Borui Wan, Wang Zhang, Chaobo Jia, Xibin Wu, Yuqi Wu, Xiang Li, Chi Zhang, Yanghua Peng, Haibin Lin, Xin Liu, Chuan Wu

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11977 2025-10-15 cs.AI cs.CL 62%

Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation

Sayash Kapoor, Benedikt Stroebl, Peter Kirgis, Nitya Nadgir, Zachary S Siegel, Boyi Wei, Tianci Xue, Ziru Chen, Felix Chen, Saiteja Utpala, Franck Ndzomga, Dheeraj Oruganty, Sophie Luskin, Kangheng Liu, Botao Yu, Amit Arora, Dongyoon Hahm, Harsh Trivedi, Huan Sun, Juyong Lee, Tengjun Jin, Yifan Mai, Yifei Zhou, Yuxuan Zhu, Rishi Bommasani, Daniel Kang, Dawn Song, Peter Henderson, Yu Su, Percy Liang, Arvind Narayanan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01909 2025-10-15 cs.AI cs.CL cs.CY cs.HC cs.SC 62%

Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models

Ranjie Duan, Jiexi Liu, Xiaojun Jia, Shiji Zhao, Ruoxi Cheng, Fengxiang Wang, Cheng Wei, Yong Xie, Chang Liu, Defeng Li, Yinpeng Dong, Yichi Zhang, Yuefeng Chen, Chongwen Wang, Xingjun Ma, Xingxing Wei, Yang Liu, Hang Su, Jun Zhu, Xinfeng Li, Yitong Sun, Jie Zhang, Jinzhao Hu, Sha Xu, Wenchao Yang, Yitong Yang, Xingyao Zhang, Yingshui Tan, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴AAIG)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Technical Report Code & Model weights available: https://github.com/Alibaba-AAIG/Oyster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14094 2025-10-15 cs.LG cs.AI 62%

Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets

Benjamin Pikus, Pratyush Ranjan Tiwari, Burton Ye

机构 * Independent(独立研究者) Eternis Labs(Eternis实验室) Writer, Inc(Writer公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11277 2025-10-14 cs.CL cs.AI 62%

Towards Real-Time Fake News Detection under Evidence Scarcity

Guangyu Wei, Ke Han, Yueming Lyu, Yu Luo, Yue Jiang, Caifeng Shan, Nicu Sebe

机构 * Nanjing University(南京大学) Ocean University of China(海洋大学) University of Trento(特伦托大学) Chinese Academy of Sciences(中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11222 2025-10-14 cs.CL cs.AI 62%

Fairness Metric Design Exploration in Multi-Domain Moral Sentiment Classification using Transformer-Based Models

Battemuulen Naranbat, Seyed Sahand Mohammadi Ziabari, Yousuf Nasser Al Husaini, Ali Mohammed Mansoor Alsahag

机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) Department of Computer Science and Technology, SUNY Empire State University(纽约州立大学奥本大学计算机科学与技术系) Faculty of Computer Studies, Arab Open University, Oman(阿曼开放大学计算机研究学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25279 2025-10-14 cs.AI cs.DC cs.LG 62%

RL in the Wild: Characterizing RLVR Training in LLM Deployment

Jiecheng Zhou, Qinghao Hu, Yuyang Jin, Zerui Wang, Peng Sun, Yuzhe Gu, Wenwei Zhang, Mingshu Zhai, Xingcheng Zhang, Weiming Zhang

机构 * USTC(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) NTU(国立台湾大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24138 2025-10-14 cs.LG cs.AI 62%

AMSbench: A Comprehensive Benchmark for Evaluating MLLM Capabilities in AMS Circuits

Yichen Shi, Ze Zhang, Hongyang Wang, Zhuofu Tao, Zhongyi Li, Bingyu Chen, Yaxin Wang, Zhen huang, Xuhua Liu, Quan Chen, Zhiping Yu, Ting-Jung Lin, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(美国加州大学洛杉矶分校) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09426 2025-10-14 cs.CV cs.AI cs.CL 62%

BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning

Shengao Wang, Arjun Chandra, Aoming Liu, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16260 2025-10-14 cs.CL cs.AI 62%

MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use

Fei Lei, Yibo Yang, Wenxiu Sun, Dahua Lin

机构 * SenseTime Research(商汤科技研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07545 2025-10-13 cs.CL cs.LG 62%

Deploying Tiny LVLM Judges for Real-World Evaluation of Chart Models: Lessons Learned and Best Practices

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Ridwan Mahbub, Mizanur Rahman, Amran Bhuiyan, Israt Jahan, Mir Tafseer Nayeem, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Salesforce AI Research(Salesforce AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to the EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08931 2025-10-13 cs.AI cs.LG 62%

RADAR: Mechanistic Pathways for Detecting Data Contamination in LLM Evaluation

Ashish Kattamuri, Harshwardhan Fartale, Arpita Vats, Rahul Raja, Ishita Prasad

机构 * Proofpoint Indian Institute of Science(印度科学研究院) Linkedin Meta FAIR

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08648 2025-10-13 cs.LG cs.AI 62%

Inverse-Free Wilson Loops for Transformers: A Practical Diagnostic for Invariance and Order Sensitivity

Edward Y. Chang, Ethan Y. Chang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08626 2025-10-13 cs.CL cs.AI 62%

From What to Why: Thought-Space Recommendation with Small Language Models

Prosenjit Biswas, Pervez Shaik, Abhinav Thorat, Ravi Kolla, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08608 2025-10-13 cs.CL cs.AI 62%

MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation

Weihua Zheng, Zhengyuan Liu, Tanmoy Chakraborty, Weiwen Xu, Xiaoxue Gao, Bryan Chen Zhengyu Tan, Bowei Zou, Chang Liu, Yujia Hu, Xing Xie, Xiaoyuan Yi, Jing Yao, Chaojun Wang, Long Li, Rui Liu, Huiyao Liu, Koji Inoue, Ryuichi Sumida, Tatsuya Kawahara, Fan Xu, Lingyu Ye, Wei Tian, Dongjun Kim, Jimin Jung, Jaehyung Seo, Nadya Yuki Wangsajaya, Pham Minh Duc, Ojasva Saxena, Palash Nandi, Xiyan Tao, Wiwik Karlina, Tuan Luong, Keertana Arun Vasan, Roy Ka-Wei Lee, Nancy F. Chen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Indian Institute of Technology Delhi(印度理工学院德里分校) Alibaba DAMO Academy(阿里巴巴达摩院) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Inner Mongolia University(内蒙古大学) Kyoto University(京都大学) Jiangxi Normal University(江西师范大学) Korea University(韩国大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07414 2025-10-13 cs.CL cs.AI cs.IR 62%

Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation

Mufei Li, Dongqi Fu, Limei Wang, Si Zhang, Hanqing Zeng, Kaan Sancak, Ruizhong Qiu, Haoyu Wang, Xiaoxin He, Xavier Bresson, Yinglong Xia, Chonglin Sun, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta AI University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Code available at https://github.com/Graph-COM/HaystackCraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07912 2025-10-10 cs.CL cs.AI 62%

Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation

Fanwei Zhua, Jiaxuan He, Xiaoxiao Chen, Zulong Chen, Quan Lu, Chenrui Mei

机构 * Hangzhou City University(杭州市大学) Alibaba Group(阿里巴巴集团) Zhejiang Hospital(浙江省医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07709 2025-10-10 cs.AI cs.CL cs.CY cs.MA 62%

Multimodal Safety Evaluation in Generative Agent Social Simulations

Alhim Vera, Karen Sanchez, Carlos Hinojosa, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem

机构 * University of Cincinnati(辛辛那提大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07356 2025-10-10 cs.LG cs.CL cs.CV stat.ML 62%

ConCuR: Conciseness Makes State-of-the-Art Kernel Generation

Lingcheng Kong, Jiateng Wei, Hanzhang Shen, Huan Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07293 2025-10-09 cs.SD cs.AI cs.CL eess.AS 62%

AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs

Peize He, Zichen Wen, Yubo Wang, Yuxuan Wang, Xiaoqian Liu, Jiajie Huang, Zehui Lei, Zhuangcheng Gu, Xiangqi Jin, Jiabing Yang, Kai Li, Zhifei Liu, Weijia Li, Cunxiang Wang, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 23 figures, the code is available at \url{https://github.com/DabDans/AudioMarathon}

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07173 2025-10-09 cs.CL cs.LG 62%

NurseLLM: The First Specialized Language Model for Nursing

Md Tawkat Islam Khondaker, Julia Harrington, Shady Shehata

机构 * Yourika Labs(Yourika实验室) The University of British Columbia(不列颠哥伦比亚大学) Western University(西方大学) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16765 2025-10-09 cs.CL cs.AI cs.SD eess.AS 62%

The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology

Fagun Patel, Duc Q. Nguyen, Sang T. Truong, Jody Vaynshtok, Sanmi Koyejo, Nick Haber

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Sound Speech and Hearing Clinic(语音与听力诊所)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06260 2025-10-09 cs.CV cs.AI cs.LG 62%

Ensemble Deep Learning and LLM-Assisted Reporting for Automated Skin Lesion Diagnosis

Sher Khan, Raz Muhammad, Adil Hussain, Muhammad Sajjad, Muhammad Rashid

机构 * Institute of Computer Science The University of Agriculture Peshawar, Pakistan(计算机科学研究所 伊斯兰农业大学 薩瓦爾,巴基斯坦) Department of Computer Science Islamia College Peshawar Pakistan(计算机科学系 伊斯兰学院 薩瓦爾,巴基斯坦) Department of Software Engineering Islamia College Peshawar Pakistan(软件工程系 伊斯兰学院 薩瓦爾,巴基斯坦)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24031 2025-10-09 cs.LG cs.AI cs.CV cs.MA 62%

GPS-MTM: Capturing Pattern of Normalcy in GPS-Trajectories with self-supervised learning

Umang Garg, Bowen Zhang, Anantajit Subrahmanya, Chandrakanth Gudavalli, BS Manjunath

机构 * ECE Department(电子工程系) University of California(加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05935 2025-10-08 cs.LG cs.AI 62%

LLM-FS-Agent: A Deliberative Role-based Large Language Model Architecture for Transparent Feature Selection

Mohamed Bal-Ghaoui, Fayssal Sabri

机构 * R&D Department, Audensiel Conseil(Audensiel Conseil 研发部) Ecole Centrale de Lyon(Lyon 工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09387 2025-10-08 cs.LG cs.AI 62%

MetaLLMix : An XAI Aided LLM-Meta-learning Based Approach for Hyper-parameters Optimization

Mohamed Bal-Ghaoui, Mohammed Tiouti

机构 * R&D Department, Audensiel Conseil Paris, France(Audensiel Conseil 巴黎法国研发部) Université Évry Paris-Saclay(Évry 巴黎-萨克莱大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏