arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2507.13390 2025-07-21 cs.CL cs.LG 62%

PARAM-1 BharatGen 2.9B Model

Kundeshwar Pundalik, Piyush Sawarkar, Nihar Sahoo, Abhishek Shinde, Prateek Chanda, Vedant Goswami, Ajay Nagpal, Atul Singh, Viraj Thakur, Vijay Dewane, Aamod Thakur, Bhargav Patel, Smita Gautam, Bhagwan Panditi, Shyam Pawar, Madhav Kotcha, Suraj Racha, Saral Sureka, Pankaj Singh, Rishi Bal, Rohit Saluja, Ganesh Ramakrishnan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14506 2025-07-21 cs.CV cs.AI cs.CL 62%

On Pre-training of Multimodal Language Models Customized for Chart Understanding

Wan-Cyuan Fan, Yen-Chun Chen, Mengchen Liu, Lu Yuan, Leonid Sigal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024 Workshop on Adaptive Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13275 2025-07-18 cs.CL cs.AI cs.IR 62%

Overview of the TalentCLEF 2025: Skill and Job Title Intelligence for Human Capital Management

Luis Gasco, Hermenegildo Fabregat, Laura García-Sardiña, Paula Estrella, Daniel Deniz, Alvaro Rodrigo, Rabih Zbib

机构 * Avature Machine Learning(Avature机器学习)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15779 2025-07-18 cs.LG cs.AI 62%

Learning Universal Human Mobility Patterns with a Foundation Model for Cross-domain Data Fusion

Haoxuan Ma, Xishun Liao, Yifan Liu, Qinhua Jiang, Chris Stanford, Shangqing Cao, Jiaqi Ma

机构 * Department of Civil and Environmental Engineering, University of California, Los Angeles(加州大学洛杉矶分校土木与环境工程系) Novateur Research Solutions(Novateur研究解决方案) Department of Civil and Environmental Engineering, University of California, Berkeley(加州大学伯克利分校土木与环境工程系)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20267 2025-07-18 cs.LG cs.AI physics.chem-ph 62%

A Large Encoder-Decoder Family of Foundation Models For Chemical Language

Eduardo Soares, Victor Shirasuna, Emilio Vital Brazil, Renato Cerqueira, Dmitry Zubarev, Kristin Schmidt

机构 * IBM Research Brazil(IBM巴西研究所以及IBM Research Brazil) IBM Research Almaden(IBM阿马登研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 3 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10596 2025-07-16 cs.CL cs.AI 62%

PLEX: Perturbation-free Local Explanations for LLM-Based Text Classification

Yogachandran Rahulamathavan, Misbah Farooq, Varuna De Silva

机构 * Institute for Digital Technologies, Loughborough University London(数字技术研究所,洛桑大学伦敦分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01738 2025-07-16 cs.CL cs.AI 62%

Style over Substance: Distilled Language Models Reason Via Stylistic Replication

Philip Lippmann, Jie Yang

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments To appear at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09185 2025-07-15 cs.CL cs.LG 62%

Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models

Ameen Ali, Shahar Katz, Lior Wolf, Ivan Titov

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09104 2025-07-15 cs.CL cs.AI 62%

CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards

Taolin Zhang, Maosong Cao, Alexander Lam, Songyang Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08104 2025-07-14 cs.MM cs.AI cs.CL cs.CV 62%

VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations

Michael Galarnyk, Veer Kejriwal, Agam Shah, Yash Bhardwaj, Nicholas Meyer, Anand Krishnan, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08015 2025-07-14 cs.CL cs.LG 62%

Assessing the Capabilities and Limitations of FinGPT Model in Financial NLP Applications

Prudence Djagba, Chimezie A. Odinakachukwu

机构 * Michigan State University(密歇根州立大学) AIMS Senegal(塞内加尔AIMS)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07748 2025-07-11 cs.CL cs.AI 62%

When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance

Peizhang Shao, Linrui Xu, Jinxi Wang, Wei Zhou, Xingyu Wu

机构 * School of Law, China University of Political Science and Law(中国政法大学法学院) Zhejiang University of Finance and Economics Dongfang College(浙江财经大学东洋学院) School of Information Management for Law, China University of Political Science and Law(中国政法大学信息管理法学院) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07439 2025-07-11 cs.CL cs.AI 62%

Towards Interpretable Time Series Foundation Models

Matthieu Boileau, Philippe Helluy, Jeremy Pawlus, Svitlana Vyetrenko

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments International Conference on Machine Leaning (ICML) 2025 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05266 2025-07-09 cs.CL cs.AI 62%

User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs

Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20545 2025-07-09 cs.SE cs.CL cs.HC cs.LG 62%

The Impact of Prompt Programming on Function-Level Code Generation

Ranim Khojah, Francisco Gomes de Oliveira Neto, Mazen Mohamad, Philipp Leitner

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) RISE Research Institutes of Sweden(瑞典RISE研究机构)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments Accepted at Transactions on Software Engineering (TSE). CodePromptEval dataset and replication package on GitHub: https://github.com/icetlab/CodePromptEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03726 2025-07-08 cs.AI cs.CL cs.IR 62%

Agent-Based Detection and Resolution of Incompleteness and Ambiguity in Interactions with Large Language Models

Riya Naik, Ashwin Srinivasan, Swati Agarwal, Estrid He

机构 * BITS Pilani, K K Birla Goa Campus(比特学院,KK Birla Goa校区) PandaByte Innovations Pvt Ltd(PandaByte创新私人有限公司) RMIT University(皇家墨尔本理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 14 pages. arXiv admin note: text overlap with arXiv:2503.17936

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24290 2025-07-08 cs.LG cs.CL 62%

Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Jingcheng Hu, Yinmin Zhang, Qi Han, Daxin Jiang, Xiangyu Zhang, Heung-Yeung Shum

机构 * StepFun Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14809 2025-07-08 cs.CL cs.AI cs.DB 62%

A Survey of Large Language Models on Generative Graph Analytics: Query, Learning, and Applications

Wenbo Shang, Xin Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 23 pages including references, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03543 2025-07-08 cs.CL cs.AI 62%

H2HTalk: Evaluating Large Language Models as Emotional Companion

Boyang Wang, Yalun Wu, Hongcheng Guo, Zhoujun Li

机构 * CCSE, Beihang University, Beijing, China(计算机科学与电子学院,北航,北京,中国) SCST, Beihang University, Beijing, China(软件学院,北航,北京,中国) Shenzhen Intelligent Strong Technology Co.,Ltd.(深圳智能强科技有限公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02938 2025-07-08 cs.CL cs.AI 62%

A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis

Jiachen Liu, Ziheng Geng, Ran Cao, Lu Cheng, Paolo Bocchini, Minghui Cheng

机构 * Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) College of Civil Engineering, Hunan University(湖南大学土木学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Center for Catastrophe Modeling and Resilience, Lehigh University(莱斯大学灾难建模与韧性中心) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04428 2025-07-08 cs.CL cs.AI 62%

MoralBench: Moral Evaluation of LLMs

Jianchao Ji, Yutong Chen, Mingyu Jin, Wujiang Xu, Wenyue Hua, Yongfeng Zhang

机构 * Rutgers The State University of New Jersey(新泽西州立大学拉特格斯分校) University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACM SIGKDD Explorations Volume 27 Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02004 2025-07-04 cs.AI cs.CL q-bio.BM 62%

STELLA: Self-Evolving LLM Agent for Biomedical Research

Ruofan Jin, Zaixi Zhang, Mengdi Wang, Le Cong

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07619 2025-07-03 cs.AI cs.LG 62%

Beating Transformers using Synthetic Cognition

Alfredo Ibias, Miguel Rodriguez-Galindo, Hector Antona, Guillem Ramirez-Miranda, Enric Guinovart

机构 * Avatar Cognition(Avatar认知)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22403 2025-07-02 cs.CL cs.AI 62%

HyperCLOVA X THINK Technical Report

NAVER Cloud HyperCLOVA X Team

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 50 pages, 13 figures; fixed figures in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20084 2025-07-01 cs.AI cs.CL cs.CY 62%

AI Awareness

Xiaojian Li, Haoyuan Shi, Rongwu Xu, Wei Xu

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院) Tsinghua University(清华大学) College of AI(人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院) Teachers College(教师学院) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19564 2025-07-01 cs.LG cs.AI 62%

FedMM-X: A Trustworthy and Interpretable Framework for Federated Multi-Modal Learning in Dynamic Environments

Sree Bhargavi Balija

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13377 2025-07-01 cs.CV cs.AI cs.CL 62%

Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding

Ye Wang, Ziheng Wang, Boshen Xu, Yang Du, Kejun Lin, Zihan Xiao, Zihao Yue, Jianzhong Ju, Liang Zhang, Dingyi Yang, Xiangnan Fang, Zewen He, Zhenbo Luo, Wenxuan Wang, Junqi Lin, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://xuboshen.github.io/Time-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09992 2025-07-01 cs.CV cs.AI cs.CL 62%

MMInA: Benchmarking Multihop Multimodal Internet Agents

Shulin Tian, Ziniu Zhang, Liangyu Chen, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 findings. The live leaderboard is at https://mmina.cliangyu.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21967 2025-06-30 cs.CL cs.LG 62%

More Vulnerable than You Think: On the Stability of Tool-Integrated LLM Agents

Weimin Xiong, Ke Wang, Yifan Song, Hanchao Liu, Sai Zhou, Wei Peng, Sujian Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21876 2025-06-30 cs.CL cs.AI cs.CV 62%

Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation

Qiyue Gao, Xinyu Pi, Kevin Liu, Junrong Chen, Ruolan Yang, Xinqi Huang, Xinyu Fang, Lu Sun, Gautham Kishore, Bo Ai, Stone Tao, Mengyang Liu, Jiaxi Yang, Chao-Jung Lai, Chuanyang Jin, Jiannan Xiang, Benhao Huang, Zeming Chen, David Danks, Hao Su, Tianmin Shu, Ziqiao Ma, Lianhui Qin, Zhiting Hu

机构 * UC San Diego JHU Cornell Tech EPFL UMich

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏