arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2510.26193 2025-10-31 cs.CL 57%

RCScore: Quantifying Response Consistency in Large Language Models

Dongjun Jang, Youngchae Ahn, Hyopil Shin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26006 2025-10-31 cs.CV cs.CL 57%

CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments

Rishika Bhagwatkar, Syrielle Montariol, Angelika Romanou, Beatriz Borges, Irina Rish, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院) MILA(蒙特利尔人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25997 2025-10-31 cs.AI cs.SE 57%

From Queries to Insights: Agentic LLM Pipelines for Spatio-Temporal Text-to-SQL

Manu Redd, Tao Zhe, Dongjie Wang

机构 * University of Kansas(堪萨斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 5 figures, GeoGenAgent'25 - ACM SIGSPATIAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25908 2025-10-31 cs.AI 57%

SciTrust 2.0: A Comprehensive Framework for Evaluating Trustworthiness of Large Language Models in Scientific Applications

Emily Herron, Junqi Yin, Feiyi Wang

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Preprint Submitted to ACM Transactions on AI for Science (TAIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11695 2025-10-31 cs.CL 57%

When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents

Lingfei Qian, Xueqing Peng, Yan Wang, Vincent Jim Zhang, Huan He, Hanley Smith, Yi Han, Yueru He, Haohang Li, Yupeng Cao, Yangyang Yu, Alejandro Lopez-Lira, Peng Lu, Jian-Yun Nie, Guojun Xiong, Jimin Huang, Sophia Ananiadou

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Florida(佛罗里达大学) Harvard University(哈佛大学) National Centre for Text Mining, University of Manchester(曼彻斯特大学文本挖掘中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04852 2025-10-31 cs.CV cs.LG 57%

CAUSAL3D: A Comprehensive Benchmark for Causal Learning from Visual Data

Disheng Liu, Yiran Qiao, Wuche Liu, Yiren Lu, Yunlai Zhou, Tuo Liang, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Datasets link: https://huggingface.co/datasets/LLDDSS/Causal3D_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06818 2025-10-30 cs.CL cs.IR 57%

Large Language Models for Few-Shot Named Entity Recognition

Yufei Zhao, Xiaoshi Zhong, Erik Cambria, Jagath C. Rajapakse

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments 17 pages, 2 figures. Accepted by AI, Computer Science and Robotics Technology (ACRT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19028 2025-10-30 cs.CV cs.AI 57%

InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts

Tianchi Xie, Minzhi Lin, Mengchen Liu, Yilin Ye, Changjian Chen, Shixia Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23960 2025-10-29 cs.CV cs.AI cs.CR 57%

SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability

Peiyang Xu, Minzhou Pan, Zhaorun Chen, Shuang Yang, Chaowei Xiao, Bo Li

机构 * University of Chicago(芝加哥大学) Virtue AI Meta University of Wisconsin, Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 42 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23775 2025-10-29 cs.CV cs.AI eess.IV 57%

Explainable Detection of AI-Generated Images with Artifact Localization Using Faster-Than-Lies and Vision-Language Models for Edge Devices

Aryan Mathur, Asaduddin Ahmed, Pushti Amit Vasoya, Simeon Kandan Sonar, Yasir Z, Madesh Kuppusamy

机构 * Indian Institute of Technology Palakkad, India(印度帕拉卡德理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00063 2025-10-29 physics.chem-ph cs.AI 57%

MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision

Yuyang Wu, Jinhui Ye, Shuhao Zhang, Lu Dai, Yonatan Bisk, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 9 pages

Journal ref EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06560 2025-10-29 cs.CL 57%

NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables

Lanrui Wang, Mingyu Zheng, Hongyin Tang, Zheng Lin, Yanan Cao, Jingang Wang, Xunliang Cai, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23358 2025-10-28 cs.CL 57%

How AI Forecasts AI Jobs: Benchmarking LLM Predictions of Labor Market Changes

Sheri Osborn, Rohit Valecha, H. Raghav Rao, Dan Sass, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 8 pages + Limitations + References

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22898 2025-10-28 cs.AI cs.SE 57%

On Generalization in Agentic Tool Calling: CoreThink Agentic Reasoner and MAVEN Dataset

Vishvesh Bhat, Omkar Ghugarkar, Julian McAuley

机构 * CoreThink AI University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22477 2025-10-28 cs.MA cs.AI 57%

Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization

Yijia Fan, Jusheng Zhang, Jing Yang, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22395 2025-10-28 cs.CL 57%

Confabulations from ACL Publications (CAP): A Dataset for Scientific Hallucination Detection

Federica Gamba, Aman Sinha, Timothee Mickus, Raul Vazquez, Patanjali Bhamidipati, Claudio Savelli, Ahana Chattopadhyay, Laura A. Zanella, Yash Kankanampati, Binesh Arakkal Remesh, Aryan Ashok Chandramania, Rohit Agarwal, Chuyuan Li, Ioana Buhnila, Radhika Mamidi

机构 * Charles University, Prague(查尔斯大学,布拉格) Independent Researcher(独立研究者) University of Helsinki, Finland(赫尔辛基大学) University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学,温哥华,加拿大) Chosun University, South Korea(成均馆大学,韩国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01481 2025-10-28 cs.CV cs.LG 57%

VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding

Zongxia Li, Xiyang Wu, Guangyao Shi, Yubin Qin, Hongyang Du, Fuxiao Liu, Tianyi Zhou, Dinesh Manocha, Jordan Lee Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07246 2025-10-28 cs.LG cs.CV 57%

ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area

Junxian Li, Di Zhang, Xunzhi Wang, Zeying Hao, Jingdi Lei, Qian Tan, Cai Zhou, Wei Liu, Yaotian Yang, Xinrui Xiong, Weiyun Wang, Zhe Chen, Wenhai Wang, Wei Li, Shufei Zhang, Mao Su, Wanli Ouyang, Yuqiang Li, Dongzhan Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 11 pages, updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21867 2025-10-28 cs.CV cs.AI 57%

Addressing Corner Cases in Autonomous Driving: A World Model-based Approach with Mixture of Experts and LLMs

Haicheng Liao, Bonan Wang, Junxian Yang, Chengyue Wang, Zhengbin He, Guohui Zhang, Chengzhong Xu, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学) Department of Civil and Environmental Engineering, University of Macau(土木与环境工程系,澳门大学) Senseable City Lab, Massachusetts Institute of Technology(可感知城市实验室,麻省理工学院) Department of Civil and Environmental Engineering, University of Hawaii(土木与环境工程系,夏威夷大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09501 2025-10-28 cs.CL 57%

Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference

Jiayi Yuan, Hao Li, Xinheng Ding, Wenya Xie, Yu-Jhe Li, Wentian Zhao, Kun Wan, Jing Shi, Xia Hu, Zirui Liu

机构 * Rice University(Rice大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Adobe Inc.(Adobe公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24063 2025-10-28 cs.CL cs.DB 57%

TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine

Jiacheng Xie, Yang Yu, Ziyang Zhang, Shuai Zeng, Jiaxuan He, Ayush Vasireddy, Xiaoting Tang, Congyu Guo, Lening Zhao, Congcong Jing, Guanghui An, Dong Xu

机构 * Department of Electrical Engineering and Computer Science, University of Missouri(密苏里大学电气工程与计算机科学系) Christopher S. Bond Life Sciences Center, University of Missouri(密苏里大学克里斯托弗·S·邦德生命科学中心) Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Computer Science and Mathematics, Truman State University(特拉华州立大学计算机科学与数学系) Marquette High School(马基特高中) Community Health Service Center, Shanghai Pudong New Area(上海浦东新区社区卫生服务中心) School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院) Department of Endocrinology, Seventh People’s Hospital of Shanghai University of Traditional Chinese Medicine(上海中医药大学第七人民医院内分泌科) School of Acupuncture-Moxibustion and Tuina, Shanghai University of Traditional Chinese Medicine(上海中医药大学针灸推拿学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21603 2025-10-27 cs.IR cs.CL 57%

Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research

Kuicai Dong, Shurui Huang, Fangda Ye, Wei Han, Zhi Zhang, Dexun Li, Wenjun Li, Qu Yang, Gang Wang, Yichao Wang, Chen Zhang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21501 2025-10-27 cs.CV cs.AI 57%

GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs

Guanghao Zheng, Bowen Shi, Mingxing Xu, Ruoyu Sun, Peisen Zhao, Zhibo Zhang, Wenrui Dai, Junni Zou, Hongkai Xiong, Xiaopeng Zhang, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc.(华为公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06958 2025-10-27 cs.CY cs.AI cs.MA 57%

Simulating Society Requires Simulating Thought

Chance Jiajie Li, Jiayi Wu, Zhenze Mo, Ao Qu, Yuhan Tang, Kaiya Ivy Zhao, Yulu Gan, Jie Fan, Jiangbo Yu, Jinhua Zhao, Paul Liang, Luis Alonso, Kent Larson

机构 * MIT Media Lab(麻省理工学院媒体实验室) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT BCS(麻省理工学院生物工程与计算机科学系) MIT IDSS(麻省理工学院国际设计与研究系统) MIT CEE(麻省理工学院土木与环境工程系) MIT DUSP(麻省理工学院设计与科学计划) MIT Architecture(麻省理工学院建筑系) Northeastern University(东北大学) Brown University(布朗大学) McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments NeurIPS 2025 (Position Paper Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20976 2025-10-27 cs.LG 57%

L^2M^3OF: A Large Language Multimodal Model for Metal-Organic Frameworks

Jiyu Cui, Fang Wu, Haokai Zhao, Minggao Feng, Xenophon Evangelopoulos, Andrew I. Cooper, Yejin Choi

机构 * Department of Chemistry, University of Liverpool(利兹大学化学系) Leverhulme Research Centre for Functional Materials Design, University of Liverpool(利兹大学功能性材料设计研究所以) Department of Computer Science, University of Stanford(斯坦福大学计算机科学系) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20952 2025-10-27 cs.LG 57%

LLM-Integrated Bayesian State Space Models for Multimodal Time-Series Forecasting

Sungjun Cho, Changho Shin, Suenggwan Jo, Xinya Yan, Shourjo Aditya Chaudhuri, Frederic Sala

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20337 2025-10-24 cs.AI 57%

Collateral Damage Assessment Model for AI System Target Engagement in Military Operations

Clara Maathuis, Kasper Cools

机构 * Open University of the Netherlands(荷兰开放大学) Royal Military Academy, Belgium(比利时皇家军事学院) Vrije Universiteit Brussel, Belgium(比利时自由大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at MILCOM 2025 WS07

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20119 2025-10-24 cs.LG 57%

There is No "apple" in Timeseries: Rethinking TSFM through the Lens of Invariance

Arian Prabowo, Flora D. Salim

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of New South Wales(新南威尔士大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19167 2025-10-24 cs.CL 57%

"You Are Rejected!": An Empirical Study of Large Language Models Taking Hiring Evaluations

Dingjie Fu, Dianxing Shi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Technical Report, 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15086 2025-10-24 cs.CL 57%

Is Safety Standard Same for Everyone? User-Specific Safety Evaluation of Large Language Models

Yeonjun In, Wonjoong Kim, Kanghoon Yoon, Sungchul Kim, Mehrab Tanjim, Sangwu Park, Kibum Kim, Chanyoung Park

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏