arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2503.04006 2025-03-07 cs.CV cs.LG 57%

DSV-LFS: Unifying LLM-Driven Semantic Cues with Visual Features for Robust Few-Shot Segmentation

Amin Karimi, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02374 2025-03-05 cs.CL 57%

MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics

Haoan Jin, Jiacheng Shi, Hanhui Xu, Kenny Q. Zhu, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Fudan University(复旦大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16456 2025-03-05 cs.LG cs.SE 57%

CoCoNUT: Structural Code Understanding does not fall out of a tree

Claas Beger, Saikat Dutta

机构 * Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Accepted at 2025 IEEE/ACM International Workshop on Large Language Models for Code (LLM4Code)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20903 2025-03-05 cs.CV cs.AI 57%

WalkVLM:Aid Visually Impaired People Walking by Vision Language Model

Zhiqiang Yuan, Ting Zhang, Ying Deng, Jiapei Zhang, Yeshuang Zhu, Zexi Jia, Jie Zhou, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯公司微信AI模式识别中心)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16792 2025-03-05 cs.LO cs.AI 57%

Laurel: Unblocking Automated Verification with Large Language Models

Eric Mugnier, Emmanuel Anaya Gonzalez, Ranjit Jhala, Nadia Polikarpova, Yuanyuan Zhou

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

Comments 34 pages, accepted at OOPSLA 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01550 2025-03-04 cs.CY cs.CL 57%

None of the Above, Less of the Right: Parallel Patterns between Humans and LLMs on Multi-Choice Questions Answering

Zhi Rui Tam, Cheng-Kuang Wu, Chieh-Yen Lin, Yun-Nung Chen

机构 * Appier AI Research(爱沛人工智能研究院) National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01226 2025-03-04 q-bio.NC cs.LG 57%

Dementia Insights: A Context-Based MultiModal Approach

Sahar Sinene Mehdoui, Abdelhamid Bouzid, Daniel Sierra-Sosa, Adel Elmaghraby

机构 * University of Louisville(路易斯维尔大学) The Catholic University of America(美国天主教大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17924 2025-03-04 cs.CL 57%

FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models

Hongzhan Lin, Yang Deng, Yuxuan Gu, Wenxuan Zhang, Jing Ma, See-Kiong Ng, Tat-Seng Chua

机构 * Hong Kong Baptist University(香港浸会大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Harbin Institute of Technology(哈尔滨工业大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00353 2025-03-04 cs.CL cs.IR 57%

U-NIAH: Unified RAG and LLM Evaluation for Long Context Needle-In-A-Haystack

Yunfan Gao, Yun Xiong, Wenlong Wu, Zijing Huang, Bohan Li, Haofen Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) College of Design and Innovation, Tongji University(同济大学设计与创新学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16955 2025-03-04 cs.LG cond-mat.mtrl-sci 57%

Probing the limitations of multimodal language models for chemistry and materials research

Nawaf Alampara, Mara Schilling-Wilhelmi, Martiño Ríos-García, Indrajeet Mandal, Pranav Khetarpal, Hargun Singh Grover, N. M. Anoop Krishnan, Kevin Maik Jablonka

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20868 2025-03-03 cs.CL 57%

ProBench: Benchmarking Large Language Models in Competitive Programming

Lei Yang, Renren Jin, Ling Shi, Jianxiang Peng, Yue Chen, Deyi Xiong

机构 * Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08772 2025-02-28 cs.CV cs.CL 57%

MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs

Xuannan Liu, Zekun Li, Peipei Li, Huaibo Huang, Shuhan Xia, Xing Cui, Linzhi Huang, Weihong Deng, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室智能感知与计算研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ICLR 2025, Project page: https://liuxuannan.github.io/MMFakeBench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18772 2025-02-27 cs.CL 57%

Plutus: Benchmarking Large Language Models in Low-Resource Greek Finance

Xueqing Peng, Triantafillos Papadopoulos, Efstathia Soufleri, Polydoros Giannouris, Ruoyu Xiang, Yan Wang, Lingfei Qian, Jimin Huang, Qianqian Xie, Sophia Ananiadou

机构 * The Fin AI Athens University of Economics and Business(雅典经济与商业大学) Archimedes/Athena RC(阿基米德/雅典娜研究中心) The University of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18297 2025-02-26 cs.LG cs.PL 57%

DeepCircuitX: A Comprehensive Repository-Level Dataset for RTL Code Understanding, Generation, and PPA Analysis

Zeju Li, Changran Xu, Zhengyuan Shi, Zedong Peng, Yi Liu, Yunhao Zhou, Lingfeng Zhou, Chengyu Ma, Jianyuan Zhong, Xi Wang, Jieru Zhao, Zhufei Chu, Xiaoyan Yang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai(上海) Hangzhou Dianzi University(杭州电子科技大学) Ningbo University(宁波大学) Southeast University(东南大学) National Center of Technology Innovation for EDA(国家集成电路设计自动化技术创新中心)

专题命中 推理评测 :CoT(abstract);分类 cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17943 2025-02-26 cs.CL 57%

CaseGen: A Benchmark for Multi-Stage Legal Case Documents Generation

Haitao Li, Jiaying Ye, Yiran Hu, Jia Chen, Qingyao Ai, Yueyue Wu, Junjie Chen, Yifan Chen, Cheng Luo, Quan Zhou, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) University of Waterloo(滑铁卢大学) Xiaohongshu Inc(小红书公司) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16614 2025-02-25 cs.CL 57%

CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models

Alexander Zhang, Marcus Dong, Jiaheng Liu, Wei Zhang, Yejie Wang, Jian Yang, Ge Zhang, Tianyu Liu, Zhongyuan Peng, Yingshui Tan, Yuanxing Zhang, Zhexu Wang, Weixun Wang, Yancheng He, Ken Deng, Wangchunshu Zhou, Wenhao Huang, Zhaoxiang Zhang

机构 * NJU(南京大学) M-A-P Alibaba(阿里巴巴) BUAA(北京航空航天大学) CASIA(中国科学院自动化研究所) BUPT(北京邮电大学) Kuaishou(快手) OPPO

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16357 2025-02-25 cs.CL 57%

LegalBench.PT: A Benchmark for Portuguese Law

Beatriz Canaverde, Telmo Pessoa Pires, Leonor Melo Ribeiro, André F. T. Martins

机构 * Instituto Superior Técnico(高等技术学院) Equall Georgetown University Law Center(乔治城大学法律中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12477 2025-02-25 cs.CL 57%

Savaal: Scalable Concept-Driven Question Generation to Enhance Human Learning

Kimia Noorbakhsh, Joseph Chandler, Pantea Karimi, Mohammad Alizadeh, Hari Balakrishnan

机构 * M.I.T.(麻省理工学院) Computer Science and Artificial Intelligence Lab (CSAIL)(计算机科学与人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Kimia Noorbakhsh, Joseph Chandler, and Pantea Karimi contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12558 2025-02-25 cs.CL 57%

RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues

Tzu-Lin Kuo, Feng-Ting Liao, Mu-Wei Hsieh, Fu-Chieh Chang, Po-Chun Hsu, Da-Shan Shiu

机构 * National Taiwan University(台湾大学) MediaTek Research(联发科研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15140 2025-02-24 cs.CL cs.HC 57%

Do LLMs Make Mistakes Like Students? Exploring Natural Alignment between Language Models and Human Error Patterns

Naiming Liu, Shashank Sonkar, Richard G. Baraniuk

机构 * Rice University(莱斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13773 2025-02-24 cs.CL 57%

Do Large Language Models Truly Understand Geometric Structures?

Xiaofeng Wang, Yiming Wang, Wenhong Zhu, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14191 2025-02-21 cs.CV cs.AI 57%

Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models

Michihiro Yasunaga, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta FAIR实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Dataset available at https://github.com/facebookresearch/multimodal_rewardbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07355 2025-02-21 cs.CL 57%

Think Together and Work Better: Combining Humans' and LLMs' Think-Aloud Outcomes for Effective Text Evaluation

SeongYeub Chu, JongWoo Kim, MunYong Yi

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) Department of Industrial & Systems Engineering, KAIST(韩国科学技术院工业与系统工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01758 2025-02-20 eess.IV cs.CV cs.LG 57%

GCAN: Generative Counterfactual Attention-guided Network for Explainable Cognitive Decline Diagnostics based on fMRI Functional Connectivity

Xiongri Shen, Zhenxi Song, Zhiguo Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13252 2025-02-20 cs.CL 57%

Multilingual Language Model Pretraining using Machine-translated Data

Jiayi Wang, Yao Lu, Maurice Weber, Max Ryabinin, David Adelani, Yihong Chen, Raphael Tang, Pontus Stenetorp

机构 * Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心) Together AI Mila, McGill University(米拉-麦吉尔大学) Research and Development Center for Large Language Models, National Institute of Informatics(国立信息学研究所大语言模型研发中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04990 2025-02-20 cs.CL 57%

MLaKE: Multilingual Knowledge Editing Benchmark for Large Language Models

Zihao Wei, Jingcheng Deng, Liang Pang, Hanxing Ding, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted as a full paper at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13125 2025-02-19 cs.CL 57%

RuozhiBench: Evaluating LLMs with Logical Fallacies and Misleading Premises

Zenan Zhai, Hao Li, Xudong Han, Zhenxuan Zhang, Yixuan Zhang, Timothy Baldwin, Haonan Li

机构 * LibrAI MBZUAI(MBZUAI( Mohamed bin Zayed University of Artificial Intelligence)) The University of Melbourne(墨尔本大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12510 2025-02-19 cs.CL 57%

Aspect-Guided Multi-Level Perturbation Analysis of Large Language Models in Automated Peer Review

Jiatao Li, Yanheng Li, Xinyu Hu, Mingqi Gao, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) Information Management Department, Peking University(北京大学信息管理系) Renmin University of China(中国人民大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15939 2025-02-19 cs.CL 57%

CausalGraph2LLM: Evaluating LLMs for Causal Queries

Ivaxi Sheth, Bahare Fatemi, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Google Research(谷歌研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL'25 Findings, Code - https://github.com/ivaxi0s/CausalGraph2LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16681 2025-02-19 cs.CL 57%

Triple Preference Optimization: Achieving Better Alignment using a Single Step Optimization

Amir Saeidi, Shivanshu Verma, Aswin RRV, Kashif Rasul, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根士丹利)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏