arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2504.12637 2025-04-18 cs.CL cs.AI 62%

Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation

Linda He, Jue Wang, Maurice Weber, Shang Zhu, Ben Athiwaratkun, Ce Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12350 2025-04-18 cs.CL cs.AI 62%

A Large-Language Model Framework for Relative Timeline Extraction from PubMed Case Reports

Jing Wang, Jeremy C Weiss

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref 2025 AMIA Informatics Summit Proceedings, March 10-13, Pittsburgh, PA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16514 2025-04-17 cs.AR cs.AI cs.LG cs.PL 62%

VeriMind: Agentic LLM for Automated Verilog Generation with a Novel Evaluation Metric

Bardia Nadimi, Ghali Omar Boutaib, Hao Zheng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10999 2025-04-15 cs.CL cs.AI 62%

Balancing Rigor and Utility: Mitigating Cognitive Biases in Large Language Models for Multiple-Choice Questions

Hanyang Zhong, Liman Wang, Wenting Cao, Zeyuan Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments This work has been accepted as a full paper at the 2025 Annual Conference of the Cognitive Science Society (CogSci 2025) and will be presented in the form of a poster. The dataset and project website are available at: https://hanyangzhong.github.io/BRU-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08772 2025-04-15 cs.LG cs.AI 62%

Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning

Younghwan Lee, Tung M. Luu, Donghoon Lee, Chang D. Yoo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 5 pages, ICASSP 2025. First two authors are equally contributed

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08312 2025-04-14 cs.LG cs.AI 62%

SortBench: Benchmarking LLMs based on their ability to sort lists

Steffen Herbold

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07703 2025-04-14 cs.AI cs.CL 62%

DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?

Liqiang Jing, Zhehui Huang, Xiaoyang Wang, Wenlin Yao, Wenhao Yu, Kaixin Ma, Hongming Zhang, Xinya Du, Dong Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15341 2025-04-09 cs.LG cs.AI q-bio.GN 62%

GenoTEX: An LLM Agent Benchmark for Automated Gene Expression Data Analysis

Haoyang Liu, Shuyu Chen, Ye Zhang, Haohan Wang

专题命中 推理评测 :self-correction(abstract);分类 cs.AI、cs.LG

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03598 2025-04-07 cs.CL cs.AI cs.IR 62%

EnrichIndex: Using LLMs to Enrich Retrieval Indices Offline

Peter Baile Chen, Tomer Wolfson, Michael Cafarella, Dan Roth

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Dataset and code are available at https://peterbaile.github.io/enrichindex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02587 2025-04-07 cs.LG cs.CL cs.CV 62%

Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme

Yan Ma, Steffi Chern, Xuyang Shen, Yiran Zhong, Pengfei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Code is public and available at: https://github.com/GAIR-NLP/MAYE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19331 2025-04-07 cs.CV cs.AI cs.LG 62%

CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models

Kiet A. Nguyen, Adheesh Juvekar, Tianjiao Yu, Muntasir Wahed, Ismini Lourentzou

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2025. Project page: https://plan-lab.github.io/calico/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12480 2025-04-07 cs.LG cs.AI 62%

Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols?

Alex Mallen, Charlie Griffin, Misha Wagner, Alessandro Abate, Buck Shlegeris

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13213 2025-04-03 cs.CL cs.AI cs.DB 62%

Multi-Meta-RAG: Improving RAG for Multi-Hop Queries using Database Filtering with LLM-Extracted Metadata

Mykhailo Poliakov, Nadiya Shvai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICTERI 2024 Posters Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00661 2025-04-02 cs.CL cs.AI 62%

DynMoLE: Boosting Mixture of LoRA Experts Fine-Tuning with a Hybrid Routing Mechanism

Dengchun Li, Naizheng Wang, Zihao Zhang, Haoyang Yin, Lei Duan, Meng Xiao, Mingjie Tang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24310 2025-04-01 cs.CL cs.AI 62%

BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models

Alok Abhishek, Lisa Erickson, Tushar Bandopadhyay

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 32 pages, 33 figures, preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23934 2025-04-01 cs.LG cs.AI 62%

Green MLOps to Green GenOps: An Empirical Study of Energy Consumption in Discriminative and Generative AI Operations

Adrián Sánchez-Mompó, Ioannis Mavromatis, Peizheng Li, Konstantinos Katsaros, Aftab Khan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Published to MDPI Information - Artificial Intelligence Section

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23779 2025-04-01 cs.CL cs.AI 62%

WinoWhat: A Parallel Corpus of Paraphrased WinoGrande Sentences with Common Sense Categorization

Ine Gevers, Victor De Marez, Luna De Bruyne, Walter Daelemans

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19654 2025-04-01 cs.CV cs.AI cs.LG 62%

RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models

Mehdi Moshtaghi, Siavash H. Khajavi, Joni Pajarinen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22074 2025-03-31 cs.CL cs.AI 62%

Penrose Tiled Low-Rank Compression and Section-Wise Q&A Fine-Tuning: A General Framework for Domain-Specific Large Language Model Adaptation

Chuan-Wei Kuo, Siyu Chen, Chenqi Yan, Yu Yang Fredrik Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21839 2025-03-31 cs.CV cs.AI cs.LG 62%

M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization?

Haolong Yan, Kaijun Tan, Yeqing Shen, Xin Huang, Zheng Ge, Xiangyu Zhang, Si Li, Daxin Jiang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20786 2025-03-27 cs.CL cs.AI 62%

Mobile-MMLU: A Mobile Intelligence Language Understanding Benchmark

Sondos Mahmoud Bsharat, Mukul Ranjan, Aidar Myrzakhan, Jiacheng Liu, Bowei Guo, Shengkun Tang, Zhuang Liu, Yuanzhi Li, Zhiqiang Shen

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

Comments An order-invariant and mobile-centric benchmark. Code and data are available at: https://github.com/VILA-Lab/Mobile-MMLU

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20227 2025-03-27 cs.CL cs.AI 62%

Advancements in Natural Language Processing: Exploring Transformer-Based Architectures for Text Understanding

Tianhao Wu, Yu Wang, Ngoc Quach

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted by the 5th International Conference on Artificial Intelligence and Industrial Technology Applications (AIITA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20202 2025-03-27 cs.CL cs.AI cs.HC cs.RO 62%

SARGes: Semantically Aligned Reliable Gesture Generation via Intent Chain

Nan Gao, Yihua Bao, Dongdong Weng, Jiayi Zhao, Jia Li, Yan Zhou, Pengfei Wan, Di Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00599 2025-03-26 cs.CV cs.AI cs.LG 62%

VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM

Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 14 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10636 2025-03-25 cs.LG cs.AI 62%

Adapt-$\infty$: Scalable Continual Multimodal Instruction Tuning via Dynamic Data Selection

Adyasha Maharana, Jaehong Yoon, Tianlong Chen, Mohit Bansal

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments First two authors contributed equally. Code: https://github.com/adymaharana/adapt-inf

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17755 2025-03-25 cs.CL cs.LG 62%

Improving Preference Extraction In LLMs By Identifying Latent Knowledge Through Classifying Probes

Sharan Maiya, Yinhong Liu, Ramit Debnath, Anna Korhonen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments preprint, submitted to ACL ARR 2025, 21 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17645 2025-03-25 cs.AI cs.LG 62%

A Modular Dataset to Demonstrate LLM Abstraction Capability

Adam Atanas, Kai Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures. Submitted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19845 2025-03-25 cs.CR cs.AI cs.CE cs.LG 62%

Enhancing Trust and Safety in Digital Payments: An LLM-Powered Approach

Devendra Dahiphale, Naveen Madiraju, Justin Lin, Rutvik Karve, Monu Agrawal, Anant Modwal, Ramanan Balakrishnan, Shanay Shah, Govind Kaushal, Priya Mandawat, Prakash Hariramani, Arif Merchant

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16480 2025-03-24 cs.HC cs.AI cs.CL cs.CY 62%

Human Preferences for Constructive Interactions in Language Model Alignment

Yara Kyrychenko, Jon Roozenbeek, Brandon Davidson, Sander van der Linden, Ramit Debnath

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 1 Figure, 1 Table, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15242 2025-03-21 cs.CL cs.AI cs.CC 62%

BigO(Bench) -- Can LLMs Generate Code with Controlled Time and Space Complexity?

Pierre Chambon, Baptiste Roziere, Benoit Sagot, Gabriel Synnaeve

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏