arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2411.11362 2024-11-19 cs.CV cs.CL 57%

MAIRA-Seg: Enhancing Radiology Report Generation with Segmentation-Aware Multimodal Large Language Models

Harshita Sharma, Valentina Salvatelli, Shaury Srivastav, Kenza Bouzid, Shruthi Bannur, Daniel C. Castro, Maximilian Ilse, Sam Bond-Taylor, Mercy Prasanna Ranjit, Fabian Falck, Fernando Pérez-García, Anton Schwaighofer, Hannah Richardson, Maria Teodora Wetscherek, Stephanie L. Hyland, Javier Alvarez-Valle

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted as Proceedings Paper at ML4H 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10813 2024-11-19 cs.CL 57%

Information Anxiety in Large Language Models

Prasoon Bajpai, Sarah Masud, Tanmoy Chakraborty

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19336 2024-11-19 cs.AI cs.PL 57%

Improving LLM Classification of Logical Errors by Integrating Error Relationship into Prompts

Yanggyu Lee, Suchae Jeong, Jihie Kim

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments Published in ITS 2024 (Best Paper Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07950 2024-11-19 cs.CL 57%

SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models

Dan Zhang, Ziniu Hu, Sining Zhoubian, Zhengxiao Du, Kaiyu Yang, Zihan Wang, Yisong Yue, Yuxiao Dong, Jie Tang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to NeurIPS D&B Track 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08320 2024-11-14 cs.AI 57%

Responsible AI in Construction Safety: Systematic Evaluation of Large Language Models and Prompt Engineering

Farouq Sammour, Jia Xu, Xi Wang, Mo Hu, Zhenyu Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15736 2024-11-14 cs.CL 57%

General LLMs as Instructors for Domain-Specific LLMs: A Sequential Fusion Method to Integrate Extraction and Editing

Xin Zhang, Tianjie Ju, Huijia Liang, Ying Fu, Qin Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07336 2024-11-13 cs.CL 57%

SetLexSem Challenge: Using Set Operations to Evaluate the Lexical and Semantic Robustness of Language Models

Bardiya Akhbari, Manish Gawali, Nicholas A. Dronen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 8 figures, NeurIPS 2024 Datasets and Benchmarks track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06835 2024-11-12 cs.CL cs.CR 57%

HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NeurIPS 2024 Workshop on Safe Generative Artificial Intelligence (SafeGenAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12641 2024-11-12 cs.CL 57%

DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?

Zhouhong Gu, Lin Zhang, Xiaoxuan Zhu, Jiangjie Chen, Wenhao Huang, Yikai Zhang, Shusen Wang, Zheyu Ye, Yan Gao, Hongwei Feng, Yanghua Xiao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04485 2024-11-12 cs.AI cs.CV 57%

GenAI Arena: An Open Evaluation Platform for Generative Models

Dongfu Jiang, Max Ku, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 9 pages,7 figures

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05338 2024-11-11 cs.CL 57%

SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers

Shruti Singh, Nandan Sarkar, Arman Cohan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 18 pages, Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23956 2024-11-07 cs.CL 57%

Multilingual Pretraining Using a Large Corpus Machine-Translated from a Single Source Language

Jiayi Wang, Yao Lu, Maurice Weber, Max Ryabinin, Yihong Chen, Raphael Tang, Pontus Stenetorp

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11650 2024-11-07 cs.CR cs.AI 57%

CIPHER: Cybersecurity Intelligent Penetration-testing Helper for Ethical Researcher

Derry Pratama, Naufal Suryanto, Andro Aprila Adiputra, Thi-Thu-Huong Le, Ahmada Yusril Kadiptya, Muhammad Iqbal, Howon Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 28 pages, github available

Journal ref Sensors 2024, 24(21), 6878;

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10057 2024-11-07 cs.CV cs.AI 57%

First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models

Enming Zhang, Ruobing Yao, Huanyong Liu, Junhui Yu, Jiale Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05269 2024-11-07 cs.CV cs.LG 57%

LifelongMemory: Leveraging LLMs for Answering Queries in Long-form Egocentric Videos

Ying Wang, Yanlai Yang, Mengye Ren

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17353 2024-11-05 cs.CL 57%

Internalizing ASR with Implicit Chain of Thought for Efficient Speech-to-Speech Conversational LLM

Robin Shing-Hei Yuen, Timothy Tin-Long Tse, Jian Zhu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Updated for reviewer comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17557 2024-11-01 cs.CL 57%

The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Guilherme Penedo, Hynek Kydlíček, Loubna Ben allal, Anton Lozhkov, Margaret Mitchell, Colin Raffel, Leandro Von Werra, Thomas Wolf

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22553 2024-10-31 cs.AI 57%

ML Research Benchmark

Matthew Kenney

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20441 2024-10-31 cs.CR cs.AI cs.HC 57%

SECURE: Benchmarking Large Language Models for Cybersecurity

Dipkamal Bhusal, Md Tanvirul Alam, Le Nguyen, Ashim Mahara, Zachary Lightcap, Rodney Frazier, Romy Fieblinger, Grace Long Torales, Benjamin A. Blakely, Nidhi Rastogi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21965 2024-10-30 cs.CL 57%

SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types

Yutao Mou, Shikun Zhang, Wei Ye

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted by NeurIPS2024 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21311 2024-10-30 cs.CV cs.AI 57%

MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding

Fengbin Zhu, Ziyang Liu, Xiang Yao Ng, Haohui Wu, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Tat Seng Chua

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19874 2024-10-30 cs.CV cs.AI 57%

Paved or unpaved? A Deep Learning derived Road Surface Global Dataset from Mapillary Street-View Imagery

Sukanya Randhawa, Eren Aygun, Guntaj Randhawa, Benjamin Herfort, Sven Lautenbach, Alexander Zipf

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17134 2024-10-29 cs.SE cs.AI 57%

RepairAgent: An Autonomous, LLM-Based Agent for Program Repair

Islem Bouzenia, Premkumar Devanbu, Michael Pradel

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16048 2024-10-29 cs.HC cs.AI 57%

GUIDE: Graphical User Interface Data for Execution

Rajat Chawla, Adarsh Jha, Muskaan Kumar, Mukunda NS, Ishaan Bhola

专题命中 推理评测 :CoT(abstract);分类 cs.AI

Comments 11 pages, 8 figures, 3 Tables and 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09687 2024-10-28 cs.SE cs.LG 57%

SQAPlanner: Generating Data-Informed Software Quality Improvement Plans

Dilini Rajapaksha, Chakkrit Tantithamthavorn, Jirayus Jiarpakdee, Christoph Bergmeir, John Grundy, Wray Buntine

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments This work has been Accepted by the IEEE Transactions on Software Engineering 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19485 2024-10-28 cs.CL 57%

A Debate-Driven Experiment on LLM Hallucinations and Accuracy

Ray Li, Tanishka Bagade, Kevin Martinez, Flora Yasmin, Grant Ayala, Michael Lam, Kevin Zhu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18588 2024-10-25 cs.LG 57%

Knowledge Distillation Using Frontier Open-source LLMs: Generalizability and the Role of Synthetic Data

Anup Shirgaonkar, Nikhil Pandey, Nazmiye Ceren Abay, Tolga Aktas, Vijay Aski

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07112 2024-10-25 cs.CV cs.AI 57%

VHELM: A Holistic Evaluation of Vision Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Wenhao Zheng, Yiyang Zhou, Yifan Mai, Josselin Somerville Roberts, Michihiro Yasunaga, Huaxiu Yao, Cihang Xie, Percy Liang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments NeurIPS 2024. First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01023 2024-10-24 cs.CV cs.AI 57%

Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!

Jiwan Chung, Seungwon Lim, Jaehyun Jeon, Seungbeen Lee, Youngjae Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted as main paper in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16640 2024-10-23 cs.CL 57%

A Statistical Analysis of LLMs' Self-Evaluation Using Proverbs

Ryosuke Sonoda, Ramya Srinivasan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏