arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2311.05591 2024-11-26 cs.CV cs.AI cs.CL 62%

Multimodal Foundation Models Exploit Text to Make Medical Image Predictions

Thomas Buckley, James A. Diao, Pranav Rajpurkar, Adam Rodman, Arjun K. Manrai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15488 2024-11-26 cs.CL cs.AI cs.CV 62%

Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark

Rong-Cheng Tu, Zi-Ao Ma, Tian Lan, Yuehao Zhao, Heyan Huang, Xian-Ling Mao

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14042 2024-11-22 cs.CL cs.AI 62%

Forecasting Future International Events: A Reliable Dataset for Text-Based Event Modeling

Daehoon Gwak, Junwoo Park, Minho Park, Chaehun Park, Hyunchan Lee, Edward Choi, Jaegul Choo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02783 2024-11-22 cs.CL cs.LG 62%

Large Language Models on Graphs: A Comprehensive Survey

Bowen Jin, Gang Liu, Chi Han, Meng Jiang, Heng Ji, Jiawei Han

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 25 pages

Journal ref Transactions on Knowledge and Data Engineering (TKDE) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12176 2024-11-18 cs.CY cs.AI cs.CL 62%

GPT-4V Cannot Generate Radiology Reports Yet

Yuyang Jiang, Chacha Chen, Dang Nguyen, Benjamin M. Mervak, Chenhao Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 3 figures, code: https://github.com/ChicagoHAI/cxr-eval-gpt-4v Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09492 2024-11-15 cs.CL cs.AI 62%

MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs

Mengyuan Zhang, Ruihui Wang, Bo Xia, Yuan Sun, Xiaobing Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09213 2024-11-15 cs.CL cs.AI cs.IR 62%

Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering

Nghia Trung Ngo, Chien Van Nguyen, Franck Dernoncourt, Thien Huu Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14192 2024-11-13 cs.CL cs.AI 62%

LeKUBE: A Legal Knowledge Update BEnchmark

Changyue Wang, Weihang Su, Hu Yiran, Qingyao Ai, Yueyue Wu, Cheng Luo, Yiqun Liu, Min Zhang, Shaoping Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05778 2024-11-13 cs.AI cs.CL 62%

LLMs as Method Actors: A Model for Prompt Engineering and Architecture

Colin Doyle

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15997 2024-11-12 cs.CL cs.AI 62%

RoCar: A Relationship Network-based Evaluation Method for Large Language Models

Ming Wang, Wenfang Wu, Chongyun Gao, Daling Wang, Shi Feng, Yifei Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05232 2024-11-11 cs.CL cs.AI 62%

Abstract2Appendix: Academic Reviews Enhance LLM Long-Context Capabilities

Shengzhi Li, Kittipat Kampa, Rongyu Lin, Bohang Li, Shichao Pei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments We share our latest dataset on https://github.com/findalexli/Abstract2Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04998 2024-11-08 cs.CV cs.AI cs.LG 62%

HourVideo: 1-Hour Video-Language Understanding

Keshigeyan Chandrasegaran, Agrim Gupta, Lea M. Hadzic, Taran Kota, Jimming He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, Li Fei-Fei

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04075 2024-11-07 cs.CL cs.AI 62%

M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models

Chuhan Li, Ziyao Shangguan, Yilun Zhao, Deyuan Li, Yixin Liu, Arman Cohan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03964 2024-11-07 cs.CL cs.AI 62%

What Really is Commonsense Knowledge?

Quyet V. Do, Junze Li, Tung-Duong Vuong, Zhaowei Wang, Yangqiu Song, Xiaojuan Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Code and data will be released together with the next version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04691 2024-11-06 cs.CL cs.AI cs.DB 62%

Synthetic SQL Column Descriptions and Their Impact on Text-to-SQL Performance

Niklas Wretblad, Oskar Holmström, Erik Larsson, Axel Wiksäter, Oscar Söderlund, Hjalmar Öhman, Ture Pontén, Martin Forsberg, Martin Sörme, Fredrik Heintz

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02036 2024-11-05 cs.CL cs.AI 62%

Explainable cognitive decline detection in free dialogues with a Machine Learning approach based on pre-trained Large Language Models

Francisco de Arriba-Pérez, Silvia García-Méndez, Javier Otero-Mosquera, Francisco J. González-Castaño

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref Applied Intelligence, 1-16 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11944 2024-11-05 cs.CL cs.AI cs.CV 62%

CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark

Ge Zhang, Xinrun Du, Bei Chen, Yiming Liang, Tongxu Luo, Tianyu Zheng, Kang Zhu, Yuyang Cheng, Chunpu Xu, Shuyue Guo, Haoran Zhang, Xingwei Qu, Junjie Wang, Ruibin Yuan, Yizhi Li, Zekun Wang, Yudong Liu, Yu-Hsuan Tsai, Fengji Zhang, Chenghua Lin, Wenhao Huang, Jie Fu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00737 2024-11-04 cs.CL cs.AI q-bio.BM 62%

MolCap-Arena: A Comprehensive Captioning Benchmark on Language-Enhanced Molecular Property Prediction

Carl Edwards, Ziqing Lu, Ehsan Hajiramezanali, Tommaso Biancalani, Heng Ji, Gabriele Scalia

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20745 2024-11-01 cs.LG cs.AI 62%

Shopping MMLU: A Massive Multi-Task Online Shopping Benchmark for Large Language Models

Yilun Jin, Zheng Li, Chenwei Zhang, Tianyu Cao, Yifan Gao, Pratik Jayarao, Mao Li, Xin Liu, Ritesh Sarkhel, Xianfeng Tang, Haodong Wang, Zhengyang Wang, Wenju Xu, Jingfeng Yang, Qingyu Yin, Xian Li, Priyanka Nigam, Yi Xu, Kai Chen, Qiang Yang, Meng Jiang, Bing Yin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track Accepted. Modified typos in Figure 9

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10574 2024-10-29 cs.CR cs.AI cs.ET cs.LG 62%

Detection Made Easy: Potentials of Large Language Models for Solidity Vulnerabilities

Md Tauseef Alam, Raju Halder, Abyayananda Maiti

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16412 2024-10-29 cs.CL cs.LG 62%

KG-FIT: Knowledge Graph Fine-Tuning Upon Open-World Knowledge

Pengcheng Jiang, Lang Cao, Cao Xiao, Parminder Bhatia, Jimeng Sun, Jiawei Han

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16264 2024-10-23 cs.CL cs.AI 62%

One Thousand and One Pairs: A "novel" challenge for long-context language models

Marzena Karpinska, Katherine Thai, Kyle Lo, Tanya Goyal, Mohit Iyyer

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15440 2024-10-22 cs.CL cs.AI 62%

Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering

Yanggyu Lee, Jihie Kim

专题命中 推理评测 :CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to the Trustworthy AI Workshop at IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15319 2024-10-22 cs.CL cs.AI stat.ML 62%

Causality for Large Language Models

Anpeng Wu, Kun Kuang, Minqin Zhu, Yingrong Wang, Yujia Zheng, Kairong Han, Baohong Li, Guangyi Chen, Fei Wu, Kun Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09038 2024-10-22 cs.CL cs.AI physics.med-ph 62%

Translating Radiology Reports into Plain Language using ChatGPT and GPT-4 with Prompt Learning: Promising Results, Limitations, and Potential

Qing Lyu, Josh Tan, Michael E. Zapadka, Janardhana Ponnatapura, Chuang Niu, Kyle J. Myers, Ge Wang, Christopher T. Whitlow

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12855 2024-10-21 cs.CL cs.AI 62%

JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework

Fan Liu, Yue Feng, Zhao Xu, Lixin Su, Xinyu Ma, Dawei Yin, Hao Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06572 2024-10-21 cs.CL cs.AI cs.IR 62%

Graph Neural Network Enhanced Retrieval for Question Answering of LLMs

Zijian Li, Qingyan Guo, Jiawei Shao, Lei Song, Jiang Bian, Jun Zhang, Rui Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13343 2024-10-18 cs.CL cs.LG 62%

Do LLMs Overcome Shortcut Learning? An Evaluation of Shortcut Challenges in Large Language Models

Yu Yuan, Lili Zhao, Kai Zhang, Guangting Zheng, Qi Liu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13216 2024-10-18 cs.AI cs.CL 62%

Anchored Alignment for Self-Explanations Enhancement

Luis Felipe Villa-Arenas, Ata Nizamoglu, Qianli Wang, Sebastian Möller, Vera Schmitt

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12329 2024-10-17 cs.CL cs.AI 62%

Understanding the Role of LLMs in Multimodal Evaluation Benchmarks

Botian Jiang, Lei Li, Xiaonan Li, Zhaowei Li, Xiachong Feng, Lingpeng Kong, Qi Liu, Xipeng Qiu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏