arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2402.13178 2024-02-26 cs.CL cs.AI 62%

Benchmarking Retrieval-Augmented Generation for Medicine

Guangzhi Xiong, Qiao Jin, Zhiyong Lu, Aidong Zhang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Homepage: https://teddy-xionggz.github.io/benchmark-medical-rag/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13225 2024-02-21 cs.CL cs.AI 62%

AgentMD: Empowering Language Agents for Risk Prediction with Large-Scale Clinical Tool Learning

Qiao Jin, Zhizheng Wang, Yifan Yang, Qingqing Zhu, Donald Wright, Thomas Huang, W John Wilbur, Zhe He, Andrew Taylor, Qingyu Chen, Zhiyong Lu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09136 2024-02-15 cs.CL cs.AI 62%

DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning

Yejie Wang, Keqing He, Guanting Dong, Pei Wang, Weihao Zeng, Muxi Diao, Yutao Mou, Mengdi Zhang, Jingang Wang, Xunliang Cai, Weiran Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05862 2024-02-09 cs.LG cs.AI cs.SI stat.ML 62%

Let Your Graph Do the Talking: Encoding Structured Data for LLMs

Bryan Perozzi, Bahare Fatemi, Dustin Zelle, Anton Tsitsulin, Mehran Kazemi, Rami Al-Rfou, Jonathan Halcrow

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05138 2024-02-09 cs.AI cs.CL 62%

SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark

Zhenwen Liang, Kehan Guo, Gang Liu, Taicheng Guo, Yujun Zhou, Tianyu Yang, Jiajun Jiao, Renjie Pi, Jipeng Zhang, Xiangliang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10923 2024-02-06 cs.CL cs.AI 62%

Language Models as Inductive Reasoners

Zonglin Yang, Li Dong, Xinya Du, Hao Cheng, Erik Cambria, Xiaodong Liu, Jianfeng Gao, Furu Wei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02548 2024-02-06 cs.CL cs.AI cs.SI 62%

"What's my model inside of?": Exploring the role of environments for grounded natural language understanding

Ronen Tamari

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12060 2024-01-29 cs.CL cs.AI 62%

FlexKBQA: A Flexible LLM-Powered Framework for Few-Shot Knowledge Base Question Answering

Zhenyu Li, Sunqi Fan, Yu Gu, Xiuxing Li, Zhichao Duan, Bowen Dong, Ning Liu, Jianyong Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted as AAAI-24 Oral paper; Knowledge Base Question Answering; Large Language Model; Data Generation; Few-Shot & Zero-Shot

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19956 2024-01-29 cs.CV cs.AI cs.LG eess.IV 62%

MicroSegNet: A Deep Learning Approach for Prostate Segmentation on Micro-Ultrasound Images

Hongxu Jiang, Muhammad Imran, Preethika Muralidharan, Anjali Patel, Jake Pensa, Muxuan Liang, Tarik Benidir, Joseph R. Grajo, Jason P. Joseph, Russell Terry, John Michael DiBianco, Li-Ming Su, Yuyin Zhou, Wayne G. Brisbane, Wei Shao

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

Journal ref Computerized Medical Imaging and Graphics (2024): 102326

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08604 2024-01-17 cs.CL cs.AI 62%

NormSAGE: Multi-Lingual Multi-Cultural Norm Discovery from Conversations On-the-Fly

Yi R. Fung, Tuhin Chakraborty, Hao Guo, Owen Rambow, Smaranda Muresan, Heng Ji

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01916 2024-01-08 astro-ph.IM astro-ph.CO astro-ph.GA astro-ph.SR cs.CL cs.LG 62%

AstroLLaMA-Chat: Scaling AstroLLaMA with Conversational and Diverse Datasets

Ernest Perkowski, Rui Pan, Tuan Dung Nguyen, Yuan-Sen Ting, Sandor Kruk, Tong Zhang, Charlie O'Neill, Maja Jablonska, Zechang Sun, Michael J. Smith, Huiling Liu, Kevin Schawinski, Kartheik Iyer, Ioana Ciucă for UniverseTBD

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 4 pages, 1 figure, model is available at https://huggingface.co/universeTBD, published in RNAAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19555 2024-01-04 cs.CL cs.LG 62%

Large Language Models Are Not Strong Abstract Reasoners

Gaël Gendron, Qiming Bao, Michael Witbrock, Gillian Dobbie

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 50 pages, 14 pages for the main paper and 36 pages for the supplement, 35 figures, 17 tables. V3: performed additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17624 2024-01-01 cs.LG cs.AI 62%

XAI for In-hospital Mortality Prediction via Multimodal ICU Data

Xingqiao Li, Jindong Gu, Zhiyong Wang, Yancheng Yuan, Bo Du, Fengxiang He

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03109 2024-01-01 cs.CL cs.AI 62%

A Survey on Evaluation of Large Language Models

Yupeng Chang, Xu Wang, Jindong Wang, Yuan Wu, Linyi Yang, Kaijie Zhu, Hao Chen, Xiaoyuan Yi, Cunxiang Wang, Yidong Wang, Wei Ye, Yue Zhang, Yi Chang, Philip S. Yu, Qiang Yang, Xing Xie

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACM Transactions on Intelligent Systems and Technology (TIST); 45 pages; More recent works; https://llm-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18365 2023-12-29 cs.CL cs.AI 62%

What can Large Language Models do in chemistry? A comprehensive benchmark on eight tasks

Taicheng Guo, Kehan Guo, Bozhao Nan, Zhenwen Liang, Zhichun Guo, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2023 Datasets and Benchmarks Track camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05685 2023-12-27 cs.CL cs.AI 62%

Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13876 2023-12-22 cs.LG cs.CL stat.ML 62%

Capture the Flag: Uncovering Data Insights with Large Language Models

Issam Laradji, Perouz Taslakian, Sai Rajeswar, Valentina Zantedeschi, Alexandre Lacoste, Nicolas Chapados, David Vazquez, Christopher Pal, Alexandre Drouin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 1 figure, Foundation Models for Decision Making Workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12806 2023-12-21 cs.CL cs.AI 62%

MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models

Yan Cai, Linlin Wang, Ye Wang, Gerard de Melo, Ya Zhang, Yanfeng Wang, Liang He

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments accepted by AAAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12436 2023-12-21 cs.CV cs.AI cs.CL cs.MM 62%

A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise

Chaoyou Fu, Renrui Zhang, Zihan Wang, Yubo Huang, Zhengye Zhang, Longtian Qiu, Gaoxiang Ye, Yunhang Shen, Mengdan Zhang, Peixian Chen, Sirui Zhao, Shaohui Lin, Deqiang Jiang, Di Yin, Peng Gao, Ke Li, Hongsheng Li, Xing Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Total 120 pages. See our project at https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15685 2023-12-21 cs.CL cs.AI 62%

RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting

Lei Shu, Liangchen Luo, Jayakumar Hoskere, Yun Zhu, Yinxiao Liu, Simon Tong, Jindong Chen, Lei Meng

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Journal ref AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11345 2023-12-19 cs.CL cs.AI 62%

Implicit Affordance Acquisition via Causal Action-Effect Modeling in the Video Domain

Hsiu-Yu Yang, Carina Silberer

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at IJCNLP-AACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11138 2023-12-19 cs.AI cs.LG 62%

Rapid Open-World Adaptation by Adaptation Principles Learning

Cheng Xue, Ekaterina Nikonova, Peng Zhang, Jochen Renz

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10942 2023-12-19 cs.AI cs.LG 62%

ShuttleSHAP: A Turn-Based Feature Attribution Approach for Analyzing Forecasting Models in Badminton

Wei-Yao Wang, Wen-Chih Peng, Wei Wang, Philip S. Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07886 2023-12-14 cs.AI cs.CL 62%

Modality Plug-and-Play: Elastic Modality Adaptation in Multimodal LLMs for Embodied AI

Kai Huang, Boyuan Yang, Wei Gao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06974 2023-12-13 cs.CL cs.AI 62%

SM70: A Large Language Model for Medical Devices

Anubhav Bhatti, Surajsinh Parmar, San Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 5 Pages, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05834 2023-12-12 cs.CL cs.AI 62%

Evidence-based Interpretable Open-domain Fact-checking with Large Language Models

Xin Tan, Bowei Zou, Ai Ti Aw

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01032 2023-12-05 cs.CL cs.AI 62%

Harnessing the Power of Prompt-based Techniques for Generating School-Level Questions using Large Language Models

Subhankar Maity, Aniket Deroy, Sudeshna Sarkar

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16101 2023-11-28 cs.CV cs.CL cs.LG 62%

How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs

Haoqin Tu, Chenhang Cui, Zijun Wang, Yiyang Zhou, Bingchen Zhao, Junlin Han, Wangchunshu Zhou, Huaxiu Yao, Cihang Xie

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments H.T., C.C., and Z.W. contribute equally. Work done during H.T. and Z.W.'s internship at UCSC, and C.C. and Y.Z.'s internship at UNC

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12983 2023-11-23 cs.CL cs.AI 62%

GAIA: a benchmark for General AI Assistants

Grégoire Mialon, Clémentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun, Thomas Scialom

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12337 2023-11-22 cs.CL cs.AI 62%

Do Smaller Language Models Answer Contextualised Questions Through Memorisation Or Generalisation?

Tim Hartill, Joshua Bensemann, Michael Witbrock, Patricia J. Riddle

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏