arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2402.13109 2024-06-05 cs.CL cs.AI 62%

CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models

Yizhi LI, Ge Zhang, Xingwei Qu, Jiali Li, Zhaoqun Li, Zekun Wang, Hao Li, Ruibin Yuan, Yinghao Ma, Kai Zhang, Wangchunshu Zhou, Yiming Liang, Lei Zhang, Lei Ma, Jiajun Zhang, Zuowen Li, Stephen W. Huang, Chenghua Lin, Jie Fu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Camera-ready version for ACL 2024. Project page at https://yizhilll.github.io/CIF-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05604 2024-06-05 cs.CL cs.AI cs.CV cs.CY 62%

REBUS: A Robust Evaluation Benchmark of Understanding Symbols

Andrew Gritsevskiy, Arjun Panickssery, Aaron Kirtland, Derik Kauffman, Hans Gundlach, Irina Gritsevskaya, Joe Cavanagh, Jonathan Chiang, Lydia La Roux, Michelle Hung

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 5 figures. For code, see http://github.com/cvndsh/rebus

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11073 2024-06-04 cs.CL cs.AI 62%

AFaCTA: Assisting the Annotation of Factual Claim Detection with Reliable LLM Annotators

Jingwei Ni, Minjing Shi, Dominik Stammbach, Mrinmaya Sachan, Elliott Ash, Markus Leippold

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04518 2024-06-04 cs.CL cs.AI 62%

The Critique of Critique

Shichao Sun, Junlong Li, Weizhe Yuan, Ruifeng Yuan, Wenjie Li, Pengfei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00752 2024-06-03 cs.LG cs.AI 62%

Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Albert Gu, Tri Dao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15255 2024-06-03 cs.CL cs.LG cs.SD eess.AS 62%

Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM

Eliya Nachmani, Alon Levkovitch, Roy Hirsch, Julian Salazar, Chulayuth Asawaroengchai, Soroosh Mariooryad, Ehud Rivlin, RJ Skerry-Ryan, Michelle Tadmor Ramanovich

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments ICLR 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19335 2024-05-30 cs.CV cs.CL cs.LG 62%

X-VILA: Cross-Modality Alignment for Large Language Model

Hanrong Ye, De-An Huang, Yao Lu, Zhiding Yu, Wei Ping, Andrew Tao, Jan Kautz, Song Han, Dan Xu, Pavlo Molchanov, Hongxu Yin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09818 2024-05-27 cs.CL cs.AI 62%

SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models

Lee Hyun, Kim Sung-Bin, Seungju Han, Youngjae Yu, Tae-Hyun Oh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13432 2024-05-24 cs.CL cs.AI 62%

Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax Reduction

Tingchen Fu, Deng Cai, Lemao Liu, Shuming Shi, Rui Yan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to the findings of ACL2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13021 2024-05-24 cs.CL cs.AI cs.IR 62%

IM-RAG: Multi-Round Retrieval-Augmented Generation Through Learning Inner Monologues

Diji Yang, Jinmeng Rao, Kezhen Chen, Xiaoyuan Guo, Yawen Zhang, Jie Yang, Yi Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Proceedings of the 47th International ACM SIGIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12035 2024-05-21 cs.AI cs.CL cs.IR 62%

KG-RAG: Bridging the Gap Between Knowledge and Creativity

Diego Sanmartin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01532 2024-05-21 cs.CL cs.AI 62%

Acquiring and Modelling Abstract Commonsense Knowledge via Conceptualization

Mutian He, Tianqing Fang, Weiqi Wang, Yangqiu Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 43 pages, 11 figures; Accepted by Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10104 2024-05-20 cs.AI cs.CL 62%

GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving

Jiaxin Zhang, Zhongzhi Li, Mingliang Zhang, Fei Yin, Chenglin Liu, Yashar Moshfeghi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted in ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10542 2024-05-20 cs.CL cs.AI 62%

Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset

Jie Zhu, Junhui Li, Yalong Wen, Lifan Guo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024

Journal ref The 62nd Annual Meeting of the Association for Computational Linguistics(ACL),2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00867 2024-05-17 cs.LG cs.AI 62%

IQL-TD-MPC: Implicit Q-Learning for Hierarchical Model Predictive Control

Rohan Chitnis, Yingchen Xu, Bobak Hashemi, Lucas Lehnert, Urun Dogan, Zheqing Zhu, Olivier Delalleau

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

Journal ref Short version published at ICRA 2024 (https://tinyurl.com/icra24-iqltdmpc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07348 2024-05-15 cs.CL cs.LG 62%

MedConceptsQA: Open Source Medical Concepts QA Benchmark

Ofir Ben Shoham, Nadav Rappoport

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06694 2024-05-14 cs.CL cs.AI 62%

SUTRA: Scalable Multilingual Language Model Architecture

Abhijit Bendale, Michael Sapienza, Steven Ripplinger, Simon Gibbs, Jaewon Lee, Pranav Mistry

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06674 2024-05-14 cs.CL cs.AI 62%

Open-SQL Framework: Enhancing Text-to-SQL on Open-source Large Language Models

Xiaojun Chen, Tianle Wang, Tianhao Qiu, Jianbin Qin, Min Yang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01886 2024-05-06 cs.CL cs.AI 62%

Aloe: A Family of Fine-tuned Open Healthcare LLMs

Ashwin Kumar Gururajan, Enrique Lopez-Cuena, Jordi Bayarri-Planas, Adrian Tormos, Daniel Hinjos, Pablo Bernabeu-Perez, Anna Arias-Duart, Pablo Agustin Martin-Torres, Lucia Urcelay-Ganzabal, Marta Gonzalez-Mallo, Sergio Alvarez-Napagao, Eduard Ayguadé-Parra, Ulises Cortés Dario Garcia-Gasulla

专题命中 推理评测 :CoT(abstract);分类 cs.CL、cs.AI

Comments Five appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18978 2024-05-01 cs.LG cs.AI cs.CY 62%

Towards Generalizable Agents in Text-Based Educational Environments: A Study of Integrating RL with LLMs

Bahar Radmehr, Adish Singla, Tanja Käser

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted as a full paper at EDM 2024: The 17th International Conference on Educational Data Mining, 14-17 of July 2024, Atlanta

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18359 2024-04-30 cs.CL cs.AI 62%

FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models

Wei Li, Ren Ma, Jiang Wu, Chenya Gu, Jiahui Peng, Jinyang Len, Songyang Zhang, Hang Yan, Dahua Lin, Conghui He

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16811 2024-04-29 cs.CL cs.AI 62%

Make Your LLM Fully Utilize the Context

Shengnan An, Zexiong Ma, Zeqi Lin, Nanning Zheng, Jian-Guang Lou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 7 figures, 3 tables, 9 examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07867 2024-04-29 cs.SE cs.AI cs.LG cs.PF 62%

Learning Performance-Improving Code Edits

Alexander Shypula, Aman Madaan, Yimeng Zeng, Uri Alon, Jacob Gardner, Milad Hashemi, Graham Neubig, Parthasarathy Ranganathan, Osbert Bastani, Amir Yazdanbakhsh

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2024 (Spotlight). Project website: https://pie4perf.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02498 2024-04-26 cs.CL cs.LG 62%

Honest Students from Untrusted Teachers: Learning an Interpretable Question-Answering Pipeline from a Pretrained Language Model

Jacob Eisenstein, Daniel Andor, Bernd Bohnet, Michael Collins, David Mimno

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments added details about a human evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13104 2024-04-23 cs.CL cs.AI 62%

Multi Class Depression Detection Through Tweets using Artificial Intelligence

Muhammad Osama Nusrat, Waseem Shahzad, Saad Ahmed Jamal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13050 2024-04-23 cs.CL cs.AI 62%

FlowMind: Automatic Workflow Generation with LLMs

Zhen Zeng, William Watson, Nicole Cho, Saba Rahimi, Shayleen Reynolds, Tucker Balch, Manuela Veloso

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Published in ACM ICAIF 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15883 2024-04-22 cs.CL cs.AI 62%

HyKGE: A Hypothesis Knowledge Graph Enhanced Framework for Accurate and Reliable Medical LLMs Responses

Xinke Jiang, Ruizhe Zhang, Yongxin Xu, Rihong Qiu, Yue Fang, Zhiyuan Wang, Jinyi Tang, Hongxin Ding, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11086 2024-04-19 cs.CL cs.AI 62%

ViLLM-Eval: A Comprehensive Evaluation Suite for Vietnamese Large Language Models

Trong-Hieu Nguyen, Anh-Cuong Le, Viet-Cuong Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2305.08322 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10774 2024-04-16 cs.CL cs.AI 62%

MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning

Fuxiao Liu, Xiaoyang Wang, Wenlin Yao, Jianshu Chen, Kaiqiang Song, Sangwoo Cho, Yaser Yacoob, Dong Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14785 2024-04-12 cs.CL cs.AI 62%

Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds

Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏