arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2406.11830 2024-06-18 cs.CL cs.AI 62%

Language Modeling with Editable External Knowledge

Belinda Z. Li, Emmy Liu, Alexis Ross, Abbas Zeitoun, Graham Neubig, Jacob Andreas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10878 2024-06-18 cs.AI cs.CL 62%

Demonstration Notebook: Finding the Most Suited In-Context Learning Example from Interactions

Yiming Tang, Bin Dong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10567 2024-06-18 cs.CL cs.AI 62%

InSaAF: Incorporating Safety through Accuracy and Fairness | Are LLMs ready for the Indian Legal Domain?

Yogesh Tripathi, Raghav Donakanti, Sahil Girhepuje, Ishan Kavathekar, Bhaskara Hanuma Vedula, Gokul S Krishnan, Shreya Goyal, Anmol Goel, Balaraman Ravindran, Ponnurangam Kumaraguru

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09861 2024-06-18 cs.CL cs.AI 62%

ConceptPsy:A Benchmark Suite with Conceptual Comprehensiveness in Psychology

Junlei Zhang, Hongliang He, Nirui Song, Zhanchao Zhou, Shuyuan He, Shuai Zhang, Huachuan Qiu, Anqi Li, Yong Dai, Lizhi Ma, Zhenzhong Lan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02982 2024-06-17 cs.CL cs.AI 62%

FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models

Shu Liu, Shangqing Zhao, Chenghao Jia, Xinlin Zhuang, Zhaoguang Long, Jie Zhou, Aimin Zhou, Man Lan, Qingquan Wu, Chong Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02060 2024-06-13 cs.CL cs.AI 62%

Long-context LLMs Struggle with Long In-context Learning

Tianle Li, Ge Zhang, Quy Duc Do, Xiang Yue, Wenhu Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02726 2024-06-13 cs.CL cs.AI 62%

Large Language Models for Automated Open-domain Scientific Hypotheses Discovery

Zonglin Yang, Xinya Du, Junxian Li, Jie Zheng, Soujanya Poria, Erik Cambria

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06474 2024-06-11 cs.AI cs.CL 62%

Towards a Personal Health Large Language Model

Justin Cosentino, Anastasiya Belyaeva, Xin Liu, Nicholas A. Furlotte, Zhun Yang, Chace Lee, Erik Schenck, Yojan Patel, Jian Cui, Logan Douglas Schneider, Robby Bryant, Ryan G. Gomes, Allen Jiang, Roy Lee, Yun Liu, Javier Perez, Jameson K. Rogers, Cathy Speed, Shyam Tailor, Megan Walker, Jeffrey Yu, Tim Althoff, Conor Heneghan, John Hernandez, Mark Malhotra, Leor Stern, Yossi Matias, Greg S. Corrado, Shwetak Patel, Shravya Shetty, Jiening Zhan, Shruthi Prabhakara, Daniel McDuff, Cory Y. McLean

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12716 2024-06-11 cs.CV cs.CL cs.LG 62%

BloomVQA: Assessing Hierarchical Multi-modal Comprehension

Yunye Gong, Robik Shrestha, Jared Claypoole, Michael Cogswell, Arijit Ray, Christopher Kanan, Ajay Divakaran

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by ACL Findings (2024). Dataset available at https://huggingface.co/datasets/ygong/BloomVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05547 2024-06-11 cs.CL cs.AI 62%

Benchmarking Large Language Models on Communicative Medical Coaching: a Novel System and Dataset

Hengguan Huang, Songtao Wang, Hongfu Liu, Hao Wang, Ye Wang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03189 2024-06-10 cs.CL cs.AI 62%

The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language Models

Noah Y. Siegel, Oana-Maria Camburu, Nicolas Heess, Maria Perez-Ortiz

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments To be published in ACL 2024. 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17438 2024-06-10 cs.CL cs.AI 62%

CLOMO: Counterfactual Logical Modification with Large Language Models

Yinya Huang, Ruixin Hong, Hongming Zhang, Wei Shao, Zhicheng Yang, Dong Yu, Changshui Zhang, Xiaodan Liang, Linqi Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (ACL 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09204 2024-06-10 cs.CL cs.AI 62%

Fusion-Eval: Integrating Assistant Evaluators with LLMs

Lei Shu, Nevan Wichers, Liangchen Luo, Yun Zhu, Yinxiao Liu, Jindong Chen, Lei Meng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14116 2024-06-07 cs.CL cs.AI 62%

FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models

Andrew Zhu, Alyssa Hwang, Liam Dugan, Chris Callison-Burch

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 2 figures. ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13109 2024-06-05 cs.CL cs.AI 62%

CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models

Yizhi LI, Ge Zhang, Xingwei Qu, Jiali Li, Zhaoqun Li, Zekun Wang, Hao Li, Ruibin Yuan, Yinghao Ma, Kai Zhang, Wangchunshu Zhou, Yiming Liang, Lei Zhang, Lei Ma, Jiajun Zhang, Zuowen Li, Stephen W. Huang, Chenghua Lin, Jie Fu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Camera-ready version for ACL 2024. Project page at https://yizhilll.github.io/CIF-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05604 2024-06-05 cs.CL cs.AI cs.CV cs.CY 62%

REBUS: A Robust Evaluation Benchmark of Understanding Symbols

Andrew Gritsevskiy, Arjun Panickssery, Aaron Kirtland, Derik Kauffman, Hans Gundlach, Irina Gritsevskaya, Joe Cavanagh, Jonathan Chiang, Lydia La Roux, Michelle Hung

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 5 figures. For code, see http://github.com/cvndsh/rebus

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11073 2024-06-04 cs.CL cs.AI 62%

AFaCTA: Assisting the Annotation of Factual Claim Detection with Reliable LLM Annotators

Jingwei Ni, Minjing Shi, Dominik Stammbach, Mrinmaya Sachan, Elliott Ash, Markus Leippold

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04518 2024-06-04 cs.CL cs.AI 62%

The Critique of Critique

Shichao Sun, Junlong Li, Weizhe Yuan, Ruifeng Yuan, Wenjie Li, Pengfei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00752 2024-06-03 cs.LG cs.AI 62%

Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Albert Gu, Tri Dao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15255 2024-06-03 cs.CL cs.LG cs.SD eess.AS 62%

Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM

Eliya Nachmani, Alon Levkovitch, Roy Hirsch, Julian Salazar, Chulayuth Asawaroengchai, Soroosh Mariooryad, Ehud Rivlin, RJ Skerry-Ryan, Michelle Tadmor Ramanovich

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments ICLR 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19335 2024-05-30 cs.CV cs.CL cs.LG 62%

X-VILA: Cross-Modality Alignment for Large Language Model

Hanrong Ye, De-An Huang, Yao Lu, Zhiding Yu, Wei Ping, Andrew Tao, Jan Kautz, Song Han, Dan Xu, Pavlo Molchanov, Hongxu Yin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09818 2024-05-27 cs.CL cs.AI 62%

SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models

Lee Hyun, Kim Sung-Bin, Seungju Han, Youngjae Yu, Tae-Hyun Oh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13432 2024-05-24 cs.CL cs.AI 62%

Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax Reduction

Tingchen Fu, Deng Cai, Lemao Liu, Shuming Shi, Rui Yan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to the findings of ACL2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13021 2024-05-24 cs.CL cs.AI cs.IR 62%

IM-RAG: Multi-Round Retrieval-Augmented Generation Through Learning Inner Monologues

Diji Yang, Jinmeng Rao, Kezhen Chen, Xiaoyuan Guo, Yawen Zhang, Jie Yang, Yi Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Proceedings of the 47th International ACM SIGIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12035 2024-05-21 cs.AI cs.CL cs.IR 62%

KG-RAG: Bridging the Gap Between Knowledge and Creativity

Diego Sanmartin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01532 2024-05-21 cs.CL cs.AI 62%

Acquiring and Modelling Abstract Commonsense Knowledge via Conceptualization

Mutian He, Tianqing Fang, Weiqi Wang, Yangqiu Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 43 pages, 11 figures; Accepted by Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10104 2024-05-20 cs.AI cs.CL 62%

GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving

Jiaxin Zhang, Zhongzhi Li, Mingliang Zhang, Fei Yin, Chenglin Liu, Yashar Moshfeghi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted in ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10542 2024-05-20 cs.CL cs.AI 62%

Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset

Jie Zhu, Junhui Li, Yalong Wen, Lifan Guo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024

Journal ref The 62nd Annual Meeting of the Association for Computational Linguistics(ACL),2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00867 2024-05-17 cs.LG cs.AI 62%

IQL-TD-MPC: Implicit Q-Learning for Hierarchical Model Predictive Control

Rohan Chitnis, Yingchen Xu, Bobak Hashemi, Lucas Lehnert, Urun Dogan, Zheqing Zhu, Olivier Delalleau

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

Journal ref Short version published at ICRA 2024 (https://tinyurl.com/icra24-iqltdmpc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07348 2024-05-15 cs.CL cs.LG 62%

MedConceptsQA: Open Source Medical Concepts QA Benchmark

Ofir Ben Shoham, Nadav Rappoport

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏