arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2404.11835 2024-05-21 cs.AI 57%

CAUS: A Dataset for Question Generation based on Human Cognition Leveraging Large Language Models

Minjung Shin, Donghyun Kim, Jeh-Kwang Ryu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 4 figures and 3 tables. This work has been accepted for presentation as a poster with full paper publication at CogSci 2024. This is the final submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05390 2024-05-21 cs.CL 57%

COKE: A Cognitive Knowledge Graph for Machine Theory of Mind

Jincenzi Wu, Zhuang Chen, Jiawen Deng, Sahand Sabour, Helen Meng, Minlie Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10251 2024-05-17 cs.CL 57%

A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks

Xuanfan Ni, Piji Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments CCL2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10166 2024-05-17 cs.CL cs.PF 57%

LFED: A Literary Fiction Evaluation Dataset for Large Language Models

Linhao Yu, Qun Liu, Deyi Xiong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18426 2024-05-13 cs.CL 57%

TriviaHG: A Dataset for Automatic Hint Generation from Factoid Questions

Jamshid Mozafari, Anubhav Jangra, Adam Jatowt

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at SIGIR 2024

Journal ref Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04170 2024-05-08 cs.CL 57%

D-NLP at SemEval-2024 Task 2: Evaluating Clinical Inference Capabilities of Large Language Models

Duygu Altinok

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments accepted to SemEval-2024, ranked 9th on Task 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00186 2024-05-07 cs.CL 57%

How far is Language Model from 100% Few-shot Named Entity Recognition in Medical Domain

Mingchen Li, Rui Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published as a journal paper at Journal of the American Medical Informatics Association (JAMIA). arXiv admin note: text overlap with arXiv:2305.18624

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00321 2024-05-02 cs.CL 57%

DFKI-NLP at SemEval-2024 Task 2: Towards Robust LLMs Using Data Perturbations and MinMax Training

Bhuvanesh Verma, Lisa Raithel

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10753 2024-05-02 cs.LG 57%

DTAAD: Dual Tcn-Attention Networks for Anomaly Detection in Multivariate Time Series Data

Lingrui Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Journal ref Knowledge-Based Systems. 295 (2024) 111849

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18766 2024-04-30 cs.AI 57%

PECC: Problem Extraction and Coding Challenges

Patrick Haller, Jonas Golde, Alan Akbik

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments This paper got accepted at LREC-COLING 2024 (long)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16670 2024-04-26 cs.CV cs.AI 57%

EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning

Hongxia Xie, Chu-Jun Peng, Yu-Wen Tseng, Hung-Jen Chen, Chan-Feng Hsu, Hong-Han Shuai, Wen-Huang Cheng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15845 2024-04-25 cs.CL 57%

Exploring LLM Prompting Strategies for Joint Essay Scoring and Feedback Generation

Maja Stahl, Leon Biermann, Andreas Nehring, Henning Wachsmuth

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted to BEA Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13340 2024-04-23 cs.SE cs.AI 57%

Large Language Models as Test Case Generators: Performance Evaluation and Enhancement

Kefan Li, Yuan Yuan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10429 2024-04-17 cs.AI 57%

MEEL: Multi-Modal Event Evolution Learning

Zhengwei Tao, Zhi Jin, Junqiang Huang, Xiancai Chen, Xiaoying Bai, Haiyan Zhao, Yifan Zhang, Chongyang Tao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09206 2024-04-16 cs.CL 57%

DKE-Research at SemEval-2024 Task 2: Incorporating Data Augmentation with Generative Models and Biomedical Knowledge to Enhance Inference Robustness

Yuqi Wang, Zeqiang Wang, Wei Wang, Qi Chen, Kaizhu Huang, Anh Nguyen, Suparna De

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14361 2024-04-16 cs.LG 57%

OpenTab: Advancing Large Language Models as Open-domain Table Reasoners

Kezhi Kong, Jiani Zhang, Zhengyuan Shen, Balasubramaniam Srinivasan, Chuan Lei, Christos Faloutsos, Huzefa Rangwala, George Karypis

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06645 2024-04-11 cs.RO cs.AI 57%

GenCHiP: Generating Robot Policy Code for High-Precision and Contact-Rich Manipulation Tasks

Kaylee Burns, Ajinkya Jain, Keegan Go, Fei Xia, Michael Stark, Stefan Schaal, Karol Hausman

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05719 2024-04-09 cs.CV cs.CL cs.HC 57%

Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs

Keen You, Haotian Zhang, Eldon Schoop, Floris Weers, Amanda Swearngin, Jeffrey Nichols, Yinfei Yang, Zhe Gan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07118 2024-04-09 cs.CL 57%

Narrating Causal Graphs with Large Language Models

Atharva Phatak, Vijay K. Mago, Ameeta Agrawal, Aravind Inbasekaran, Philippe J. Giabbanelli

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments HICSS '24

Journal ref Proceedings of the 57th Hawaii International Conference on System Sciences 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15147 2024-04-09 cs.CL 57%

S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models

Fangyu Lei, Qian Liu, Yiming Huang, Shizhu He, Jun Zhao, Kang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03977 2024-04-08 cs.CL 57%

SEME at SemEval-2024 Task 2: Comparing Masked and Generative Language Models on Natural Language Inference for Clinical Trials

Mathilde Aguiar, Pierre Zweigenbaum, Nona Naderi

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13793 2024-04-08 cs.LG 57%

Evaluating Frontier Models for Dangerous Capabilities

Mary Phuong, Matthew Aitchison, Elliot Catt, Sarah Cogan, Alexandre Kaskasoli, Victoria Krakovna, David Lindner, Matthew Rahtz, Yannis Assael, Sarah Hodkinson, Heidi Howard, Tom Lieberum, Ramana Kumar, Maria Abi Raad, Albert Webson, Lewis Ho, Sharon Lin, Sebastian Farquhar, Marcus Hutter, Gregoire Deletang, Anian Ruoss, Seliem El-Sayed, Sasha Brown, Anca Dragan, Rohin Shah, Allan Dafoe, Toby Shevlane

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16854 2024-04-08 cs.CL 57%

AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators

Xingwei He, Zhenghao Lin, Yeyun Gong, A-Long Jin, Hang Zhang, Chen Lin, Jian Jiao, Siu Ming Yiu, Nan Duan, Weizhu Chen

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01667 2024-04-03 cs.CL 57%

METAL: Towards Multilingual Meta-Evaluation

Rishav Hada, Varun Gumma, Mohamed Ahmed, Kalika Bali, Sunayana Sitaram

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to NAACL 2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03663 2024-04-03 cs.CL 57%

Principles from Clinical Research for NLP Model Generalization

Aparna Elangovan, Jiayuan He, Yuan Li, Karin Verspoor

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16583 2024-04-03 cs.CL 57%

GPT-Fathom: Benchmarking Large Language Models to Decipher the Evolutionary Path towards GPT-4 and Beyond

Shen Zheng, Yuyu Zhang, Yijie Zhu, Chenguang Xi, Pengyang Gao, Xun Zhou, Kevin Chen-Chuan Chang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00361 2024-04-02 cs.CL 57%

Controllable and Diverse Data Augmentation with Large Language Model for Low-Resource Open-Domain Dialogue Generation

Zhenhua Liu, Tong Zhu, Jianxiang Xiang, Wenliang Chen

专题命中 推理评测 :planning(abstract);分类 cs.CL

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16211 2024-04-02 cs.CV cs.AI 57%

VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models

Zihao Zhu, Mingda Zhang, Shaokui Wei, Bingzhe Wu, Baoyuan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08591 2024-04-02 cs.CL 57%

Are Multilingual LLMs Culturally-Diverse Reasoners? An Investigation into Multicultural Proverbs and Sayings

Chen Cecilia Liu, Fajri Koto, Timothy Baldwin, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19046 2024-03-29 cs.CV cs.AI 57%

LITA: Language Instructed Temporal-Localization Assistant

De-An Huang, Shijia Liao, Subhashree Radhakrishnan, Hongxu Yin, Pavlo Molchanov, Zhiding Yu, Jan Kautz

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏