arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2402.12782 2024-02-21 cs.SE cs.AI 57%

Advancing GenAI Assisted Programming--A Comparative Study on Prompt Efficiency and Code Quality Between GPT-4 and GLM-4

Angus Yang, Zehan Li, Jie Li

专题命中 推理评测 :CoT(abstract);分类 cs.AI

Comments 18 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12023 2024-02-20 cs.CR cs.AI 57%

Evaluation of ChatGPT's Smart Contract Auditing Capabilities Based on Chain of Thought

Yuying Du, Xueyan Tang

专题命中 推理评测 :CoT(abstract);分类 cs.AI

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11845 2024-02-20 cs.CL cs.CV 57%

Modularized Networks for Few-shot Hateful Meme Detection

Rui Cao, Roy Ka-Wei Lee, Jing Jiang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments camera-ready for WWW, 2024, Web4Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05983 2024-02-20 cs.CV cs.AI 57%

Accountable Textual-Visual Chat Learns to Reject Human Instructions in Image Re-creation

Zhiwei Zhang, Yuliang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments TMLR, Survey Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16132 2024-02-19 cs.CL 57%

RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models

Tianhao Shen, Sun Li, Quan Tu, Deyi Xiong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Our dataset is available at https://github.com/Magnetic2014/RoleEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04636 2024-02-08 cs.CL 57%

TransLLaMa: LLM-based Simultaneous Translation System

Roman Koshkin, Katsuhito Sudoh, Satoshi Nakamura

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01656 2024-02-06 cs.CY cs.AI 57%

Promises and pitfalls of artificial intelligence for legal applications

Sayash Kapoor, Peter Henderson, Arvind Narayanan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17107 2024-02-06 cs.CV cs.CL 57%

LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding

Yanzhe Zhang, Ruiyi Zhang, Jiuxiang Gu, Yufan Zhou, Nedim Lipka, Diyi Yang, Tong Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15328 2024-01-31 cs.CL 57%

Equipping Language Models with Tool Use Capability for Tabular Data Analysis in Finance

Adrian Theuma, Ehsan Shareghi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EACL2024; code, model and dataset are available at https://raven-lm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15927 2024-01-30 cs.CL 57%

E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models

Jinchang Hou, Chang Ao, Haihong Wu, Xiangtao Kong, Zhigang Zheng, Daijia Tang, Chengming Li, Xiping Hu, Ruifeng Xu, Shiwen Ni, Min Yang

专题命中 推理评测 :CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15810 2024-01-30 cs.SE cs.AI 57%

Green Runner: A tool for efficient deep learning component selection

Jai Kannan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15471 2024-01-30 cs.CL 57%

ConvoSense: Overcoming Monotonous Commonsense Inferences for Conversational AI

Sarah E. Finch, Jinho D. Choi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments accepted to TACL 2024; final author's version of paper; pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15391 2024-01-30 cs.CL 57%

MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries

Yixuan Tang, Yi Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Link: https://github.com/yixuantt/MultiHop-RAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14385 2024-01-30 cs.CL 57%

Mental-LLM: Leveraging Large Language Models for Mental Health Prediction via Online Text Data

Xuhai Xu, Bingsheng Yao, Yuanzhe Dong, Saadia Gabriel, Hong Yu, James Hendler, Marzyeh Ghassemi, Anind K. Dey, Dakuo Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published at Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies (IMWUT) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14827 2024-01-29 cs.CL 57%

ChatGPT Evaluation on Sentence Level Relations: A Focus on Temporal, Causal, and Discourse Relations

Chunkit Chan, Jiayang Cheng, Weiqi Wang, Yuxin Jiang, Tianqing Fang, Xin Liu, Yangqiu Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to Findings of EACL2024 "Exploring the Potential of ChatGPT on Sentence Level Relations: A Focus on Temporal, Causal, and Discourse Relations"

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11814 2024-01-23 cs.CV cs.AI 57%

Symbrain: A large-scale dataset of MRI images for neonatal brain symmetry analysis

Arnaud Gucciardi, Safouane El Ghazouali, Francesca Venturini, Vida Groznik, Umberto Michelucci

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 7 pages, 2 figures, Dataset Paper, Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10995 2024-01-23 cs.CL physics.med-ph 57%

The Radiation Oncology NLP Database

Zhengliang Liu, Jason Holmes, Wenxiong Liao, Chenbin Liu, Lian Zhang, Hongying Feng, Peilong Wang, Muhammad Ali Elahi, Hongmin Cai, Lichao Sun, Quanzheng Li, Xiang Li, Tianming Liu, Jiajian Shen, Wei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00772 2024-01-22 cs.AI cs.HC cs.RO 57%

SAGE: Smart home Agent with Grounded Execution

Dmitriy Rivkin, Francois Hogan, Amal Feriani, Abhisek Konar, Adam Sigal, Steve Liu, Greg Dudek

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08695 2024-01-18 cs.AI cs.CV cs.HC 57%

Enabling Collaborative Clinical Diagnosis of Infectious Keratitis by Integrating Expert Knowledge and Interpretable Data-driven Intelligence

Zhengqing Fang, Shuowen Zhou, Zhouhang Yuan, Yuxuan Si, Mengze Li, Jinxu Li, Yesheng Xu, Wenjia Xie, Kun Kuang, Yingming Li, Fei Wu, Yu-Feng Yao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15316 2024-01-18 cs.CL eess.AS 57%

Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue

Guan-Ting Lin, Prashanth Gurunath Shivakumar, Ankur Gandhe, Chao-Han Huck Yang, Yile Gu, Shalini Ghosh, Andreas Stolcke, Hung-yi Lee, Ivan Bulyko

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ICASSP 2024. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07098 2024-01-17 cs.CL 57%

A Novel Multi-Stage Prompting Approach for Language Agnostic MCQ Generation using GPT

Subhankar Maity, Aniket Deroy, Sudeshna Sarkar

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted at ECIR 2024(short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07078 2024-01-17 cs.CL 57%

PUB: A Pragmatics Understanding Benchmark for Assessing LLMs' Pragmatics Capabilities

Settaluri Lakshmi Sravanthi, Meet Doshi, Tankala Pavan Kalyan, Rudra Murthy, Pushpak Bhattacharyya, Raj Dabre

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04872 2024-01-11 cs.CV cs.LG cs.RO 57%

Knowledge-aware Graph Transformer for Pedestrian Trajectory Prediction

Yu Liu, Yuexin Zhang, Kunming Li, Yongliang Qiao, Stewart Worrall, You-Fu Li, He Kong

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments This paper was accepted to and presented at the 26th IEEE International Conference on Intelligent Transportation Systems (ITSC), September 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03401 2024-01-09 cs.CL 57%

Empirical Study of Large Language Models as Automated Essay Scoring Tools in English Composition__Taking TOEFL Independent Writing Task for Example

Wei Xia, Shaoguang Mao, Chanjing Zheng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09785 2024-01-09 cs.CL 57%

RJUA-QA: A Comprehensive QA Dataset for Urology

Shiwei Lyu, Chenfei Chi, Hongbo Cai, Lei Shi, Xiaoyan Yang, Lei Liu, Xiang Chen, Deng Zhao, Zhiqiang Zhang, Xianguo Lyu, Ming Zhang, Fangzhou Li, Xiaowei Ma, Yue Shen, Jinjie Gu, Wei Xue, Yiran Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments An initial version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02187 2024-01-05 cs.CL 57%

Location Aware Modular Biencoder for Tourism Question Answering

Haonan Li, Martin Tomko, Timothy Baldwin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at AACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06355 2024-01-05 cs.CV cs.CL 57%

VideoChat: Chat-Centric Video Understanding

KunChang Li, Yinan He, Yi Wang, Yizhuo Li, Wenhai Wang, Ping Luo, Yali Wang, Limin Wang, Yu Qiao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00388 2024-01-02 cs.CL 57%

FusionMind -- Improving question and answering with external context fusion

Shreyas Verma, Manoj Parmar, Palash Choudhary, Sanchita Porwal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 5 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08298 2024-01-02 cs.CL 57%

Symbol tuning improves in-context learning in language models

Jerry Wei, Le Hou, Andrew Lampinen, Xiangning Chen, Da Huang, Yi Tay, Xinyun Chen, Yifeng Lu, Denny Zhou, Tengyu Ma, Quoc V. Le

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15838 2023-12-27 cs.CL cs.CR 57%

SecQA: A Concise Question-Answering Dataset for Evaluating Large Language Models in Computer Security

Zefang Liu

专题命中 推理评测 :planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏