arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2403.15715 2024-03-26 cs.CL 57%

EDDA: A Encoder-Decoder Data Augmentation Framework for Zero-Shot Stance Detection

Daijun Ding, Li Dong, Zhichao Huang, Guangning Xu, Xu Huang, Bo Liu, Liwen Jing, Bowen Zhang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14566 2024-03-26 cs.CV cs.CL 57%

HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models

Tianrui Guan, Fuxiao Liu, Xiyang Wu, Ruiqi Xian, Zongxia Li, Xiaoyu Liu, Xijun Wang, Lichang Chen, Furong Huang, Yaser Yacoob, Dinesh Manocha, Tianyi Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05113 2024-03-21 cs.CL 57%

Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models

Zhouhong Gu, Lin Zhang, Jiangjie Chen, Haoning Ye, Xiaoxuan Zhu, Zihan Li, Zheyu Ye, Yan Gao, Yao Hu, Yanghua Xiao, Hongwei Feng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12881 2024-03-20 cs.CL 57%

Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models

Zehui Chen, Kuikun Liu, Qiuchen Wang, Wenwei Zhang, Jiangning Liu, Dahua Lin, Kai Chen, Feng Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12862 2024-03-20 cs.CL 57%

Epistemology of Language Models: Do Language Models Have Holistic Knowledge?

Minsu Kim, James Thorne

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12316 2024-03-20 cs.CL 57%

OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety

Chuang Liu, Linhao Yu, Jiaxuan Li, Renren Jin, Yufei Huang, Ling Shi, Junhui Zhang, Xinmeng Ji, Tingting Cui, Tao Liu, Jinwang Song, Hongying Zan, Sun Li, Deyi Xiong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11129 2024-03-19 cs.CL 57%

Enhancing Event Causality Identification with Rationale and Structure-Aware Causal Question Answering

Baiyan Zhang, Qin Chen, Jie Zhou, Jian Jin, Liang He

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13063 2024-03-19 cs.CL 57%

Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs

Miao Xiong, Zhiyuan Hu, Xinyang Lu, Yifei Li, Jie Fu, Junxian He, Bryan Hooi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments The paper is accepted by ICLR 2024. The code is publicly available at https://github.com/MiaoXiong2320/llm-uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10378 2024-03-18 cs.CL cs.CV 57%

EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models

Rocktim Jyoti Das, Simeon Emilov Hristov, Haonan Li, Dimitar Iliyanov Dimitrov, Ivan Koychev, Preslav Nakov

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01980 2024-03-15 cs.CL 57%

SOCIALITE-LLAMA: An Instruction-Tuned Model for Social Scientific Tasks

Gourab Dey, Adithya V Ganesan, Yash Kumar Lal, Manal Shah, Shreyashee Sinha, Matthew Matero, Salvatore Giorgi, Vivek Kulkarni, H. Andrew Schwartz

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Short paper accepted to EACL 2024. 4 pgs, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09164 2024-03-15 cs.CL stat.AP 57%

Exploring the Comprehension of ChatGPT in Traditional Chinese Medicine Knowledge

Li Yizhen, Huang Shaohan, Qi Jiaxing, Quan Lei, Han Dongran, Luan Zhongzhi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08299 2024-03-14 cs.SE cs.AI 57%

AutoDev: Automated AI-Driven Development

Michele Tufano, Anisha Agarwal, Jinu Jang, Roshanak Zilouchian Moghaddam, Neel Sundaresan

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06574 2024-03-12 cs.CL 57%

AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models

Yuting Wei, Yuanxing Xu, Xinru Wei, Simin Yang, Yangfu Zhu, Yuqing Li, Di Liu, Bin Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06282 2024-03-12 cs.LG cs.CV cs.IR 57%

MuseChat: A Conversational Music Recommendation System for Videos

Zhikang Dong, Bin Chen, Xiulong Liu, Pawel Polak, Peng Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15272 2024-03-12 cs.AI cs.SE 57%

AutoDroid: LLM-powered Task Automation in Android

Hao Wen, Yuanchun Li, Guohong Liu, Shanhui Zhao, Tao Yu, Toby Jia-Jun Li, Shiqi Jiang, Yunhao Liu, Yaqin Zhang, Yunxin Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Published in MobiCom 2024; Original title: "Empowering LLM to use Smartphone for Intelligent Task Automation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00849 2024-03-11 cs.CL cs.CV 57%

RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback

Tianyu Yu, Yuan Yao, Haoye Zhang, Taiwen He, Yifeng Han, Ganqu Cui, Jinyi Hu, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun, Tat-Seng Chua

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04642 2024-03-08 cs.LG 57%

Teaching Large Language Models to Reason with Reinforcement Learning

Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis, Jane Dwivedi-Yu, Maksym Zhuravinskyi, Eric Hambro, Sainbayar Sukhbaatar, Roberta Raileanu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02698 2024-03-06 cs.CL 57%

Causal Walk: Debiasing Multi-Hop Fact Verification with Front-Door Adjustment

Congzhi Zhang, Linhai Zhang, Deyu Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14818 2024-03-06 cs.CL cs.CV 57%

PALO: A Polyglot Large Multimodal Model for 5B People

Muhammad Maaz, Hanoona Rasheed, Abdelrahman Shaker, Salman Khan, Hisham Cholakal, Rao M. Anwer, Tim Baldwin, Michael Felsberg, Fahad S. Khan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Technical Report of PALO

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01972 2024-03-05 cs.CL 57%

Multi-perspective Improvement of Knowledge Graph Completion with Large Language Models

Derong Xu, Ziheng Zhang, Zhenxi Lin, Xian Wu, Zhihong Zhu, Tong Xu, Xiangyu Zhao, Yefeng Zheng, Enhong Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00103 2024-03-05 cs.AI cs.HC 57%

Towards Human Cognition Level-based Experiment Design for Counterfactual Explanations (XAI)

Muhammad Suffian, Muhammad Yaseen Khan, Alessandro Bogliolo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19173 2024-03-01 cs.SE cs.AI 57%

StarCoder 2 and The Stack v2: The Next Generation

Anton Lozhkov, Raymond Li, Loubna Ben Allal, Federico Cassano, Joel Lamy-Poirier, Nouamane Tazi, Ao Tang, Dmytro Pykhtar, Jiawei Liu, Yuxiang Wei, Tianyang Liu, Max Tian, Denis Kocetkov, Arthur Zucker, Younes Belkada, Zijian Wang, Qian Liu, Dmitry Abulkhanov, Indraneil Paul, Zhuang Li, Wen-Ding Li, Megan Risdal, Jia Li, Jian Zhu, Terry Yue Zhuo, Evgenii Zheltonozhskii, Nii Osae Osae Dade, Wenhao Yu, Lucas Krauß, Naman Jain, Yixuan Su, Xuanli He, Manan Dey, Edoardo Abati, Yekun Chai, Niklas Muennighoff, Xiangru Tang, Muhtasham Oblokulov, Christopher Akiki, Marc Marone, Chenghao Mou, Mayank Mishra, Alex Gu, Binyuan Hui, Tri Dao, Armel Zebaze, Olivier Dehaene, Nicolas Patry, Canwen Xu, Julian McAuley, Han Hu, Torsten Scholak, Sebastien Paquet, Jennifer Robinson, Carolyn Jane Anderson, Nicolas Chapados, Mostofa Patwary, Nima Tajbakhsh, Yacine Jernite, Carlos Muñoz Ferrandis, Lingming Zhang, Sean Hughes, Thomas Wolf, Arjun Guha, Leandro von Werra, Harm de Vries

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19052 2024-03-01 cs.CL cs.HC 57%

Exploring the Efficacy of Large Language Models in Summarizing Mental Health Counseling Sessions: A Benchmark Study

Prottay Kumar Adhikary, Aseem Srivastava, Shivani Kumar, Salam Michael Singh, Puneet Manuja, Jini K Gopinath, Vijay Krishnan, Swati Kedia, Koushik Sinha Deb, Tanmoy Chakraborty

专题命中 推理评测 :planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15818 2024-02-27 cs.CL 57%

Linguistic Intelligence in Large Language Models for Telecommunications

Tasnim Ahmed, Nicola Piovesan, Antonio De Domenico, Salimur Choudhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13718 2024-02-27 cs.CL 57%

$\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens

Xinrong Zhang, Yingfa Chen, Shengding Hu, Zihang Xu, Junhao Chen, Moo Khai Hao, Xu Han, Zhen Leng Thai, Shuo Wang, Zhiyuan Liu, Maosong Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref 2023.12.15ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14293 2024-02-23 cs.CL 57%

Leveraging Large Language Models for Concept Graph Recovery and Question Answering in NLP Education

Rui Yang, Boming Yang, Sixun Ouyang, Tianwei She, Aosong Feng, Yuang Jiang, Freddy Lecue, Jinghui Lu, Irene Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14272 2024-02-23 cs.CL 57%

Qsnail: A Questionnaire Dataset for Sequential Question Generation

Yan Lei, Liang Pang, Yuanzhuo Wang, Huawei Shen, Xueqi Cheng

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted to the LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14258 2024-02-23 cs.CL 57%

Eagle: Ethical Dataset Given from Real Interactions

Masahiro Kaneko, Danushka Bollegala, Timothy Baldwin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13372 2024-02-23 cs.CL 57%

EvoGrad: A Dynamic Take on the Winograd Schema Challenge with Human Adversaries

Jing Han Sun, Ali Emami

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted for publication in main proceedings of LREC-COLING 2024, 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13584 2024-02-22 cs.CL 57%

WinoViz: Probing Visual Properties of Objects Under Different States

Woojeong Jin, Tejas Srinivasan, Jesse Thomason, Xiang Ren

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏