arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2410.04838 2024-10-28 cs.CL 70%

Rationale-Aware Answer Verification by Pairwise Self-Evaluation

Akira Kawabata, Saku Sugawara

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15050 2024-10-22 cs.CL 70%

Are LLMs Good Zero-Shot Fallacy Classifiers?

Fengjun Pan, Xiaobao Wu, Zongrui Li, Anh Tuan Luu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted to EMNLP2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15518 2024-10-22 cs.CL 70%

Beware of Words: Evaluating the Lexical Diversity of Conversational LLMs using ChatGPT as Case Study

Gonzalo Martínez, José Alberto Hernández, Javier Conde, Pedro Reviriego, Elena Merino

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Journal ref ACM Transactions on Intelligent Systems and Technology, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12675 2024-10-18 cs.CL 70%

Pragmatic Competence Evaluation of Large Language Models for the Korean Language

Dojun Park, Jiwoo Lee, Hyeyun Jeong, Seohyun Park, Sungeun Lee

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 38th Pacific Asia Conference on Language, Information and Computation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07461 2024-10-11 cs.CL 70%

Is C4 Dataset Optimal for Pruning? An Investigation of Calibration Data for LLM Pruning

Abhinav Bandari, Lu Yin, Cheng-Yu Hsieh, Ajay Kumar Jaiswal, Tianlong Chen, Li Shen, Ranjay Krishna, Shiwei Liu

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12402 2024-10-04 cs.CL 70%

TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkish

Arda Yüksel, Abdullatif Köksal, Lütfi Kerem Şenel, Anna Korhonen, Hinrich Schütze

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments EMNLP 2024 - Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01314 2024-10-02 cs.CL 70%

NLEBench+NorGLM: A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in Norwegian

Peng Liu, Lemei Zhang, Terje Farup, Even W. Lauvrak, Jon Espen Ingvaldsen, Simen Eide, Jon Atle Gulla, Zhirong Yang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted at EMNLP 2024 Main Conference. Code available at https://github.com/Smartmedia-AI/NorGLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16418 2024-09-26 cs.SE cs.AI 70%

Task-oriented Prompt Enhancement via Script Generation

Chung-Yu Wang, Alireza DaghighFarsoodeh, Hung Viet Pham

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments 17 pages + reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13711 2024-09-26 cs.IR cs.AI 70%

WebQuest: A Benchmark for Multimodal QA on Web Page Sequences

Maria Wang, Srinivas Sunkara, Gilles Baechler, Jason Lin, Yun Zhu, Fedir Zubach, Lei Shu, Jindong Chen

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12979 2024-09-23 cs.HC cs.AI 70%

Can we only use guideline instead of shot in prompt?

Jiaxiang Chen, Song Wang, Zhucong Li, Wayne Xiong, Lizhen Qu, Zenglin Xu, Yuan Qi

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10883 2024-09-18 cs.CL 70%

CREAM: Comparison-Based Reference-Free ELO-Ranked Automatic Evaluation for Meeting Summarization

Ziwei Gong, Lin Ai, Harshsaiprasad Deshpande, Alexander Johnson, Emmy Phung, Zehui Wu, Ahmad Emami, Julia Hirschberg

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08264 2024-09-17 cs.AI 70%

Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale

Rogerio Bonatti, Dan Zhao, Francesco Bonacci, Dillon Dupont, Sara Abdali, Yinheng Li, Yadong Lu, Justin Wagle, Kazuhito Koishida, Arthur Bucker, Lawrence Jang, Zack Hui

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06351 2024-09-11 cs.AI 70%

MAGDA: Multi-agent guideline-driven diagnostic assistance

David Bani-Harouni, Nassir Navab, Matthias Keicher

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05365 2024-08-13 cs.AI 70%

ElecBench: a Power Dispatch Evaluation Benchmark for Large Language Models

Xiyuan Zhou, Huan Zhao, Yuheng Cheng, Yuji Cao, Gaoqi Liang, Guolong Liu, Wenxuan Liu, Yan Xu, Junhua Zhao

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15952 2024-08-12 cs.CV cs.CL 70%

IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models

Haz Sameen Shahgir, Khondker Salman Sayeed, Abhik Bhattacharjee, Wasi Uddin Ahmad, Yue Dong, Rifat Shahriyar

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01118 2024-08-05 cs.CL 70%

IAI Group at CheckThat! 2024: Transformer Models and Data Augmentation for Checkworthy Claim Detection

Peter Røysland Aarnes, Vinay Setty, Petra Galuščáková

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted to CLEF2024 CheckThat!

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05003 2024-07-17 cs.CL 70%

Revisiting Relation Extraction in the era of Large Language Models

Somin Wadhwa, Silvio Amir, Byron C. Wallace

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10795 2024-07-16 cs.CL 70%

Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping

Wenhao Zhu, Sizhe Liu, Shujian Huang, Shuaijie She, Chris Wendler, Jiajun Chen

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09548 2024-07-16 cs.CV cs.AI 70%

Towards Temporal Change Explanations from Bi-Temporal Satellite Images

Ryo Tsujimoto, Hiroki Ouchi, Hidetaka Kamigaito, Taro Watanabe

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08922 2024-07-15 cs.LG 70%

Leveraging large language models for nano synthesis mechanism explanation: solid foundations or mere conjectures?

Yingming Pu, Liping Huang, Tao Lin, Hongyu Chen

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14877 2024-06-24 cs.CL 70%

Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video

Zhengbang Yang, Haotian Xia, Jingxi Li, Zezhi Chen, Zhuangdi Zhu, Weining Shen

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12386 2024-06-19 cs.CL 70%

IPEval: A Bilingual Intellectual Property Agency Consultation Evaluation Benchmark for Large Language Models

Qiyao Wang, Jianguo Huang, Shule Lu, Yuan Lin, Kan Xu, Liang Yang, Hongfei Lin

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11865 2024-06-19 cs.AI 70%

Large Language Models Play StarCraft II: Benchmarks and A Chain of Summarization Approach

Weiyu Ma, Qirui Mi, Yongcheng Zeng, Xue Yan, Yuqiao Wu, Runji Lin, Haifeng Zhang, Jun Wang

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04687 2024-06-10 cs.LG cs.CV 70%

LogiCode: an LLM-Driven Framework for Logical Anomaly Detection

Yiheng Zhang, Yunkang Cao, Xiaohao Xu, Weiming Shen

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00936 2024-06-04 cs.CL 70%

A Survey of Useful LLM Evaluation

Ji-Lun Peng, Sijia Cheng, Egil Diau, Yung-Yu Shih, Po-Heng Chen, Yen-Ting Lin, Yun-Nung Chen

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12063 2024-06-04 cs.CL 70%

CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models

Tong Zhang, Peixin Qin, Yang Deng, Chen Huang, Wenqiang Lei, Junhong Liu, Dingnan Jin, Hongru Liang, Tat-Seng Chua

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to ACL 2024. Camera Ready. Our dataset is available at https://github.com/zt991211/CLAMBER

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12461 2024-05-22 cs.CV cs.AI 70%

WorldAfford: Affordance Grounding based on Natural Language Instructions

Changmao Chen, Yuren Cong, Zhen Kan

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11841 2024-05-21 cs.AI 70%

Evaluating and Modeling Social Intelligence: A Comparative Study of Human and AI Capabilities

Junqi Wang, Chunhui Zhang, Jiapeng Li, Yuxi Ma, Lixing Niu, Jiaheng Han, Yujia Peng, Yixin Zhu, Lifeng Fan

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Also published in Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19063 2024-05-01 cs.CL 70%

SuperCLUE-Fin: Graded Fine-Grained Analysis of Chinese LLMs on Diverse Financial Tasks and Applications

Liang Xu, Lei Zhu, Yaotong Wu, Hang Xue

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments 11 pages, 19 figures, and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11757 2024-04-19 cs.CL 70%

Language Models Still Struggle to Zero-shot Reason about Time Series

Mike A. Merrill, Mingtian Tan, Vinayak Gupta, Tom Hartvigsen, Tim Althoff

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏