arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2408.11381 2024-09-10 cs.CL 57%

RAGLAB: A Modular and Research-Oriented Unified Framework for Retrieval-Augmented Generation

Xuanwang Zhang, Yunze Song, Yidong Wang, Shuyun Tang, Xinfeng Li, Zhengran Zeng, Zhen Wu, Wei Ye, Wenyuan Xu, Yue Zhang, Xinyu Dai, Shikun Zhang, Qingsong Wen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01560 2024-09-04 cs.CV cs.AI 57%

Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models

Bin Fu, Qiyang Wan, Jialin Li, Ruiping Wang, Xilin Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 39 pages, 28 figures, 4 tables. Accepted at The 35th British Machine Vision Conference (BMVC 2024). Project page at https://fubin29.github.io/Blocks-as-Probes/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15133 2024-08-28 cs.LG 57%

Using LLMs for Explaining Sets of Counterfactual Examples to Final Users

Arturo Fredes, Jordi Vitria

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Presented as a poster in the 2nd Workshop on Causal Inference and Machine Learning in Practice at KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14717 2024-08-28 cs.DB cs.AI 57%

Text2SQL is Not Enough: Unifying AI and Databases with TAG

Asim Biswal, Liana Patel, Siddarth Jha, Amog Kamsetty, Shu Liu, Joseph E. Gonzalez, Carlos Guestrin, Matei Zaharia

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07536 2024-08-27 cs.CL 57%

A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering

Yunxin Li, Longyue Wang, Baotian Hu, Xinyu Chen, Wanqi Zhong, Chenyang Lyu, Wei Wang, Min Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 20 pages, 15 pages; technical paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03823 2024-08-23 cs.CL 57%

A Modular Approach for Multimodal Summarization of TV Shows

Louis Mahon, Mirella Lapata

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06281 2024-08-21 cs.CV cs.CL 57%

MMBench: Is Your Multi-modal Model an All-around Player?

Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, Kai Chen, Dahua Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted in ECCV2024 as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09717 2024-08-20 cs.CL 57%

SEMDR: A Semantic-Aware Dual Encoder Model for Legal Judgment Prediction with Legal Clue Tracing

Pengjie Liu, Wang Zhang, Yulong Ding, Xuefeng Zhang, Shuang-Hua Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13892 2024-08-20 cs.CL 57%

Adaptable Logical Control for Large Language Models

Honghua Zhang, Po-Nien Kung, Masahiro Yoshida, Guy Van den Broeck, Nanyun Peng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05709 2024-08-19 cs.RO cs.FL cs.LG 57%

TR2MTL: LLM based framework for Metric Temporal Logic Formalization of Traffic Rules

Kumar Manas, Stefan Zwicklbauer, Adrian Paschke

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

Comments Accepted for publication in Proceedings of the IEEE Intelligent Vehicles Symposium (IV), Jeju Island - Korea, 2-5 June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05283 2024-08-15 cs.CL 57%

MUSE: Multi-Knowledge Passing on the Edges, Boosting Knowledge Graph Completion

Pengjie Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03160 2024-08-14 cs.CV cs.AI 57%

User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance

Mrinal Verghese, Brian Chen, Hamid Eghbalzadeh, Tushar Nagarajan, Ruta Desai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03729 2024-08-13 cs.CV cs.AI 57%

TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models

Wenqi Shao, Meng Lei, Yutao Hu, Peng Gao, Kaipeng Zhang, Fanqing Meng, Peng Xu, Siyuan Huang, Hongsheng Li, Yu Qiao, Ping Luo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04983 2024-08-12 cs.CL 57%

Get Confused Cautiously: Textual Sequence Memorization Erasure with Selective Entropy Maximization

Zhaohan Zhang, Ziquan Liu, Ioannis Patras

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03630 2024-08-09 cs.CL 57%

PAGED: A Benchmark for Procedural Graphs Extraction from Documents

Weihong Du, Wenrui Liao, Hongru Liang, Wenqiang Lei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to The 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03506 2024-08-08 cs.CL 57%

1.5-Pints Technical Report: Pretraining in Days, Not Months -- Your Language Model Thrives on Quality Data

Calvin Tan, Jerome Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Technical Report for 1.5-Pints

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03246 2024-08-07 cs.CL 57%

Making Long-Context Language Models Better Multi-Hop Reasoners

Yanyang Li, Shuo Liang, Michael R. Lyu, Liwei Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2024 Main Conference Camera Ready; Dataset, model, and code are available at https://github.com/LaVi-Lab/LongContextReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17379 2024-08-07 cs.CV cs.CL 57%

MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models

Siwei Wu, Kang Zhu, Yu Bai, Yiming Liang, Yizhi Li, Haoning Wu, J. H. Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang, Wenhao Huang, Chenghua Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments VLMs, Multi-Image Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12587 2024-08-07 cs.CL 57%

ARIES: A Corpus of Scientific Paper Edits Made in Response to Peer Reviews

Mike D'Arcy, Alexis Ross, Erin Bransom, Bailey Kuehl, Jonathan Bragg, Tom Hope, Doug Downey

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2024, 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02213 2024-08-06 cs.DB cs.AI 57%

Is Large Language Model Good at Database Knob Tuning? A Comprehensive Experimental Evaluation

Yiyan Li, Haoyang Li, Zhao Pu, Jing Zhang, Xinyi Zhang, Tao Ji, Luming Sun, Cuiping Li, Hong Chen

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16732 2024-08-06 cs.SE cs.AI 57%

PyBench: Evaluating LLM Agent on various real-world coding tasks

Yaolun Zhang, Yinxu Pan, Yudong Wang, Jie Cai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21531 2024-08-01 cs.SD cs.CL cs.MM eess.AS 57%

Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation

Ziya Zhou, Yuhang Wu, Zhiyue Wu, Xinyue Zhang, Ruibin Yuan, Yinghao Ma, Lu Wang, Emmanouil Benetos, Wei Xue, Yike Guo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ISMIR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15259 2024-08-01 cs.HC cs.AI 57%

V-RECS, a Low-Cost LLM4VIS Recommender with Explanations, Captioning and Suggestions

Luca Podo, Marco Angelini, Paola Velardi

专题命中 推理评测 :CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16711 2024-07-31 cs.SE cs.CL 57%

Benchmarks as Microscopes: A Call for Model Metrology

Michael Saxon, Ari Holtzman, Peter West, William Yang Wang, Naomi Saphra

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Conference paper at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19528 2024-07-31 cs.HC cs.AI cs.CY 57%

Harnessing LLMs for Automated Video Content Analysis: An Exploratory Workflow of Short Videos on Depression

Jiaying Lizzy Liu, Yunlong Wang, Yao Lyu, Yiheng Su, Shuo Niu, Xuhai Orson Xu, Yan Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 7 pages, 2 figures, accepted by CSCW 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12840 2024-07-31 cs.CL 57%

ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic

Fajri Koto, Haonan Li, Sara Shatnawi, Jad Doughman, Abdelrahman Boda Sadallah, Aisha Alraeesi, Khalid Almubarak, Zaid Alyafeai, Neha Sengupta, Shady Shehata, Nizar Habash, Preslav Nakov, Timothy Baldwin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20053 2024-07-30 cs.LG physics.ao-ph 57%

Orca: Ocean Significant Wave Height Estimation with Spatio-temporally Aware Large Language Models

Zhe Li, Ronghui Xu, Jilin Hu, Zhong Peng, Xi Lu, Chenjuan Guo, Bin Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03602 2024-07-30 cs.CL 57%

Evaluating LLMs at Detecting Errors in LLM Responses

Ryo Kamoi, Sarkar Snigdha Sarathi Das, Renze Lou, Jihyun Janice Ahn, Yilun Zhao, Xiaoxin Lu, Nan Zhang, Yusen Zhang, Ranran Haoran Zhang, Sujeeth Reddy Vummanthala, Salika Dave, Shaobo Qin, Arman Cohan, Wenpeng Yin, Rui Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments COLM 2024, 46 pages, Benchmark and code: https://github.com/psunlpgroup/ReaLMistake

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14644 2024-07-29 cs.CL 57%

Human-Interpretable Adversarial Prompt Attack on Large Language Models with Situational Context

Nilanjana Das, Edward Raff, Manas Gaur

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18695 2024-07-29 cs.CV cs.CL 57%

Grounding Language Models for Visual Entity Recognition

Zilin Xiao, Ming Gong, Paola Cascante-Bonilla, Xingyao Zhang, Jie Wu, Vicente Ordonez

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏