arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2406.12053 2024-06-19 cs.CL 57%

InternalInspector $I^2$: Robust Confidence Estimation in LLMs through Internal States

Mohammad Beigi, Ying Shen, Runing Yang, Zihao Lin, Qifan Wang, Ankith Mohan, Jianfeng He, Ming Jin, Chang-Tien Lu, Lifu Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11651 2024-06-18 cs.CL 57%

A Two-dimensional Zero-shot Dialogue State Tracking Evaluation Method using GPT-4

Ming Gu, Yan Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11566 2024-06-18 cs.CL 57%

MEMLA: Enhancing Multilingual Knowledge Editing with Neuron-Masked Low-Rank Adaptation

Jiakuan Xie, Pengfei Cao, Yuheng Chen, Yubo Chen, Kang Liu, Jun Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09994 2024-06-17 cs.CL 57%

Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models

Manas Jhalani, Annervaz K M, Pushpak Bhattacharyya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09646 2024-06-17 cs.CV cs.AI 57%

A Survey of Video Datasets for Grounded Event Understanding

Kate Sanders, Benjamin Van Durme

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09754 2024-06-17 cs.AI 57%

EX-FEVER: A Dataset for Multi-hop Explainable Fact Verification

Huanhuan Ma, Weizhi Xu, Yifan Wei, Liuji Chen, Liang Wang, Qiang Liu, Shu Wu, Liang Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments ACL 2024 findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09397 2024-06-14 cs.CV cs.AI 57%

Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms

Miaosen Zhang, Yixuan Wei, Zhen Xing, Yifei Ma, Zuxuan Wu, Ji Li, Zheng Zhang, Qi Dai, Chong Luo, Xin Geng, Baining Guo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 28 pages, 26 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12639 2024-06-14 cs.CV cs.AI 57%

KNVQA: A Benchmark for evaluation knowledge-based VQA

Sirui Cheng, Siyu Zhang, Jiayi Wu, Muchen Lan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments There was a little error in the method section of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07444 2024-06-12 cs.CL 57%

On the Robustness of Document-Level Relation Extraction Models to Entity Name Variations

Shiao Meng, Xuming Hu, Aiwei Liu, Fukun Ma, Yawen Yang, Shuang Li, Lijie Wen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05892 2024-06-11 cs.CR cs.LG cs.SE 57%

Security Vulnerability Detection with Multitask Self-Instructed Fine-Tuning of Large Language Models

Aidan Z. H. Yang, Haoye Tian, He Ye, Ruben Martins, Claire Le Goues

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13787 2024-06-11 cs.LG 57%

RewardBench: Evaluating Reward Models for Language Modeling

Nathan Lambert, Valentina Pyatkin, Jacob Morrison, LJ Miranda, Bill Yuchen Lin, Khyathi Chandu, Nouha Dziri, Sachin Kumar, Tom Zick, Yejin Choi, Noah A. Smith, Hannaneh Hajishirzi

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 44 pages, 19 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04460 2024-06-11 cs.CL 57%

Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation Dataset

Minjin Kim, Minju Kim, Hana Kim, Beong-woo Kwak, Soyeon Chun, Hyunseo Kim, SeongKu Kang, Youngjae Yu, Jinyoung Yeo, Dongha Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published at ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11100 2024-06-11 cs.CL 57%

When LLMs Meet Cunning Texts: A Fallacy Understanding Benchmark for Large Language Models

Yinghui Li, Qingyu Zhou, Yuanzhen Luo, Shirong Ma, Yangning Li, Hai-Tao Zheng, Xuming Hu, Philip S. Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04947 2024-06-10 cs.CL 57%

BAMO at SemEval-2024 Task 9: BRAINTEASER: A Novel Task Defying Common Sense

Baktash Ansari, Mohammadmostafa Rostamkhani, Sauleh Eetemadi

专题命中 推理评测 :CoT(abstract);分类 cs.CL

Comments 9 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03248 2024-06-07 cs.IR cs.CL 57%

Large Language Models as Evaluators for Recommendation Explanations

Xiaoyu Zhang, Yishan Li, Jiayin Wang, Bowen Sun, Weizhi Ma, Peijie Sun, Min Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14008 2024-06-07 cs.CL 57%

OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems

Chaoqun He, Renjie Luo, Yuzhuo Bai, Shengding Hu, Zhen Leng Thai, Junhao Shen, Jinyi Hu, Xu Han, Yujie Huang, Yuxiang Zhang, Jie Liu, Lei Qi, Zhiyuan Liu, Maosong Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL 2024 (main), update

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03181 2024-06-06 cs.CL 57%

Missci: Reconstructing Fallacies in Misrepresented Science

Max Glockner, Yufang Hou, Preslav Nakov, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2024 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02818 2024-06-06 cs.CL 57%

Chain of Agents: Large Language Models Collaborating on Long-Context Tasks

Yusen Zhang, Ruoxi Sun, Yanfei Chen, Tomas Pfister, Rui Zhang, Sercan Ö. Arik

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11034 2024-06-05 cs.CL 57%

PAT-Questions: A Self-Updating Benchmark for Present-Anchored Temporal Question-Answering

Jannat Ara Meem, Muhammad Shihab Rashid, Yue Dong, Vagelis Hristidis

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to Findings of ACL '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00231 2024-06-04 cs.CV cs.CL 57%

Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models

Lei Li, Yuqi Wang, Runxin Xu, Peiyi Wang, Xiachong Feng, Lingpeng Kong, Qi Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Project page: https://mm-arxiv.github.io, Camera Ready Version of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18223 2024-06-04 cs.CL 57%

Improving Open-Ended Text Generation via Adaptive Decoding

Wenhong Zhu, Hongkun Hao, Zhiwei He, Yiming Ai, Rui Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00583 2024-06-04 cs.DB cs.AI 57%

CMDBench: A Benchmark for Coarse-to-fine Multimodal Data Discovery in Compound AI Systems

Yanlin Feng, Sajjadur Rahman, Aaron Feng, Vincent Chen, Eser Kandogan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Governance, Understanding and Integration of Data for Effective and Responsible AI (GUIDE-AI '24), June 14, 2024, Santiago, AA, Chile

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11052 2024-06-03 cs.CL 57%

Mining experimental data from Materials Science literature with Large Language Models: an evaluation study

Luca Foppiano, Guillaume Lambard, Toshiyuki Amagasa, Masashi Ishii

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 40 pages: 5 figures and 1 table in the body. 32 Tables in the Appendix / Supplementary materials

Journal ref Science and Technology of Advanced Materials: Methods (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15924 2024-05-31 cs.CL 57%

SLIDE: A Framework Integrating Small and Large Language Models for Open-Domain Dialogues Evaluation

Kun Zhao, Bohao Yang, Chen Tang, Chenghua Lin, Liang Zhan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18910 2024-05-30 cs.AI 57%

Predicting Parking Availability in Singapore with Cross-Domain Data: A New Dataset and A Data-Driven Approach

Huaiwu Zhang, Yutong Xia, Siru Zhong, Kun Wang, Zekun Tong, Qingsong Wen, Roger Zimmermann, Yuxuan Liang

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments Accepted by IJCAI 2024 (Multi-Year Track On AI And Social Good with ~20% acceptance rate)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18027 2024-05-29 cs.CL 57%

TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models

Jaewoo Ahn, Taehyun Lee, Junyoung Lim, Jin-Hwa Kim, Sangdoo Yun, Hwaran Lee, Gunhee Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2024 Findings. Code and dataset are released at https://ahnjaewoo.github.io/timechara

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05007 2024-05-29 cs.CL 57%

MinPrompt: Graph-based Minimal Prompt Data Augmentation for Few-shot Question Answering

Xiusi Chen, Jyun-Yu Jiang, Wei-Cheng Chang, Cho-Jui Hsieh, Hsiang-Fu Yu, Wei Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13769 2024-05-24 cs.CL 57%

Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story Evaluation

Cyril Chhun, Fabian M. Suchanek, Chloé Clavel

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments TACL, pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03548 2024-05-24 cs.CL 57%

MAmmoTH2: Scaling Instructions from the Web

Xiang Yue, Tuney Zheng, Ge Zhang, Wenhu Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15431 2024-05-24 cs.CL 57%

What Makes it Ok to Set a Fire? Iterative Self-distillation of Contexts and Rationales for Disambiguating Defeasible Social and Moral Situations

Kavel Rao, Liwei Jiang, Valentina Pyatkin, Yuling Gu, Niket Tandon, Nouha Dziri, Faeze Brahman, Yejin Choi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Camera Ready EMNLP Findings 2023. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏