arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2312.07488 2023-12-22 cs.CV cs.AI cs.RO 57%

LMDrive: Closed-Loop End-to-End Driving with Large Language Models

Hao Shao, Yuxuan Hu, Letian Wang, Steven L. Waslander, Yu Liu, Hongsheng Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments project page: https://hao-shao.com/projects/lmdrive.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12853 2023-12-21 cs.CL 57%

CORECODE: A Common Sense Annotated Dialogue Dataset with Benchmark Tasks for Chinese Large Language Models

Dan Shi, Chaobin You, Jiantao Huang, Taihao Li, Deyi Xiong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07879 2023-12-21 cs.CV cs.AI 57%

CoIE: Chain-of-Instruct Editing for Multi-Attribute Face Manipulation

Zhenduo Zhang, Bo-Wen Zhang, Guang Liu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11467 2023-12-20 eess.IV cs.CV cs.LG 57%

Glioblastoma Tumor Segmentation using an Ensemble of Vision Transformers

Huafeng Liu, Benjamin Dowdell, Todd Engelder, Zarah Pulmano, Nicolas Osa, Arko Barman

专题命中 推理评测 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07819 2023-12-14 cs.CL 57%

Native Language Identification with Large Language Models

Wei Zhang, Alexandre Salle

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06853 2023-12-14 cs.AI 57%

LLF-Bench: Benchmark for Interactive Learning from Language Feedback

Ching-An Cheng, Andrey Kolobov, Dipendra Misra, Allen Nie, Adith Swaminathan

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05605 2023-12-12 cs.LG cs.CV 57%

TCNCA: Temporal Convolution Network with Chunked Attention for Scalable Sequence Processing

Aleksandar Terzic, Michael Hersche, Geethan Karunaratne, Luca Benini, Abu Sebastian, Abbas Rahimi

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15766 2023-12-11 cs.CL 57%

Knowledge Unlearning for LLMs: Tasks, Methods, and Challenges

Nianwen Si, Hao Zhang, Heyu Chang, Wenlin Zhang, Dan Qu, Weiqiang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00164 2023-12-04 cs.CY cs.AI 57%

Towards Accurate Differential Diagnosis with Large Language Models

Daniel McDuff, Mike Schaekermann, Tao Tu, Anil Palepu, Amy Wang, Jake Garrison, Karan Singhal, Yash Sharma, Shekoofeh Azizi, Kavita Kulkarni, Le Hou, Yong Cheng, Yun Liu, S Sara Mahdavi, Sushant Prakash, Anupam Pathak, Christopher Semturs, Shwetak Patel, Dale R Webster, Ewa Dominowska, Juraj Gottweis, Joelle Barral, Katherine Chou, Greg S Corrado, Yossi Matias, Jake Sunshine, Alan Karthikesalingam, Vivek Natarajan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18658 2023-12-01 cs.CL 57%

ArcMMLU: A Library and Information Science Benchmark for Large Language Models

Shitou Zhang, Zuchao Li, Xingshen Liu, Liming Yang, Ping Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17435 2023-11-30 cs.CV cs.AI 57%

MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning

Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Project page at https://mm-narrator.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08164 2023-11-29 cs.LG 57%

Long Range Graph Benchmark

Vijay Prakash Dwivedi, Ladislav Rampášek, Mikhail Galkin, Ali Parviz, Guy Wolf, Anh Tuan Luu, Dominique Beaini

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Added reference to Tönshoff et al., 2023 in Sec. 4.1; NeurIPS 2022 Track on D&B; Open-sourced at: https://github.com/vijaydwivedi75/lrgb

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16087 2023-11-28 cs.CL 57%

DUnE: Dataset for Unified Editing

Afra Feyza Akyürek, Eric Pan, Garry Kuwanto, Derry Wijaya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15826 2023-11-28 cs.CV cs.AI 57%

GeoChat: Grounded Large Vision-Language Model for Remote Sensing

Kartik Kuckreja, Muhammad Sohail Danish, Muzammal Naseer, Abhijit Das, Salman Khan, Fahad Shahbaz Khan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20477 2023-11-23 cs.HC cs.LG 57%

Exploring Practitioner Perspectives On Training Data Attribution Explanations

Elisa Nguyen, Evgenii Kortukov, Jean Y. Song, Seong Joon Oh

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Accepted to NeurIPS XAI in Action workshop 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03817 2023-11-23 cs.SE cs.AI 57%

Exploring and Characterizing Large Language Models For Embedded System Development and Debugging

Zachary Englhardt, Richard Li, Dilini Nissanka, Zhihan Zhang, Girish Narayanswamy, Joseph Breda, Xin Liu, Shwetak Patel, Vikram Iyer

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08734 2023-11-16 cs.CL 57%

Thread of Thought Unraveling Chaotic Contexts

Yucheng Zhou, Xiubo Geng, Tao Shen, Chongyang Tao, Guodong Long, Jian-Guang Lou, Jianbing Shen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 11 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07250 2023-11-16 q-bio.QM cs.CV cs.LG eess.IV 57%

Synthesizing Missing MRI Sequences from Available Modalities using Generative Adversarial Networks in BraTS Dataset

Ibrahim Ethem Hamamci

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments Wrong paper submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07897 2023-11-15 cs.CL 57%

CPopQA: Ranking Cultural Concept Popularity by LLMs

Ming Jiang, Mansi Joshi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05345 2023-11-14 cs.LG cs.AR 57%

RTLLM: An Open-Source Benchmark for Design RTL Generation with Large Language Model

Yao Lu, Shang Liu, Qijun Zhang, Zhiyao Xie

专题命中 推理评测 :planning(abstract);分类 cs.LG

Journal ref Asia and South Pacific Design Automation Conference (ASP-DAC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03533 2023-11-08 cs.CL 57%

Quantifying Uncertainty in Natural Language Explanations of Large Language Models

Sree Harsha Tanneru, Chirag Agarwal, Himabindu Lakkaraju

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14303 2023-11-08 cs.CL 57%

QTSumm: Query-Focused Summarization over Tabular Data

Yilun Zhao, Zhenting Qi, Linyong Nan, Boyu Mi, Yixin Liu, Weijin Zou, Simeng Han, Ruizhe Chen, Xiangru Tang, Yumo Xu, Dragomir Radev, Arman Cohan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08322 2023-11-07 cs.CL 57%

C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models

Yuzhen Huang, Yuzhuo Bai, Zhihao Zhu, Junlei Zhang, Jinghan Zhang, Tangjun Su, Junteng Liu, Chuancheng Lv, Yikai Zhang, Jiayi Lei, Yao Fu, Maosong Sun, Junxian He

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NeurIPS 2023. Website: https://cevalbenchmark.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01620 2023-11-06 cs.CV cs.CL 57%

ACQUIRED: A Dataset for Answering Counterfactual Questions In Real-Life Videos

Te-Lin Wu, Zi-Yi Dou, Qingyuan Hu, Yu Hou, Nischal Reddy Chandra, Marjorie Freedman, Ralph M. Weischedel, Nanyun Peng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09146 2023-11-06 cs.CL 57%

Can Retriever-Augmented Language Models Reason? The Blame Game Between the Retriever and the Language Model

Parishad BehnamGhader, Santiago Miret, Siva Reddy

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted in EMNLP2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00686 2023-11-02 cs.CL 57%

Little Giants: Exploring the Potential of Small LLMs as Evaluation Metrics in Summarization in the Eval4NLP 2023 Shared Task

Neema Kotonya, Saran Krishnasamy, Joel Tetreault, Alejandro Jaimes

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Eval4NLP 2023 Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00273 2023-11-02 cs.CL 57%

SoulChat: Improving LLMs' Empathy, Listening, and Comfort Abilities through Fine-tuning with Multi-turn Empathy Conversations

Yirong Chen, Xiaofen Xing, Jingkai Lin, Huimin Zheng, Zhenyu Wang, Qi Liu, Xiangmin Xu

专题命中 推理评测 :CoT(abstract);分类 cs.CL

Comments Appectped to Findings of EMNLP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20159 2023-11-01 cs.CV cs.AI 57%

Language Guided Visual Question Answering: Elevate Your Multimodal Language Model Using Knowledge-Enriched Prompts

Deepanway Ghosal, Navonil Majumder, Roy Ka-Wei Lee, Rada Mihalcea, Soujanya Poria

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04751 2023-11-01 cs.CL 57%

How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources

Yizhong Wang, Hamish Ivison, Pradeep Dasigi, Jack Hessel, Tushar Khot, Khyathi Raghavi Chandu, David Wadden, Kelsey MacMillan, Noah A. Smith, Iz Beltagy, Hannaneh Hajishirzi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 18 pages, 6 figure, 10 tables. NeurIPS 2023 Datasets and Benchmarks Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17924 2023-10-30 cs.CL 57%

SOUL: Towards Sentiment and Opinion Understanding of Language

Yue Deng, Wenxuan Zhang, Sinno Jialin Pan, Lidong Bing

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2023 Main Conference, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏