arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2410.01926 2024-10-04 cs.LG 57%

MARPLE: A Benchmark for Long-Horizon Inference

Emily Jin, Zhuoyi Huang, Jan-Philipp Fränken, Weiyu Liu, Hannah Cha, Erik Brockbank, Sarah Wu, Ruohan Zhang, Jiajun Wu, Tobias Gerstenberg

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments NeurIPS 2024. First two authors contributed equally. Project page: https://marple-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01769 2024-10-04 cs.CL 57%

Quantifying Generalization Complexity for Large Language Models

Zhenting Qi, Hongyin Luo, Xuliang Huang, Zhuokai Zhao, Yibo Jiang, Xiangjun Fan, Himabindu Lakkaraju, James Glass

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11239 2024-10-03 cs.CL 57%

LLM-as-a-Judge & Reward Model: What They Can and Cannot Do

Guijin Son, Hyunwoo Ko, Hoyoung Lee, Yewon Kim, Seunghyeok Hong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04927 2024-10-03 cs.CL eess.AS 57%

Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue

Junkai Wu, Xulin Fan, Bo-Ru Lu, Xilin Jiang, Nima Mesgarani, Mark Hasegawa-Johnson, Mari Ostendorf

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to IEEE SLT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03347 2024-10-03 cs.CL 57%

Towards Interpretable Mental Health Analysis with Large Language Models

Kailai Yang, Shaoxiong Ji, Tianlin Zhang, Qianqian Xie, Ziyan Kuang, Sophia Ananiadou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2023 main conference as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00292 2024-10-02 cs.CL cs.CV 57%

Insight: A Multi-Modal Diagnostic Pipeline using LLMs for Ocular Surface Disease Diagnosis

Chun-Hsiao Yeh, Jiayun Wang, Andrew D. Graham, Andrea J. Liu, Bo Tan, Yubei Chen, Yi Ma, Meng C. Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to MICCAI 2024. Project Webpage: https://danielchyeh.github.io/MDPipe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00175 2024-10-02 cs.CL 57%

Adaptable Moral Stances of Large Language Models on Sexist Content: Implications for Society and Gender Discourse

Rongchen Guo, Isar Nejadgholi, Hillary Dawkins, Kathleen C. Fraser, Svetlana Kiritchenko

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments To be published at EMNLP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12857 2024-10-02 cs.CL cs.DL cs.IR 57%

Automated Peer Reviewing in Paper SEA: Standardization, Evaluation, and Analysis

Jianxiang Yu, Zichen Ding, Jiaqi Tan, Kangyang Luo, Zhenmin Weng, Chenghua Gong, Long Zeng, Renjing Cui, Chengcheng Han, Qiushi Sun, Zhiyong Wu, Yunshi Lan, Xiang Li

专题命中 推理评测 :self-correction(abstract);分类 cs.CL

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18711 2024-10-02 cs.CL 57%

Women Are Beautiful, Men Are Leaders: Gender Stereotypes in Machine Translation and Language Modeling

Matúš Pikuliak, Andrea Hrckova, Stefan Oresko, Marián Šimko

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19723 2024-10-01 cs.CL 57%

Revealing Personality Traits: A New Benchmark Dataset for Explainable Personality Recognition on Dialogues

Lei Sun, Jinming Zhao, Qin Jin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2024 Main Conference (Long Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10173 2024-10-01 cs.CL 57%

IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commerce

Wenxuan Ding, Weiqi Wang, Sze Heng Douglas Kwok, Minghao Liu, Tianqing Fang, Jiaxin Bai, Xin Liu, Changlong Yu, Zheng Li, Chen Luo, Qingyu Yin, Bing Yin, Junxian He, Yangqiu Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18343 2024-09-30 cs.AI 57%

Improving Agent Behaviors with RL Fine-tuning for Autonomous Driving

Zhenghao Peng, Wenjie Luo, Yiren Lu, Tianyi Shen, Cole Gulino, Ari Seff, Justin Fu

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18142 2024-09-30 cs.AI cs.MM 57%

A Survey on Multimodal Benchmarks: In the Era of Large AI Models

Lin Li, Guikun Chen, Hanrong Shi, Jun Xiao, Long Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16807 2024-09-30 cs.CL 57%

Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learning

Tianhui Zhang, Bei Peng, Danushka Bollegala

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2024 Findings, Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06349 2024-09-30 cs.LG 57%

CausalBench: A Comprehensive Benchmark for Causal Learning Capability of LLMs

Yu Zhou, Xingyu Wu, Beicheng Huang, Jibin Wu, Liang Feng, Kay Chen Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17588 2024-09-27 cs.CL 57%

DualCoTs: Dual Chain-of-Thoughts Prompting for Sentiment Lexicon Expansion of Idioms

Fuqiang Niu, Minghuan Tan, Bowen Zhang, Min Yang, Ruifeng Xu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17536 2024-09-27 cs.CL 57%

MUSE: Integrating Multi-Knowledge for Knowledge Graph Completion

Pengjie Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2408.05283

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16176 2024-09-25 cs.CR cs.AI 57%

Cyber Knowledge Completion Using Large Language Models

Braden K Webb, Sumit Purohit, Rounak Meyur

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 7 pages, 2 figures. Submitted to 2024 IEEE International Conference on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15188 2024-09-25 cs.CL cs.HC 57%

PALLM: Evaluating and Enhancing PALLiative Care Conversations with Large Language Models

Zhiyuan Wang, Fangxu Yuan, Virginia LeBaron, Tabor Flickinger, Laura E. Barnes

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACM Transactions on Computing for Healthcare, Special Issue on Large Language Models, Conversational Systems, and Generative AI in Health, pending minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14759 2024-09-24 cs.CV cs.AI 57%

VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models

Nam Hyeon-Woo, Moon Ye-Bin, Wonseok Choi, Lee Hyun, Tae-Hyun Oh

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07720 2024-09-24 cs.CV cs.AI 57%

Multi-modal Auto-regressive Modeling via Visual Words

Tianshuo Peng, Zuchao Li, Lefei Zhang, Hai Zhao, Ping Wang, Bo Du

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14478 2024-09-24 cs.AI 57%

Can Large Language Models Logically Predict Myocardial Infarction? Evaluation based on UK Biobank Cohort

Yuxing Zhi, Yuan Guo, Kai Yuan, Hesong Wang, Heng Xu, Haina Yao, Albert C Yang, Guangrui Huang, Yuping Duan

专题命中 推理评测 :CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14050 2024-09-24 cs.AI 57%

The use of GPT-4o and Other Large Language Models for the Improvement and Design of Self-Assessment Scales for Measurement of Interpersonal Communication Skills

Goran Bubaš

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13721 2024-09-24 cs.CL 57%

LegiLM: A Fine-Tuned Legal Language Model for Data Compliance

Linkai Zhu, Lu Yang, Chaofan Li, Shanwen Hu, Lu Liu, Bin Yin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12889 2024-09-24 cs.AI 57%

Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case

Peng Chen, Pi Bu, Jun Song, Yuan Gao, Bo Zheng

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13940 2024-09-23 cs.CL 57%

A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models

Jiayin Wang, Fengran Mo, Weizhi Ma, Peijie Sun, Min Zhang, Jian-Yun Nie

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12599 2024-09-20 cs.CL 57%

Enhancing SLM via ChatGPT and Dataset Augmentation

Tom Pieper, Mohamad Ballout, Ulf Krumnack, Gunther Heidemann, Kai-Uwe Kühnberger

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10825 2024-09-17 eess.SY cs.LG cs.SY 57%

Large Language Model (LLM) for Telecommunications: A Comprehensive Survey on Principles, Key Techniques, and Opportunities

Hao Zhou, Chengming Hu, Ye Yuan, Yufei Cui, Yili Jin, Can Chen, Haolun Wu, Dun Yuan, Li Jiang, Di Wu, Xue Liu, Charlie Zhang, Xianbin Wang, Jiangchuan Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02373 2024-09-16 cs.AI 57%

Operationalizing Contextual Integrity in Privacy-Conscious Assistants

Sahra Ghalebikesabi, Eugene Bagdasaryan, Ren Yi, Itay Yona, Ilia Shumailov, Aneesh Pappu, Chongyang Shi, Laura Weidinger, Robert Stanforth, Leonard Berrada, Pushmeet Kohli, Po-Sen Huang, Borja Balle

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05968 2024-09-16 eess.AS cs.CL 57%

Prompting Large Language Models with Audio for General-Purpose Speech Summarization

Wonjune Kang, Deb Roy

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏