arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2403.08213 2024-10-23 cs.CL 57%

Can Large Language Models Identify Authorship?

Baixiang Huang, Canyu Chen, Kai Shu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2024 Findings. The main paper is 9 pages long, with 16 pages total. The code, results, dataset, and additional resources are available on the project website: https://llm-authorship.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15012 2024-10-22 eess.IV cs.AI cs.CV 57%

Pathologist-like explainable AI for interpretable Gleason grading in prostate cancer

Gesa Mittmann, Sara Laiouar-Pedari, Hendrik A. Mehrtens, Sarah Haggenmüller, Tabea-Clara Bucher, Tirtha Chanda, Nadine T. Gaisa, Mathias Wagner, Gilbert Georg Klamminger, Tilman T. Rau, Christina Neppl, Eva Maria Compérat, Andreas Gocht, Monika Hämmerle, Niels J. Rupp, Jula Westhoff, Irene Krücken, Maximillian Seidl, Christian M. Schürch, Marcus Bauer, Wiebke Solass, Yu Chun Tam, Florian Weber, Rainer Grobholz, Jaroslaw Augustyniak, Thomas Kalinski, Christian Hörner, Kirsten D. Mertz, Constanze Döring, Andreas Erbersdobler, Gabriele Deubler, Felix Bremmer, Ulrich Sommer, Michael Brodhun, Jon Griffin, Maria Sarah L. Lenon, Kiril Trpkov, Liang Cheng, Fei Chen, Angelique Levi, Guoping Cai, Tri Q. Nguyen, Ali Amin, Alessia Cimadamore, Ahmed Shabaik, Varsha Manucha, Nazeel Ahmad, Nidia Messias, Francesca Sanguedolce, Diana Taheri, Ezra Baraban, Liwei Jia, Rajal B. Shah, Farshid Siadat, Nicole Swarbrick, Kyung Park, Oudai Hassan, Siamak Sakhaie, Michelle R. Downes, Hiroshi Miyamoto, Sean R. Williamson, Tim Holland-Letz, Carolin V. Schneider, Jakob Nikolas Kather, Yuri Tolkach, Titus J. Brinker

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 58 pages, 15 figures (incl. supplementary)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14948 2024-10-22 cs.CL cs.CV 57%

SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation

Junda Wang, Yujan Ting, Eric Z. Chen, Hieu Tran, Hong Yu, Weijing Huang, Terrence Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14680 2024-10-22 cs.AI 57%

Influence of Backdoor Paths on Causal Link Prediction

Utkarshani Jaimini, Cory Henson, Amit Sheth

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01976 2024-10-21 cs.CL 57%

SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis

Hengxing Cai, Xiaochen Cai, Junhan Chang, Sihang Li, Lin Yao, Changxin Wang, Zhifeng Gao, Hongshuai Wang, Yongge Li, Mujie Lin, Shuwen Yang, Jiankun Wang, Mingjun Xu, Jin Huang, Xi Fang, Jiaxi Zhuang, Yuqi Yin, Yaqi Li, Changhong Chen, Zheng Cheng, Zifeng Zhao, Linfeng Zhang, Guolin Ke

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12109 2024-10-17 cs.CL cs.CV 57%

OMCAT: Omni Context Aware Transformer

Arushi Goel, Karan Sapra, Matthieu Le, Rafael Valle, Andrew Tao, Bryan Catanzaro

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Demo page: https://om-cat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11710 2024-10-16 cs.CL 57%

MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models

Pei Wang, Yanan Wu, Zekun Wang, Jiaheng Liu, Xiaoshuai Song, Zhongyuan Peng, Ken Deng, Chenchen Zhang, Jiakai Wang, Junran Peng, Ge Zhang, Hangyu Guo, Zhaoxiang Zhang, Wenbo Su, Bo Zheng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11123 2024-10-16 cs.CL cs.HC 57%

A Systematic Review on Prompt Engineering in Large Language Models for K-12 STEM Education

Eason Chen, Danyang Wang, Luyi Xu, Chen Cao, Xiao Fang, Jionghao Lin

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10998 2024-10-16 cs.AI 57%

WILT: A Multi-Turn, Memorization-Robust Inductive Logic Benchmark for LLMs

Eryk Banatt, Jonathan Cheng, Skanda Vaidyanath, Tiffany Hwu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Submitted to ICLR 2025. Preprint version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11924 2024-10-16 cs.CL 57%

Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark

Jian Wu, Linyi Yang, Zhen Wang, Manabu Okumura, Yue Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10054 2024-10-15 cs.CL 57%

AlphaLoRA: Assigning LoRA Experts Based on Layer Training Quality

Peijun Qing, Chongyang Gao, Yefan Zhou, Xingjian Diao, Yaoqing Yang, Soroush Vosoughi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments The 2024 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09604 2024-10-15 cs.AI cs.RO 57%

EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment

Chen Gao, Baining Zhao, Weichen Zhang, Jinzhu Mao, Jun Zhang, Zhiheng Zheng, Fanhang Man, Jianjie Fang, Zile Zhou, Jinqiang Cui, Xinlei Chen, Yong Li

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments All of the software, Python library, codes, datasets, tutorials, and real-time online service are available on this website: https://embodied-city.fiblab.net

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06851 2024-10-15 cs.CV cs.AI 57%

LIME: Less Is More for MLLM Evaluation

King Zhu, Qianbo Zang, Shian Jia, Siwei Wu, Feiteng Fang, Yizhi Li, Shawn Gavin, Tuney Zheng, Jiawei Guo, Bo Li, Haoning Wu, Xingwei Qu, Jian Yang, Zachary Liu, Xiang Yue, J. H. Liu, Chenghua Lin, Min Yang, Shiwen Ni, Wenhao Huang, Ge Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21693 2024-10-15 cs.AI 57%

TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities

Ming Zhang, Caishuang Huang, Yilong Wu, Shichun Liu, Huiyuan Zheng, Yurui Dong, Yujiong Shen, Shihan Dou, Jun Zhao, Junjie Ye, Qi Zhang, Tao Gui, Xuanjing Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03659 2024-10-14 cs.CV cs.CL 57%

Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models

Tinghui Zhu, Qin Liu, Fei Wang, Zhengzhong Tu, Muhao Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Website: https://darthzhu.github.io/cross-modality-knowledge-conflict/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07851 2024-10-11 cs.LG 57%

Scalable Representation Learning for Multimodal Tabular Transactions

Natraj Raman, Sumitra Ganesh, Manuela Veloso

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07826 2024-10-11 cs.CL 57%

Fine-Tuning Language Models for Ethical Ambiguity: A Comparative Study of Alignment with Human Responses

Pranav Senthilkumar, Visshwa Balasubramanian, Prisha Jain, Aneesa Maity, Jonathan Lu, Kevin Zhu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2024, SoLaR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07230 2024-10-11 cs.CV cs.AI 57%

Needle In A Multimodal Haystack

Weiyun Wang, Shuibo Zhang, Yiming Ren, Yuchen Duan, Tiantong Li, Shuo Liu, Mengkang Hu, Zhe Chen, Kaipeng Zhang, Lewei Lu, Xizhou Zhu, Ping Luo, Yu Qiao, Jifeng Dai, Wenqi Shao, Wenhai Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2024 Track Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06566 2024-10-10 cs.CL 57%

Detecting Bias and Enhancing Diagnostic Accuracy in Large Language Models for Healthcare

Pardis Sadat Zahraei, Zahra Shakeri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06547 2024-10-10 cs.CL cs.FL 57%

TuringQ: Benchmarking AI Comprehension in Theory of Computation

Pardis Sadat Zahraei, Ehsaneddin Asgari

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05802 2024-10-10 cs.CL 57%

Gradual Learning: Optimizing Fine-Tuning with Partially Mastered Knowledge in Large Language Models

Bozhou Li, Hao Liang, Yang Li, Fangcheng Fu, Hongzhi Yin, Conghui He, Wentao Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03278 2024-10-10 cs.CL 57%

What do Large Language Models Need for Machine Translation Evaluation?

Shenbin Qian, Archchana Sindhujan, Minnie Kabra, Diptesh Kanojia, Constantin Orăsan, Tharindu Ranasinghe, Frédéric Blain

专题命中 推理评测 :CoT(abstract);分类 cs.CL

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10900 2024-10-10 cs.CV cs.CL 57%

AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models

Xiyang Wu, Tianrui Guan, Dianqi Li, Shuaiyi Huang, Xiaoyu Liu, Xijun Wang, Ruiqi Xian, Abhinav Shrivastava, Furong Huang, Jordan Lee Boyd-Graber, Tianyi Zhou, Dinesh Manocha

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05077 2024-10-08 cs.CL 57%

ZEBRA: Zero-Shot Example-Based Retrieval Augmentation for Commonsense Question Answering

Francesco Maria Molfese, Simone Conia, Riccardo Orlando, Roberto Navigli

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08811 2024-10-08 cs.CL 57%

Mixture-of-Skills: Learning to Optimize Data Usage for Fine-Tuning Large Language Models

Minghao Wu, Thuy-Trang Vu, Lizhen Qu, Gholamreza Haffari

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 15 pages, 7 tables, 4 figures; Accepted by EMNLP2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00126 2024-10-08 cs.CL 57%

FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition

Xiaoqiang Wang, Lingfei Wu, Tengfei Ma, Bang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04107 2024-10-08 cs.CV cs.CL 57%

TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions

Xingwei He, Qianru Zhang, A-Long Jin, Yuan Yuan, Siu-Ming Yiu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04700 2024-10-08 cs.CL 57%

Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue

Jia-Chen Gu, Hao-Xiang Xu, Jun-Yu Ma, Pan Lu, Zhen-Hua Ling, Kai-Wei Chang, Nanyun Peng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03502 2024-10-07 cs.CL 57%

CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios

Zetian Ouyang, Yishuai Qiu, Linlin Wang, Gerard de Melo, Ya Zhang, Yanfeng Wang, Liang He

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments accepted by ENMLP-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03334 2024-10-07 cs.CV cs.AI 57%

An X-Ray Is Worth 15 Features: Sparse Autoencoders for Interpretable Radiology Report Generation

Ahmed Abdulaal, Hugo Fry, Nina Montaña-Brown, Ayodeji Ijishakin, Jack Gao, Stephanie Hyland, Daniel C. Alexander, Daniel C. Castro

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏