arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2505.20305 2025-05-28 cs.CY 88%

Making Sense of the Unsensible: Reflection, Survey, and Challenges for XAI in Large Language Models Toward Human-Centered AI

Francisco Herrera

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 30 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10541 2025-05-26 cs.CV 88%

Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis

Pengfei Wang, Guohai Xu, Weinong Wang, Junjie Yang, Jie Lou, Yunhua Xue

机构 * Pengfei Wang(王鹏飞) Guohai Xu(徐国海) Weinong Wang(王文龙) Junjie Yang(杨俊杰) Jie Lou(娄杰) Yunhua Xue(许云华)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09936 2025-05-16 cs.HC cs.GR cs.MA cs.MM 88%

CartoAgent: a multimodal large language model-powered multi-agent cartographic framework for map style transfer and evaluation

Chenglong Wang, Yuhao Kang, Zhaoya Gong, Pengjun Zhao, Yu Feng, Wenjia Zhang, Ge Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09478 2025-05-15 cs.HC 88%

Card Sorting Simulator: Augmenting Design of Logical Information Architectures with Large Language Models

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16566 2025-05-08 cs.HC 88%

AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models

Zheng Lian, Haoyu Chen, Lan Chen, Haiyang Sun, Licai Sun, Yong Ren, Zebang Cheng, Bin Liu, Rui Liu, Xiaojiang Peng, Jiangyan Yi, Jianhua Tao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01976 2025-05-06 cs.CR 88%

A Survey on Privacy Risks and Protection in Large Language Models

Kang Chen, Xiuze Zhou, Yuanguo Lin, Shibo Feng, Li Shen, Pengcheng Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21803 2025-05-01 cs.SE cs.CR 88%

An Empirical Study on the Effectiveness of Large Language Models for Binary Code Understanding

Xiuwei Shang, Zhenkan Fu, Shaoyin Cheng, Guoqiang Chen, Gangyang Li, Li Hu, Weiming Zhang, Nenghai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21040 2025-05-01 cs.CV 88%

Can a Large Language Model Assess Urban Design Quality? Evaluating Walkability Metrics Across Expertise Levels

Chenyi Cai, Kosuke Kuriyama, Youlong Gu, Filip Biljecki, Pieter Herthogs

机构 * Singapore-ETH Centre, Future Cities Lab Global Programme, CREATE campus(新加坡-ETH中心,未来城市实验室全球计划,CREATE校区) National University of Singapore(新加坡国立大学) Takenaka Corporation(Takenaka公司) Department of Architecture, National University of Singapore(新加坡国立大学建筑系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07229 2025-04-24 cs.MM 88%

MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks

Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang, Daling Wang, Yang Li, Qi Sun, Yifei Zhang, Xiaoming Fu, Soujanya Poria

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by the Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15279 2025-04-22 cs.CV 88%

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Weiye Xu, Jiahao Wang, Weiyun Wang, Zhe Chen, Wengang Zhou, Aijun Yang, Lewei Lu, Houqiang Li, Xiaohua Wang, Xizhou Zhu, Wenhai Wang, Jifeng Dai, Jinguo Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Code, data, and baselines are available at https://visulogic-benchmark.github.io/VisuLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17933 2025-04-22 cs.SE 88%

Automated Test Transfer Across Android Apps Using Large Language Models

Benyamin Beyzaei, Saghar Talebipour, Ghazal Rafiei, Nenad Medvidovic, Sam Malek

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04178 2025-04-22 cs.CV 88%

SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models

Yichen Shi, Yuhao Gao, Yingxin Lai, Hongyang Wang, Jun Feng, Lei He, Jun Wan, Changsheng Chen, Zitong Yu, Xiaochun Cao

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系) School of Information Science and Technology, Shijiazhuang Tiedao University(石家庄铁道大学信息科学与技术学院) Electrical Engineering Department, UCLA(加州大学洛杉矶分校电子工程系) New Laboratory of Pattern Recognition(NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Computing and Information Technology, Great Bay University(广东东莞Great Bay大学计算与信息科技学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by Visual Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11481 2025-04-17 cs.CY 88%

Leveraging Knowledge Graphs and Large Language Models to Track and Analyze Learning Trajectories

Yu-Hxiang Chen, Ju-Shen Huang, Jia-Yu Hung, Chia-Kai Chang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05508 2025-04-16 cs.CL cs.AI cs.LG 88%

FairPy: A Toolkit for Evaluation of Prediction Biases and their Mitigation in Large Language Models

Hrishikesh Viswanath, Tianyi Zhang

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13983 2025-04-14 cs.CV 88%

SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability

Jiankang Wang, Zhihan Zhang, Zhihang Liu, Yang Li, Jiannan Ge, Hongtao Xie, Yongdong Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10727 2025-04-14 cs.CV 88%

MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning

Chenyu Wang, Weixin Luo, Sixun Dong, Xiaohua Xuan, Zhengxin Li, Lin Ma, Shenghua Gao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04659 2025-04-10 cs.CV 88%

ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models

Ziyue Wang, Chi Chen, Fuwen Luo, Yurui Dong, Yuanchi Zhang, Yuzhuang Xu, Xiaolong Wang, Peng Li, Yang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01145 2025-04-03 cs.CR 88%

MaLAware: Automating the Comprehension of Malicious Software Behaviours using Large Language Models (LLMs)

Bikash Saha, Nanda Rani, Sandeep Kumar Shukla

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted at MSR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19910 2025-03-26 cs.CV cs.IR 88%

CoLLM: A Large Language Model for Composed Image Retrieval

Chuong Huynh, Jinyu Yang, Ashish Tawari, Mubarak Shah, Son Tran, Raffay Hamid, Trishul Chilimbi, Abhinav Shrivastava

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments CVPR 2025. Project page: https://collm-cvpr25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17998 2025-03-25 cs.SE 88%

Automatic High-Level Test Case Generation using Large Language Models

Navid Bin Hasan, Md. Ashraful Islam, Junaed Younus Khan, Sanjida Senjik, Anindya Iqbal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted at International Conference on Mining Software Repositories (MSR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17827 2025-03-25 cs.CV 88%

4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding

Wenxuan Zhu, Bing Li, Cheng Zheng, Jinjie Mai, Jun Chen, Letian Jiang, Abdullah Hamdi, Sara Rojas Martinez, Chia-Wen Lin, Mohamed Elhoseiny, Bernard Ghanem

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14941 2025-03-20 cs.CV 88%

UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation

Qihui Zhang, Munan Ning, Zheyuan Liu, Yanbo Wang, Jiayi Ye, Yue Huang, Shuo Yang, Xiao Chen, Yibing Song, Li Yuan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13962 2025-03-19 cs.CV 88%

Survey of Adversarial Robustness in Multimodal Large Language Models

Chengze Jiang, Zhuangzhuang Wang, Minjing Dong, Jie Gui

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13772 2025-03-19 cs.DC cs.SE 88%

Do Large Language Models Understand Performance Optimization?

Bowen Cui, Tejas Ramesh, Oscar Hernandez, Keren Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments First two authors have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09123 2025-03-19 cs.SI 88%

Can I introduce my boyfriend to my grandmother? Evaluating Large Language Models Capabilities on Iranian Social Norm Classification

Hamidreza Saffari, Mohammadamin Shafiei, Donya Rooein, Francesco Pierri, Debora Nozza

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 15 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18325 2025-03-18 cs.CV 88%

AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models

Kim Sung-Bin, Oh Hyun-Bin, JungMok Lee, Arda Senocak, Joon Son Chung, Tae-Hyun Oh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11400 2025-03-17 cs.CV cs.RO 88%

A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving

Tin Stribor Sohn, Philipp Reis, Maximilian Dillitzer, Johannes Bach, Jason J. Corso, Eric Sax

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Submitted to IEEE IAVVC 2025, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06142 2025-03-11 cs.CV 88%

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models

Xinan He, Yue Zhou, Bing Fan, Bin Li, Guopu Zhu, Feng Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06141 2025-03-11 cs.CV 88%

Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model

Mingxing Li, Rui Wang, Lei Sun, Yancheng Bai, Xiangxiang Chu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16498 2025-03-05 cs.SE 88%

A Survey on Evaluating Large Language Models in Code Generation Tasks

Liguo Chen, Qi Guo, Hongrui Jia, Zhengran Zeng, Xin Wang, Yijiang Xu, Jian Wu, Yidong Wang, Qing Gao, Jindong Wang, Wei Ye, Shikun Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏