arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2506.18883 2025-11-24 cs.CV 88%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11777 2025-11-19 cs.RO cs.CV 88%

Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy

Vinit Mehta, Charu Sharma, Karthick Thiyagarajan

机构 * Machine Learning Lab IIIT Hyderabad(IIIT Hyderabad 机器学习实验室) SensR Lab Western Sydney University(Western Sydney University SensR实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 45 pages, 15 figures, MDPI Sensors Journal

Journal ref Sensors 2025, 25(20), 6394

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10974 2025-11-18 cs.MM cs.CV 88%

Failures to Surface Harmful Contents in Video Large Language Models

Yuxin Cao, Wei Song, Derui Wang, Jingling Xue, Jin Song Dong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 12 pages, 8 figures. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11407 2025-11-17 cs.CV 88%

MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimodal Large Language Model

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08530 2025-11-12 cs.SE cs.PL 88%

Can Large Language Models Simulate Symbolic Execution Output Like KLEE?

Rong Feng, Vanisha Gupta, Vivek Patel, Viroopaksh Reddy Ernampati, Suman Saha

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04012 2025-11-07 cs.SE 88%

PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models

Yongxi Chen, Lei Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06350 2025-11-04 cs.CV 88%

Aligning Effective Tokens with Video Anomaly in Large Language Models

Yingxian Chen, Jiahui Liu, Ruidi Fan, Yanwei Li, Chirui Chang, Shizhen Zhao, Wilton W. T. Fok, Xiaojuan Qi, Yik-Chung Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26543 2025-10-31 cs.CL cs.AI cs.LG 88%

The Structure of Relation Decoding Linear Operators in Large Language Models

Miranda Anna Christ, Adrián Csiszárik, Gergely Becsó, Dániel Varga

机构 * Fazekas Mihály High School(法泽卡米哈伊高中) HUN-REN Alfréd Rényi Insititute of Mathematics(HUN-REN阿弗雷德·雷尼数学研究所) Eötvös Loránd University(欧多布查伊·劳尔大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11094 2025-10-31 cs.CV 88%

Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space

Weichen Zhang, Zile Zhou, Xin Zeng, Xuchen Liu, Jianjie Fang, Chen Gao, Yong Li, Jinqiang Cui, Xinlei Chen, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23055 2025-10-28 cs.SE 88%

From Online User Feedback to Requirements: Evaluating Large Language Models for Classification and Specification Tasks

Manjeshwar Aniruddh Mallya, Alessio Ferrari, Mohammad Amin Zadenoori, Jacek Dąbrowski

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21076 2025-10-28 cs.CV 88%

DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding

Weihao Xuan, Junjue Wang, Heli Qi, Zihang Chen, Zhuo Zheng, Yanfei Zhong, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Wuhan University(武汉大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09252 2025-10-28 cs.CV 88%

Zero-Shot Multi-modal Large Language Model v.s. Supervised Deep Learning: A Comparative Study on CT-Based Intracranial Hemorrhage Subtyping

Yinuo Wang, Yue Zeng, Kai Chen, Cai Meng, Chao Pan, Zhouping Tang

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程与自动化学院) Department of Neurology, Tongji Hospital, Tongji Medical College, Huazhong University of Science and Technology(华中科技大学同济医学院神经内科,同济医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12520 2025-10-28 cs.CV 88%

SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning

Junkai Chen, Zhijie Deng, Kening Zheng, Yibo Yan, Shuliang Liu, PeiJun Wu, Peijie Jiang, Jia Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Ant Group, Alibaba(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18582 2025-10-23 cs.CV 88%

The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers

Daiqing Qi, Handong Zhao, Jing Shi, Simon Jenni, Yifei Fan, Franck Dernoncourt, Scott Cohen, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Adobe(Adobe公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11000 2025-10-23 cs.SE 88%

Ever-Improving Test Suite by Leveraging Large Language Models

Ketai Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by 33rd ACM International Conference on the Foundations of Software Engineering (FSE Companion '25), June 23--28, 2025, Trondheim, Norway

Journal ref Proceedings of the 33rd ACM International Conference on the Foundations of Software Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16779 2025-10-21 cs.SE 88%

QuanBench: Benchmarking Quantum Code Generation with Large Language Models

Xiaoyu Guo, Minggu Wang, Jianjun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments This paper was accepted by ASE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00003 2025-10-21 cs.CV 88%

Large Language Model-Guided Semantic Alignment for Human Activity Recognition

Hua Yan, Heng Tan, Yi Ding, Pengfei Zhou, Vinod Namboodiri, Yu Yang

机构 * Lehigh University(莱维理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26165 2025-10-16 cs.CV 88%

Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models

Yuansen Liu, Haiming Tang, Jinlong Peng, Jiangning Zhang, Xiaozhong Ji, Qingdong He, Wenbin Wu, Donghao Luo, Zhenye Gan, Junwei Zhu, Yunhang Shen, Chaoyou Fu, Chengjie Wang, Xiaobin Hu, Shuicheng Yan

机构 * Yuan-Hou(元侯)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11742 2025-10-15 cs.CY 88%

The Ethics Engine: A Modular Pipeline for Accessible Psychometric Assessment of Large Language Models

Jake Van Clief, Constantine Kyritsopoulos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 18 pages, 2 figures. Code available at https://github.com/RinDig/GPTmetrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10367 2025-10-15 cs.CV 88%

Contrast Sensitivity in Multimodal Large Language Models: A Psychophysics-Inspired Evaluation

Pablo Hernández-Cámara, Alexandra Gomez-Villa, Jose Manuel Jaén-Lorites, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de València, Spain(瓦伦西亚大学图像处理实验室) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学) Center for Biomaterials and Tissue Engineering, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11131 2025-10-14 cs.SI cs.CY 88%

SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Models

Jia Wang, Ziyu Zhao, Tingjuntao Ni, Zhongyu Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05899 2025-10-13 cs.SE 88%

Prompt engineering and its implications on the energy consumption of Large Language Models

Riccardo Rubei, Aicha Moussaid, Claudio di Sipio, Davide di Ruscio

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20553 2025-10-09 cs.SE 88%

GeoJSEval: An Automated Evaluation Framework for Large Language Models on JavaScript-Based Geospatial Computation and Visualization Code Generation

Guanyu Chen, Haoyue Jiao, Shuyang Hou, Ziqi Liu, Lutong Xie, Shaowen Wu, Huayi Wu, Xuefeng Guan, Zhipeng Gui

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Journal ref 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07966 2025-10-08 cs.CV 88%

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Ziyang Gong, Wenhao Li, Oliver Ma, Songyuan Li, Zhaokai Wang, Songyuan Li, Jiayi Ji, Xue Yang, Gen Luo, Junchi Yan, Rongrong Ji

机构 * SJTU(上海交通大学) XMU(厦门大学) Shanghai AI Lab(上海人工智能实验室) SYSU(南方科技大学) FDU(福建大学) NUS(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20862 2025-10-01 cs.CV 88%

AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding

Chaeyoung Jung, Youngjoon Jang, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24782 2025-09-30 cs.SE 88%

Large language models for behavioral modeling: A literature survey

Muhammad Laiq

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19096 2025-09-26 cs.CV cs.SE 88%

Investigating Traffic Accident Detection Using Multimodal Large Language Models

Ilhan Skender, Kailin Tong, Selim Solmaz, Daniel Watzenig

机构 * Embedded Systems Group (Dept.-E)(嵌入式系统组) Virtual Vehicle Research GmbH(虚拟车辆研究公司) Control Systems Group (Dept.-E)(控制系统组) Institute of Visual Computing(视觉计算研究所) Graz University of Technology(格拉茨技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted for presentation at the 2025 IEEE International Automated Vehicle Validation Conference (IAVVC 2025). Final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19673 2025-09-25 cs.SE 88%

Assertion Messages with Large Language Models (LLMs) for Code

Ahmed Aljohani, Anamul Haque Mollah, Hyunsook Do

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted at Proceedings of the 2025 Evaluation and Assessment in Software Engineering (EASE '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07584 2025-09-22 cs.CR 88%

SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models

Huining Cui, Wei Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Major rework on the paper that changes the title, content, experiments, story, and etc. All authors agree to withdraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16405 2025-09-18 cs.MM 88%

EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment

Lancheng Gao, Ziheng Jia, Yunhao Zeng, Wei Sun, Yiming Zhang, Wei Zhou, Guangtao Zhai, Xiongkuo Min

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏