arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2512.01989 2025-12-02 cs.CV 67%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14007 2025-12-02 cs.SE 67%

On the Quality of AI-Generated Source Code Comments: A Comprehensive Evaluation

关于由人工智能生成的源代码注释质量:全面评估

Ian Guelman, Arthur Gregório Leal, Laerte Xavier, Marco Tulio Valente

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文评估了AI生成的源代码注释质量,发现其与原始注释相当或更优,并揭示了需要新的文档特定度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01755 2025-12-02 cs.CV cs.RO 67%

3EED: Ground Everything Everywhere in 3D

3EED: 在三维中万物皆 grounded

Rong Li, Yuhao Dong, Tianshuai Hu, Ao Liang, Youquan Liu, Dongyue Lu, Liang Pan, Lingdong Kong, Junwei Liang, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 3EED提出一个大规模多平台多模态三维 grounding 基准测试,通过提供丰富的户外场景数据和跨平台学习技术,推动语言驱动的三维具身感知研究。

Comments NeurIPS 2025 DB Track; 38 pages, 17 figures, 10 tables; Project Page at https://project-3eed.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 67%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19362 2025-12-02 cs.CV cs.AI cs.CL cs.CY cs.LG 67%

LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences

LOTUS: 一种用于从质量到社会偏见和用户偏好的详细图像描述的排行榜

Yusuke Hirota, Boyi Li, Ryo Hachiuma, Yueh-Hua Wu, Boris Ivanovic, Yuta Nakashima, Marco Pavone, Yejin Choi, Yu-Chiang Frank Wang, Chao-Han Huck Yang

机构 * NVIDIA Research(NVIDIA研究)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LOTUS是一种用于评估详细图像描述质量、偏见和社会偏见的排行榜,通过定制标准满足不同用户偏好,揭示了模型在不同评估标准上的表现差异。

Comments Accepted to ACL 2025. Leaderboard: huggingface.co/spaces/nvidia/lotus-vlm-bias-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00259 2025-12-02 cs.NI 67%

Design and Evaluation of a Multi-Agent Perception System for Autonomous Flying Networks

自主飞行网络多智能体感知系统的設計與評估

Diogo Ferreira, Pedro Ribeiro, André Coelho, Rui Campos

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出多智能体感知系统MAPS,利用多模态大语言模型和代理AI,实现自主飞行网络中用户感知与服务需求的自动识别与规范生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09869 2025-12-02 cs.CL cs.AI 62%

NarraBench: A Comprehensive Framework for Narrative Benchmarking

NarraBench:一个全面的叙事基准评估框架

Sil Hamilton, Matthew Wilkens, Andrew Piper

机构 * Cornell University(康奈尔大学) McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 NarraBench提出了一种叙事理解任务的分类框架,并指出现有基准在评估叙事事件、风格等关键方面存在不足,呼吁开发更全面的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00120 2025-12-02 cs.SD cs.AI cs.CV cs.LG cs.MM 62%

Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment

Art2Music: 通过多模态情感对齐生成艺术图像的音乐

Jiaying Hong, Ting Zhu, Thanet Markchom, Huizhi Liang

机构 * School of Computing Newcastle University(计算学院新castle大学) Department of Computer Science University of Reading(计算机科学系阅读大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Art2Music通过多模态情感对齐生成艺术图像的音乐,利用轻量级跨模态框架提升音乐生成的感知自然性和频谱保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12048 2025-12-02 cs.AI cs.HC cs.LG 62%

A Survey on Bridging EEG Signals and Generative AI: From Image and Text to Beyond

关于将EEG信号与生成式AI连接的综述:从图像和文本到更广泛的领域

Shreya Shukla, Jose Torres, Akshaj Murhekar, Christina Liu, Abhijit Mishra, Jacek Gwizdka, Shounak Roychowdhury

机构 * School of Information, The University of Texas at Austin, Austin, TX, USA(信息学院,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本综述探讨了将EEG信号转化为图像、文本和音频的生成式AI方法,分析了当前技术趋势与挑战,为未来研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01396 2025-12-02 cs.SE cs.CL cs.CR 57%

BackportBench: A Multilingual Benchmark for Automated Backporting of Patches

BackportBench: 一种多语言的自动化补丁回退基准测试

Zhiqing Zhong, Jiaming Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 BackportBench是一个多语言基准测试,用于评估自动化补丁回退技术,展示了代理方法在处理复杂补丁回退任务中的优越性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00473 2025-12-02 cs.CV cs.AI 57%

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19217 2025-12-02 cs.CV cs.AI 57%

A Lightweight and Extensible Cell Segmentation and Classification Model for Whole Slide Images

一种轻量且可扩展的整张滑片图像细胞分割与分类模型

Nikita Shvetsov, Thomas K. Kilvaer, Masoud Tafavvoghi, Anders Sildnes, Kajsa Møllersen, Lill-Tove Rasmussen Busund, Lars Ailo Bongo

机构 * Department of Computer Science, UiT The Arctic University of Norway(计算机科学系,UiT北极大学) Department of Oncology, University Hospital of North Norway(肿瘤学系,北挪威大学医院) Department of Clinical Medicine, UiT The Arctic University of Norway(临床医学系,UiT北极大学) Department of Community Medicine, UiT The Arctic University of Norway(社区医学系,UiT北极大学) Department of Medical Biology, UiT The Arctic University of Norway(医学生物学系,UiT北极大学) Department of Clinical Pathology, University Hospital of North Norway(临床病理学系,北挪威大学医院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种轻量且可扩展的细胞分割与分类模型,通过改进数据标注、利用H-Optimus基础模型和知识蒸馏,提升分割和分类性能,同时降低计算复杂度。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01686 2025-12-02 cs.CV 50%

DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

DreamingComics: 通过主体和布局定制生成实现故事可视化管道

Patrick Kwon, Chen Chen

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 评测与基准 :LLM(abstract)

AI总结 DreamingComics通过结合视频模型和布局生成技术,实现了基于主体和布局定制的高效故事可视化方法,提升了角色一致性和风格相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01665 2025-12-02 cs.CV 50%

Bridging the Scale Gap: Balanced Tiny and General Object Detection in Remote Sensing Imagery

弥合尺度差距:面向遥感影像中平衡微小和通用目标检测

Zhicheng Zhao, Yin Huang, Lingma Sun, Chenglong Li, Jin Tang

机构 * Key Laboratory of Intelligent Computing & Signal Processing (Anhui University), Ministry of Education(智能计算与信号处理重点实验室(安徽大学)) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Artificial Intelligence, Anhui University(人工智能学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第三十八研究所) School of Computer Science and Technology, Anhui University(计算机科学与技术学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 ScaleBridge-Det通过适应性专家路由和密度引导查询分配,实现遥感影像中微小和通用目标检测的平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01519 2025-12-02 cs.CV cond-mat.mtrl-sci quant-ph 50%

QuantumCanvas: A Multimodal Benchmark for Visual Learning of Atomic Interactions

QuantumCanvas:一种用于原子相互作用视觉学习的多模态基准

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A&M University(德克萨斯大学) Ankara University(安卡拉大学) Texas A&M University at Qatar(德克萨斯大学(卡塔尔)) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 QuantumCanvas通过多模态基准统一轨道物理与视觉表示学习,为学习可转移的量子相互作用提供了系统且可解释的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06263 2025-12-02 cs.CV 50%

OmniSVG: A Unified Scalable Vector Graphics Generation Model

OmniSVG: 一种统一的可扩展矢量图形生成模型

Yiying Yang, Wei Cheng, Sijin Chen, Xianfang Zeng, Fukun Yin, Jiaxu Zhang, Liao Wang, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun Project(StepFun项目)

专题命中 评测与基准 :language model(abstract)

AI总结 OmniSVG通过统一框架和预训练视觉-语言模型,实现高效多模态SVG生成,提升复杂结构的表达能力,并引入大规模数据集推动SVG合成发展。

Comments 20 pages; Project Page: https://omnisvg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01352 2025-12-02 cs.CV 50%

OpenBox: Annotate Any Bounding Boxes in 3D

OpenBox: 任意3D边界框的标注

In-Jae Lee, Mungyeom Kim, Kwonyoung Ryu, Pierre Musacchio, Jaesik Park

机构 * Seoul National University(首尔国立大学) POSTECH

专题命中 评测与基准 :foundation model(abstract)

AI总结 OpenBox通过2D视觉基础模型实现无需自我训练的高质量3D边界框标注,提升自动驾驶中物体检测的准确性和效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01348 2025-12-02 cs.CV 50%

Handwritten Text Recognition for Low Resource Languages

低资源语言的手写文本识别

Sayantan Dey, Alireza Alaei, Partha Pratim Roy

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基学院) Faculty of Science and Engineering(科学与工程学院)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出BharatOCR,一种无需分段的段落级手写印地语和乌尔都语文本识别系统,通过ViT-Transformer Decoder-LM架构提升识别准确率和流畅性。

Comments 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01009 2025-12-02 cs.RO cs.CV 50%

FOM-Nav: Frontier-Object Maps for Object Goal Navigation

FOM-Nav:用于目标导航的前沿-对象地图

Thomas Chabal, Shizhe Chen, Jean Ponce, Cordelia Schmid

机构 * Inria(法国国家信息与自动化技术研究院) Department of Computer Science, École normale supérieure (ENS-PSL, CNRS, Inria)(高等师范学院计算机科学系) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学Courant数学科学研究所和数据科学中心)

专题命中 评测与基准 :language model(abstract)

AI总结 FOM-Nav通过前沿-对象地图和视觉-语言模型提升机器人在未知环境中的目标导航效率,实现最先进的导航性能。

Comments Project page: https://www.di.ens.fr/willow/research/fom-nav/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 48 篇

2512.01672 2025-12-02 cs.LG cs.AI 92%

ICAD-LLM: One-for-All Anomaly Detection via In-Context Learning with Large Language Models

ICAD-LLM: 一种通过大语言模型上下文学习实现的通用异常检测方法

Zhongyuan Wu, Jingyuan Wang, Zexuan Cheng, Yilong Zhou, Weizhi Wang, Juhua Pu, Chao Li, Changqing Ma

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ICAD-LLM通过大语言模型的上下文学习能力,实现跨领域和模态的通用异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00040 2025-12-02 cs.NI cs.AI 90%

Constrained Network Slice Assignment via Large Language Models

通过大语言模型实现受约束的网络切片分配

Sagar Sudhakara, Pankaj Rajak

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大语言模型实现网络切片分配,通过零样本提示生成初始分配方案,并结合优化求解器提升性能,实现高效的5G网络资源分配。

Comments Accepted at NeurIPS 2025 Workshop on AI and ML for Next-Generation Wireless Communications and Networking (AI4NextG), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00083 2025-12-02 cs.AR cs.DC 89%

LLaMCAT: Optimizing Large Language Model Inference with Cache Arbitration and Throttling

LLaMCAT:通过缓存仲裁和限流优化大语言模型推理

Zhongchun Zhou, Chengtao Lai, Wei Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLaMCAT通过缓存仲裁和限流技术优化大语言模型推理,实现1.26-1.58倍速度提升,填补LLM解码特定MSHR竞争的空白。

Comments Accepted to ICPP 2025

Journal ref In Proceedings of 54th International Conference on Parallel Processing (ICPP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01949 2025-12-02 cs.CV 88%

Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models

脚本:图结构和查询条件的语义令牌修剪用于多模态大语言模型

Zhongyu Yang, Dannong Xu, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦德大学BCML中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 Script通过图结构和查询条件的语义令牌修剪,提升多模态大语言模型的效率和准确性,实现显著的性能提升。

Comments Published in Transactions on Machine Learning Research, Project in https://01yzzyu.github.io/script.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20015 2025-12-02 cs.AI cs.CL 86%

Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak

通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking

Haoxuan Ji, Zheng Lin, Zhenxing Niu, Xinbo Gao, Gang Hua

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01002 2025-12-02 cs.LG cs.DC 85%

Optimal Scheduling Algorithms for LLM Inference: Theory and Practice

LLM推理的最优调度算法:理论与实践

Agrim Bari, Parikshit Hegde, Gustavo de Veciana

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SLAI调度器,通过动态资源分配和实时测量优化LLM推理的吞吐量和延迟,减少TTFT并提高服务容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00119 2025-12-02 cs.CR cs.AI 85%

NetDeTox: Adversarial and Efficient Evasion of Hardware-Security GNNs via RL-LLM Orchestration

NetDeTox: 通过RL-LLM协同实现对硬件安全GNN的对抗性高效逃避

Zeng Wang, Minghao Shao, Akashdeep Saha, Ramesh Karri, Johann Knechtel, Muhammad Shafique, Ozgur Sinanoglu

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NetDeTox通过RL-LLM协同实现对硬件安全GNN的高效对抗性逃避,减少重写次数和面积开销,提升安全性方案的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01644 2025-12-02 cs.AR 85%

A Systematic Characterization of LLM Inference on GPUs

对GPU上LLM推理的系统性表征

Haonan Wang, Xuxin Xiao, Mingyu Yan, Zhuoyuan Zhu, Dengke Han, Duo Wang, Wenming Li, Xiaochun Ye, Cunchen Hu, Hongyang Chen, Guangyu Sun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统性分析,揭示了GPU上LLM推理的四维框架,包括异质性观察、微架构分析、系统扩展原则和新兴范式边界,为LLM推理提供了新的优化方向和理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00335 2025-12-02 cs.AR 85%

Efficient Kernel Mapping and Comprehensive System Evaluation of LLM Acceleration on a CGLA

高效内核映射与LLM加速在CGLA上的综合系统评估

Takuto Ando, Yu Eto, Ayumu Takeuchi, Yasuhiko Nakashima

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种非AI专用的CGLA加速器,通过高效内核映射和综合系统评估,展示了其在LLM推断中的高能效和性能-能耗折中优势。

Comments This paper is published at IEEE Access

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18583 2025-12-02 cs.LG cs.PF 83%

PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation

PARD:通过低成本并行草稿模型适应加速大语言模型推理

Zihao An, Huajun Bai, Ziqiong Liu, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PARD通过低成本并行草稿模型适应技术,显著提升大语言模型推理速度,实现3.67倍加速。

Comments Submitted for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10205 2025-12-02 cs.LG 82%

AWP: Activation-Aware Weight Pruning and Quantization with Projected Gradient Descent

AWP: 基于激活感知的权重剪枝与量化方法(投影梯度下降)

Jing Liu, Toshiaki Koike-Akino, Ye Wang, Hassan Mansour, Matthew Brand

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 AWP通过投影梯度下降方法实现激活感知的权重剪枝与量化,优于现有LLM压缩技术。

Comments ICML 2025 workshop on Efficient Systems for Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏