arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2412.16148 2026-01-15 cs.CV 78%

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练

Mingliang Liang, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) Radboud University(拉德堡德大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08106 2026-01-08 cs.CV 78%

Generalized Logit Adjustment: Calibrating Fine-tuned Models by Removing Label Bias in Foundation Models

广义对数调整:通过消除基础模型中的标签偏见来校准微调模型

Beier Zhu, Kaihua Tang, Qianru Sun, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出广义对数调整方法,通过消除基础模型中的标签偏见,提升多种任务的性能。

Comments Accepted by NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22856 2025-12-30 quant-ph 78%

Benchmarking Lie-Algebraic Pretraining and Non-Variational QWOA for the MaxCut Problem

对MaxCut问题中Lie-代数预训练和非变分QWOA的基准测试

Matthaus Zering, Jolyon Joyce, Tal Gurfinkel, Jingbo Wang

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过对比Lie-代数预训练和非变分QWOA在MaxCut问题上的表现,证明后者在参数空间小的情况下能更高效地找到近优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18850 2025-12-30 cs.RO 78%

InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement

InDRiVE: 通过潜在分歧进行无奖励世界模型预训练以实现自动驾驶

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学-迪尔伯恩分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 InDRiVE通过潜在分歧进行无奖励世界模型预训练,提升了自动驾驶在零样本迁移和少量样本适应中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18803 2025-12-23 cs.CY cs.MA 78%

Quantifying the Lifelong Impact of Resilience Interventions via Agent-Based LLM Simulation

通过基于代理的LLM模拟量化韧性干预的终身影响

Vivienne L'Ecuyer Ming

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出LALS框架,通过基于代理的LLM模拟量化韧性干预的终身影响,揭示早期干预对财富积累的显著正向作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15781 2025-12-19 cs.CR 78%

Detecting Malicious Entra OAuth Apps with LLM-Based Permission Risk Scoring

基于LLM的权限风险评分检测恶意Entra OAuth应用

Ashim Mahara

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 本文提出基于LLM的权限风险评分方法,用于实时检测恶意Entra OAuth应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02498 2025-12-18 cs.CV 78%

dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model

dots.ocr: 一种单一视觉-语言模型中的多语言文档布局解析

Yumeng Li, Guang Yang, Hao Liu, Bowen Wang, Colin Zhang

机构 * hi lab(hi实验室) Xiaohongshu Inc(小红书公司)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 dots_ocr是一种单一视觉-语言模型,通过联合学习多语言文档布局解析的三个核心任务,实现了统一框架下的高效性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17186 2025-12-15 cs.CV 78%

Advancing Weakly-Supervised Change Detection in Satellite Images via Adversarial Class Prompting

通过对抗性类别提示推进卫星图像弱监督变化检测

Zhenghui Zhao, Chen Wu, Di Wang, Hongruixuan Chen, Cuiqun Chen, Zhuo Zheng, Bo Du, Liangpei Zhang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(信息工程测绘遥感国家重点实验室,武汉大学) School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) Graduate School of Frontier Sciences, University of Tokyo(前沿科学研究院,东京大学) Institute of Geodesy and Photogrammetry, ETH Zürich(测绘学研究院,苏黎世联邦理工学院) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 提出对抗性类别提示方法,通过对抗性扰动和原型校正提升卫星图像弱监督变化检测性能。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09282 2025-12-11 cs.CV 78%

FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

FoundIR-v2:优化图像修复基础模型的预训练数据混合

Xiang Chen, Jinshan Pan, Jiangxin Dong, Jian Yang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 FoundIR-v2通过优化预训练数据混合比例,提升图像修复基础模型在多种任务中的泛化能力和性能。

Comments Project page: https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22143 2025-12-08 cs.CV 78%

3D Question Answering via only 2D Vision-Language Models

仅通过2D视觉-语言模型实现3D问答

Fengyun Wang, Sicheng Yu, Jiawei Wu, Jinhui Tang, Hanwang Zhang, Qianru Sun

机构 * Nanyang Technological University, Singapore Singapore Management University, Singapore National University of Singapore, Singapore Nanjing University of Science \& Technology, Nanjing, China

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出cdViews方法,通过仅使用2D视觉-语言模型,实现3D问答任务的高性能表现。

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02512 2025-12-04 cs.CV 78%

Two-Stage Vision Transformer for Image Restoration: Colorization Pretraining + Residual Upsampling

双阶段视觉Transformer用于图像恢复:颜色化预训练+残差上采样

Aditya Chaudhary, Prachet Dev Singh, Ankit Jha

机构 * LNMIIT(拉纳印度理工学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出双阶段视觉Transformer方法,通过颜色化预训练和残差上采样提升图像超分辨率性能,实现在DIV2K数据集上的高SSIM和PSNR指标。

Comments Accepted as a Tiny Paper at the 13th Indian Conference on Computer Vision, Graphics and Image Processing (ICVGIP 2025), IIT Mandi, India. 3 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00971 2025-12-02 cs.RO 78%

H-Zero: Cross-Humanoid Locomotion Pretraining Enables Few-shot Novel Embodiment Transfer

H-Zero:跨人形机器人运动预训练实现少样本新躯干转移

Yunfeng Lin, Minghuan Liu, Yufei Xue, Ming Zhou, Yong Yu, Jiangmiao Pang, Weinan Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 H-Zero通过跨人形机器人预训练实现少样本新躯干转移,提升机器人运动控制的通用性和效率。

Comments in submission, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00591 2025-12-02 cs.CR 78%

TrojanLoC: LLM-based Framework for RTL Trojan Localization

TrojanLoC: 基于LLM的RTL Trojan定位框架

Weihua Xiao, Zeng Wang, Minghao Shao, Raghu Vamshi Hemadri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel, Siddharth Garg, Ramesh Karri

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 TrojanLoC利用LLM直接从RTL代码生成嵌入,实现模块级和行级木马检测与定位,提升RTL级安全分析精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20455 2025-11-26 physics.flu-dyn 78%

Fluid Intelligence: A Forward Look on AI Foundation Models in Computational Fluid Dynamics

流体智力:计算流体动力学中人工智能基础模型的前瞻展望

Neil Ashton, Johannes Brandstetter, Siddhartha Mishra

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出首个结合CFD输入的缩放定律,用于数据生成和模型训练,以解决复杂流体动力学问题中的独特挑战,并提供了构建基础模型的计算成本和时间估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18599 2025-11-25 eess.SP 78%

Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus

利用语言模型对大规模语料库中叙述进行可解释性分析

Eric A. Bai, Minling Zhou, Ricardo Henao, Kyle M. Schwing, Lawrence Carin

专题命中 预训练与数据 :language model(title);LLM(abstract)

AI总结 本文提出一种结合词袋模型和LLM的问题回答模型,通过共享再生核希尔伯特空间表示,实现对大规模语料库中叙述的可解释性量化分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15311 2025-11-24 cs.CV 78%

Adapt-As-You-Walk Through the Clouds: Training-Free Online Test-Time Adaptation of 3D Vision-Language Foundation Models

在云中适应:无需训练的在线测试时适应3D视觉-语言基础模型

Mehran Tamjidi, Hamidreza Dastmalchi, Mohammadreza Alimoradijazi, Ali Cheraghian, Aijun An, Morteza Saberi

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 Uni-Adapter通过动态原型学习和熵加权聚合,在无需重新训练的情况下提升3D VLFMs在不同基准测试中的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27237 2025-11-21 cs.CV 78%

Fusion of Multi-scale Heterogeneous Pathology Foundation Models for Whole Slide Image Analysis

多尺度异构病理基础模型融合用于全切片图像分析

Zhidong Yang, Xiuhui Shi, Wei Ba, Zhigang Song, Haijing Luan, Taiyuan Hu, Senlin Lin, Jiguang Wang, Shaohua Kevin Zhou, Rui Yan

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生物医学工程学院) Division of Life Science, Department of Chemical and Biological Engineering, State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学生命科学系) SIAT-HKUST Joint Laboratory of Cell Evolution and Digital Health, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(深圳-香港联合创新研究院细胞进化与数字健康联合实验室) Department of Hepatobiliary Surgery, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院肝胆外科) Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu, China(中国科学技术大学苏州先进研究所) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou, Jiangsu, China(江苏省多模态数字孪生技术重点实验室) Key Laboratory of Precision and Intelligent Chemistry, USTC, Hefei, Anhui, China(中国科学技术大学精准与智能化学重点实验室) Department of Pathology, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院病理科)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出FuseCPath框架,通过多尺度异构病理基础模型融合提升全切片图像分析性能。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22242 2025-11-19 cs.CV 78%

4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration

Jiahui Zhang, Yurui Chen, Yueming Xu, Ze Huang, Yanpeng Zhou, Yu-Jie Yuan, Xinyue Cai, Guowei Huang, Xingyue Quan, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13150 2025-11-18 cs.CV 78%

Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification

Rifen Lin, Alex Jinpeng Wang, Jiawei Mo, Min Li

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05245 2025-11-10 cs.CV 78%

ADPretrain: Advancing Industrial Anomaly Detection via Anomaly Representation Pretraining

Xincheng Yao, Yan Luo, Zefeng Qian, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能MOE重点实验室) College of Artificial Intelligence, Nanjing Agricultural University(南京农业大学人工智能学院) Key Laboratory of Livestock Farming Equipment, Ministry of Agriculture and Rural Affairs, Nanjing Agricultural University(南京农业大学农业机械化关键实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07316 2025-11-10 cs.SD cs.MM eess.AS 78%

Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining

Rui Zhou, Akinori Ito, Takashi Nose

机构 * Graduate School of Engineering, Tohoku University(东大理工大学研究生院)

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23066 2025-10-28 cs.IR 78%

Multi-Stage Field Extraction of Financial Documents with OCR and Compact Vision-Language Models

Yichao Jin, Yushuo Wang, Qishuai Zhong, Kent Chiu Jin-Chun, Kenneth Zhu Ke, Donald MacDonald

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17884 2025-10-24 cs.CR 78%

PhantomLint: Principled Detection of Hidden LLM Prompts in Structured Documents

Toby Murray

专题命中 预训练与数据 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11540 2025-10-23 cs.CV 78%

Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation

Zhen Xu, Hongyu Zhou, Sida Peng, Haotong Lin, Haoyu Guo, Jiahao Shao, Peishan Yang, Qinglin Yang, Sheng Miao, Xingyi He, Yifan Wang, Yue Wang, Ruizhen Hu, Yiyi Liao, Xiaowei Zhou, Hujun Bao

专题命中 预训练与数据 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18244 2025-10-22 cs.CV 78%

BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining

Ajinkya Khoche, Gergő László Nagy, Maciej Wozniak, Thomas Gustafsson, Patric Jensfelt

机构 * KTH Royal Institute of Technology(皇家理工学院) Scania CV AB(斯堪尼亚公司)

专题命中 预训练与数据 :pretraining(title,abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17014 2025-10-21 cs.CV 78%

Do Satellite Tasks Need Special Pretraining?

Ani Vanyan, Alvard Barseghyan, Hakob Tamazyan, Tigran Galstyan, Vahan Huroyan, Naira Hovakimyan, Hrant Khachatrian

机构 * YerevaNN research lab and YSU(YerevaNN研究实验室和YSU) Saint Louis University(圣路易斯大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :pretraining(title);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04024 2025-10-07 cs.CV cs.MM 78%

Enhancing Fake News Video Detection via LLM-Driven Creative Process Simulation

Yuyan Bu, Qiang Sheng, Juan Cao, Shaofei Wang, Peng Qi, Yuhui Shi, Beizhe Hu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Media Synthesis and Forensics Lab(媒体合成与取证实验室) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(title,abstract)

Comments ACM CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00013 2025-10-02 physics.bio-ph 78%

ProTDyn: a foundation Protein language model for Thermodynamics and Dynamics generation

Yikai Liu, Haoyang Zheng, Lining Mao, Yanbin Wang, Ming Chen, Guang Lin

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10390 2025-09-30 cs.CV 78%

DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models

Shicheng Yin, Kaixuan Yin, Yang Liu, Weixing Chen, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :foundation model(title,abstract)

Comments Code is available at https://github.com/HCPLab-SYSU/DART

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16806 2025-09-23 cs.CV 78%

FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation

Fan Yang, Yousong Zhu, Xin Li, Yufei Zhan, Hongyin Zhao, Shurong Zheng, Yaowei Wang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Wuhan AI Research, Wuhan, China(武汉人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏