arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2508.17186 2025-12-15 cs.CV 78%

Advancing Weakly-Supervised Change Detection in Satellite Images via Adversarial Class Prompting

通过对抗性类别提示推进卫星图像弱监督变化检测

Zhenghui Zhao, Chen Wu, Di Wang, Hongruixuan Chen, Cuiqun Chen, Zhuo Zheng, Bo Du, Liangpei Zhang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(信息工程测绘遥感国家重点实验室,武汉大学) School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) Graduate School of Frontier Sciences, University of Tokyo(前沿科学研究院,东京大学) Institute of Geodesy and Photogrammetry, ETH Zürich(测绘学研究院,苏黎世联邦理工学院) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 提出对抗性类别提示方法,通过对抗性扰动和原型校正提升卫星图像弱监督变化检测性能。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09282 2025-12-11 cs.CV 78%

FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

FoundIR-v2:优化图像修复基础模型的预训练数据混合

Xiang Chen, Jinshan Pan, Jiangxin Dong, Jian Yang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 FoundIR-v2通过优化预训练数据混合比例,提升图像修复基础模型在多种任务中的泛化能力和性能。

Comments Project page: https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22143 2025-12-08 cs.CV 78%

3D Question Answering via only 2D Vision-Language Models

仅通过2D视觉-语言模型实现3D问答

Fengyun Wang, Sicheng Yu, Jiawei Wu, Jinhui Tang, Hanwang Zhang, Qianru Sun

机构 * Nanyang Technological University, Singapore Singapore Management University, Singapore National University of Singapore, Singapore Nanjing University of Science \& Technology, Nanjing, China

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出cdViews方法,通过仅使用2D视觉-语言模型,实现3D问答任务的高性能表现。

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02512 2025-12-04 cs.CV 78%

Two-Stage Vision Transformer for Image Restoration: Colorization Pretraining + Residual Upsampling

双阶段视觉Transformer用于图像恢复:颜色化预训练+残差上采样

Aditya Chaudhary, Prachet Dev Singh, Ankit Jha

机构 * LNMIIT(拉纳印度理工学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出双阶段视觉Transformer方法,通过颜色化预训练和残差上采样提升图像超分辨率性能,实现在DIV2K数据集上的高SSIM和PSNR指标。

Comments Accepted as a Tiny Paper at the 13th Indian Conference on Computer Vision, Graphics and Image Processing (ICVGIP 2025), IIT Mandi, India. 3 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00971 2025-12-02 cs.RO 78%

H-Zero: Cross-Humanoid Locomotion Pretraining Enables Few-shot Novel Embodiment Transfer

H-Zero:跨人形机器人运动预训练实现少样本新躯干转移

Yunfeng Lin, Minghuan Liu, Yufei Xue, Ming Zhou, Yong Yu, Jiangmiao Pang, Weinan Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 H-Zero通过跨人形机器人预训练实现少样本新躯干转移,提升机器人运动控制的通用性和效率。

Comments in submission, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00591 2025-12-02 cs.CR 78%

TrojanLoC: LLM-based Framework for RTL Trojan Localization

TrojanLoC: 基于LLM的RTL Trojan定位框架

Weihua Xiao, Zeng Wang, Minghao Shao, Raghu Vamshi Hemadri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel, Siddharth Garg, Ramesh Karri

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 TrojanLoC利用LLM直接从RTL代码生成嵌入,实现模块级和行级木马检测与定位,提升RTL级安全分析精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20455 2025-11-26 physics.flu-dyn 78%

Fluid Intelligence: A Forward Look on AI Foundation Models in Computational Fluid Dynamics

流体智力:计算流体动力学中人工智能基础模型的前瞻展望

Neil Ashton, Johannes Brandstetter, Siddhartha Mishra

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出首个结合CFD输入的缩放定律,用于数据生成和模型训练,以解决复杂流体动力学问题中的独特挑战,并提供了构建基础模型的计算成本和时间估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18599 2025-11-25 eess.SP 78%

Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus

利用语言模型对大规模语料库中叙述进行可解释性分析

Eric A. Bai, Minling Zhou, Ricardo Henao, Kyle M. Schwing, Lawrence Carin

专题命中 预训练与数据 :language model(title);LLM(abstract)

AI总结 本文提出一种结合词袋模型和LLM的问题回答模型,通过共享再生核希尔伯特空间表示,实现对大规模语料库中叙述的可解释性量化分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15311 2025-11-24 cs.CV 78%

Adapt-As-You-Walk Through the Clouds: Training-Free Online Test-Time Adaptation of 3D Vision-Language Foundation Models

在云中适应:无需训练的在线测试时适应3D视觉-语言基础模型

Mehran Tamjidi, Hamidreza Dastmalchi, Mohammadreza Alimoradijazi, Ali Cheraghian, Aijun An, Morteza Saberi

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 Uni-Adapter通过动态原型学习和熵加权聚合,在无需重新训练的情况下提升3D VLFMs在不同基准测试中的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27237 2025-11-21 cs.CV 78%

Fusion of Multi-scale Heterogeneous Pathology Foundation Models for Whole Slide Image Analysis

多尺度异构病理基础模型融合用于全切片图像分析

Zhidong Yang, Xiuhui Shi, Wei Ba, Zhigang Song, Haijing Luan, Taiyuan Hu, Senlin Lin, Jiguang Wang, Shaohua Kevin Zhou, Rui Yan

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生物医学工程学院) Division of Life Science, Department of Chemical and Biological Engineering, State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学生命科学系) SIAT-HKUST Joint Laboratory of Cell Evolution and Digital Health, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(深圳-香港联合创新研究院细胞进化与数字健康联合实验室) Department of Hepatobiliary Surgery, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院肝胆外科) Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu, China(中国科学技术大学苏州先进研究所) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou, Jiangsu, China(江苏省多模态数字孪生技术重点实验室) Key Laboratory of Precision and Intelligent Chemistry, USTC, Hefei, Anhui, China(中国科学技术大学精准与智能化学重点实验室) Department of Pathology, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院病理科)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出FuseCPath框架,通过多尺度异构病理基础模型融合提升全切片图像分析性能。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22242 2025-11-19 cs.CV 78%

4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration

Jiahui Zhang, Yurui Chen, Yueming Xu, Ze Huang, Yanpeng Zhou, Yu-Jie Yuan, Xinyue Cai, Guowei Huang, Xingyue Quan, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13150 2025-11-18 cs.CV 78%

Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification

Rifen Lin, Alex Jinpeng Wang, Jiawei Mo, Min Li

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05245 2025-11-10 cs.CV 78%

ADPretrain: Advancing Industrial Anomaly Detection via Anomaly Representation Pretraining

Xincheng Yao, Yan Luo, Zefeng Qian, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能MOE重点实验室) College of Artificial Intelligence, Nanjing Agricultural University(南京农业大学人工智能学院) Key Laboratory of Livestock Farming Equipment, Ministry of Agriculture and Rural Affairs, Nanjing Agricultural University(南京农业大学农业机械化关键实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07316 2025-11-10 cs.SD cs.MM eess.AS 78%

Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining

Rui Zhou, Akinori Ito, Takashi Nose

机构 * Graduate School of Engineering, Tohoku University(东大理工大学研究生院)

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23066 2025-10-28 cs.IR 78%

Multi-Stage Field Extraction of Financial Documents with OCR and Compact Vision-Language Models

Yichao Jin, Yushuo Wang, Qishuai Zhong, Kent Chiu Jin-Chun, Kenneth Zhu Ke, Donald MacDonald

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17884 2025-10-24 cs.CR 78%

PhantomLint: Principled Detection of Hidden LLM Prompts in Structured Documents

Toby Murray

专题命中 预训练与数据 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11540 2025-10-23 cs.CV 78%

Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation

Zhen Xu, Hongyu Zhou, Sida Peng, Haotong Lin, Haoyu Guo, Jiahao Shao, Peishan Yang, Qinglin Yang, Sheng Miao, Xingyi He, Yifan Wang, Yue Wang, Ruizhen Hu, Yiyi Liao, Xiaowei Zhou, Hujun Bao

专题命中 预训练与数据 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18244 2025-10-22 cs.CV 78%

BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining

Ajinkya Khoche, Gergő László Nagy, Maciej Wozniak, Thomas Gustafsson, Patric Jensfelt

机构 * KTH Royal Institute of Technology(皇家理工学院) Scania CV AB(斯堪尼亚公司)

专题命中 预训练与数据 :pretraining(title,abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17014 2025-10-21 cs.CV 78%

Do Satellite Tasks Need Special Pretraining?

Ani Vanyan, Alvard Barseghyan, Hakob Tamazyan, Tigran Galstyan, Vahan Huroyan, Naira Hovakimyan, Hrant Khachatrian

机构 * YerevaNN research lab and YSU(YerevaNN研究实验室和YSU) Saint Louis University(圣路易斯大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :pretraining(title);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04024 2025-10-07 cs.CV cs.MM 78%

Enhancing Fake News Video Detection via LLM-Driven Creative Process Simulation

Yuyan Bu, Qiang Sheng, Juan Cao, Shaofei Wang, Peng Qi, Yuhui Shi, Beizhe Hu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Media Synthesis and Forensics Lab(媒体合成与取证实验室) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(title,abstract)

Comments ACM CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00013 2025-10-02 physics.bio-ph 78%

ProTDyn: a foundation Protein language model for Thermodynamics and Dynamics generation

Yikai Liu, Haoyang Zheng, Lining Mao, Yanbin Wang, Ming Chen, Guang Lin

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10390 2025-09-30 cs.CV 78%

DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models

Shicheng Yin, Kaixuan Yin, Yang Liu, Weixing Chen, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :foundation model(title,abstract)

Comments Code is available at https://github.com/HCPLab-SYSU/DART

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16806 2025-09-23 cs.CV 78%

FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation

Fan Yang, Yousong Zhu, Xin Li, Yufei Zhan, Hongyin Zhao, Shurong Zheng, Yaowei Wang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Wuhan AI Research, Wuhan, China(武汉人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20271 2025-09-19 cs.LG cs.AI cs.CL 78%

Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models

Haoyu Tang, Ye Liu, Xi Zhao, Xukai Liu, Yanghai Zhang, Kai Zhang, Xiaofang Zhou, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12546 2025-09-17 cs.CV 78%

Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection

Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao

专题命中 预训练与数据 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12474 2025-09-17 cs.CV 78%

Image Tokenizer Needs Post-Training

Kai Qiu, Xiang Li, Hao Chen, Jason Kuen, Xiaohao Xu, Jiuxiang Gu, Yinyi Luo, Bhiksha Raj, Zhe Lin, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究) University of Michigan(密歇根大学)

专题命中 预训练与数据 :post-training(title,abstract)

Comments 21 pages, 16 figures, 10 tables. arXiv admin note: substantial text overlap with arXiv:2503.08354

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12193 2025-09-16 cs.CV 78%

Domain-Adaptive Pretraining Improves Primate Behavior Recognition

Felix B. Mueller, Timo Lueddecke, Richard Vogg, Alexander S. Ecker

机构 * Institute of Computer Science and Campus Institute Data Science, University of Göttingen(计算机科学研究所和校园数据科学研究所,哥廷根大学) Max Planck Institute for Dynamics and Self-Organization(动态与自组织Max Planck研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

Comments Oral at the CVPR 2025 Workshop CV4Animals

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08913 2025-09-12 eess.IV 78%

Generalized User-Oriented Image Semantic Coding Empowered by Large Vision-Language Model

Sin-Yu Huang, Vincent W. S. Wong

专题命中 预训练与数据 :language model(title,abstract)

Comments Accepted by IEEE Global Communications Conference (GLOBECOM), Taipei, Taiwan, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09822 2025-09-09 cs.CV 78%

Physical Autoregressive Model for Robotic Manipulation without Action Pretraining

Zijian Song, Sihan Qin, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 预训练与数据 :pretraining(title,abstract)

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10906 2025-09-09 cs.CV 78%

ShapeSplat: A Large-scale Dataset of Gaussian Splats and Their Self-Supervised Pretraining

Qi Ma, Yue Li, Bin Ren, Nicu Sebe, Ender Konukoglu, Theo Gevers, Luc Van Gool, Danda Pani Paudel

专题命中 预训练与数据 :pretraining(title,abstract)

Comments Accepted as 3DV'25 Oral, project page: https://unique1i.github.io/ShapeSplat_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏