arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2511.15967 2025-11-21 cs.CV 71%

InfoCLIP: Bridging Vision-Language Pretraining and Open-Vocabulary Semantic Segmentation via Information-Theoretic Alignment Transfer

InfoCLIP: 通过信息论对齐转移连接视觉语言预训练与开放词汇语义分割

Muyao Yuan, Yuanhong Zhang, Weizhan Zhang, Lan Ma, Yuan Gao, Jiangyong Ying, Yudeng Xin

专题命中 预训练与数据 :pretraining(title)

AI总结 InfoCLIP通过信息论对齐转移提升开放词汇语义分割的性能,有效解决预训练CLIP在微调过程中的过拟合问题。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14270 2025-11-11 cs.CV cs.GR 71%

GauSSmart: Enhanced 3D Reconstruction through 2D Foundation Models and Geometric Filtering

Alexander Valverde, Brian Xu, Yuyin Zhou, Meng Xu, Hongyun Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Brown University(布朗大学) Kean University(凯恩大学)

专题命中 预训练与数据 :foundation model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04426 2025-11-07 cs.CV 71%

HideAndSeg: an AI-based tool with automated prompting for octopus segmentation in natural habitats

Alan de Aguiar, Michaella Pereira Andrade, Charles Morphy D. Santos, João Paulo Gois

机构 * Universidade Federal do ABC (UFABC)(巴西圣安德烈大学联邦ABC分校)

专题命中 预训练与数据 :prompting(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08054 2025-10-13 cs.CV 71%

RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models

Moon Ye-Bin, Roy Miles, Tae-Hyun Oh, Ismail Elezi, Jiankang Deng

机构 * POSTECH Huawei London Research Center(华为伦敦研究中心) KAIST(韩国科学技术院) Imperial College London(伦敦帝国理工学院)

专题命中 预训练与数据 :language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08586 2025-09-11 eess.IV cs.CV 71%

CNN-ViT Hybrid for Pneumonia Detection: Theory and Empiric on Limited Data without Pretraining

Prashant Singh Basnet, Roshan Chitrakar

机构 * The British College, Keele University(凯利大学英国学院) Nepal College of Information Technology, Pokhara University(尼泊尔信息技术学院,波克拉大学)

专题命中 预训练与数据 :pretraining(title)

Comments 8 pages, 5 Tables, 5 Figures. Manuscript submitted to ICOIICS 2025 Conference. Currently, under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01550 2025-09-04 cs.SE 71%

RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale

Zhilong Chen, Chengzong Zhao, Boyuan Chen, Dayi Lin, Yihao Chen, Arthur Leung, Gopi Krishnan Rajbahadur, Gustavo A. Oliva, Haoxiang Zhang, Aaditya Bhatia, Chong Chun Yong, Ahmed E. Hassan

专题命中 预训练与数据 :SFT(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21960 2025-07-30 cs.CV 71%

PanoSplatt3R: Leveraging Perspective Pretraining for Generalized Unposed Wide-Baseline Panorama Reconstruction

Jiahui Ren, Mochu Xiang, Jiajun Zhu, Yuchao Dai

机构 * School of Electronics and Information, Northwestern Polytechnical University and Shaanxi Key Laboratory of Information Acquisition and Processing(电子工程学院、西北工业大学和陕西省信息获取与处理重点实验室)

专题命中 预训练与数据 :pretraining(title)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03474 2025-07-01 cs.CV 71%

Multi-encoder nnU-Net outperforms transformer models with self-supervised pretraining

Seyedeh Sahar Taheri Otaghsara, Reza Rahmanzadeh

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17837 2025-06-24 cs.CV 71%

Time-Contrastive Pretraining for In-Context Image and Video Segmentation

Assefa Wahd, Jacob Jaremko, Abhilash Hareendranathan

机构 * Department of Radiology(放射科部门)

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11241 2025-06-19 cs.CV 71%

CooPre: Cooperative Pretraining for V2X Cooperative Perception

Seth Z. Zhao, Hao Xiang, Chenfeng Xu, Xin Xia, Bolei Zhou, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13455 2025-06-17 eess.AS cs.SD 71%

Stereo sound event localization and detection based on PSELDnet pretraining and BiMamba sequence modeling

Wenmiao Gao, Yang Xiao

专题命中 预训练与数据 :pretraining(title)

Comments Technical report for DCASE 2025 Challenge Task 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18052 2025-06-04 cs.CV 71%

SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining

Yue Li, Qi Ma, Runyi Yang, Huapeng Li, Mengjiao Ma, Bin Ren, Nikola Popovic, Nicu Sebe, Ender Konukoglu, Theo Gevers, Luc Van Gool, Martin R. Oswald, Danda Pani Paudel

机构 * University of Amsterdam(阿姆斯特丹大学) Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) INSAIT, Sofia University ”St. Kliment Ohridski”(索菲亚大学”圣克莱门特·欧赫里迪斯”研究所) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) University of Pisa(比萨大学) University of Trento(特伦特大学)

专题命中 预训练与数据 :pretraining(title)

Comments Our code, model, and dataset will be released at https://unique1i.github.io/SceneSplat_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24282 2025-06-02 cs.CV 71%

LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization

Zirui Shang, Xinxiao Wu, Shuo Yang

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology(北京智能信息科技重点实验室,计算机科学与技术学院) Beijing Institute of Technology(北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing(广东机器感知与智能计算实验室) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 预训练与数据 :LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10847 2025-05-23 cs.CV 71%

Enhancement-Driven Pretraining for Robust Fingerprint Representation Learning

Ekta Gavas, Kaustubh Olpadkar, Anoop Namboodiri

机构 * Centre for Visual Information Technology, International Institute of Information Technology, Hyderabad, India(视觉信息技术中心,国际信息学院,印度海得拉巴) Stony Brook University, USA(石溪大学)

专题命中 预训练与数据 :pretraining(title)

Comments 8 pages, 4 figures, Accepted at 19th VISIGRAPP 2024: VISAPP conference

Journal ref Proceedings of the 19th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISIGRAPP 2024) - Volume 2: VISAPP, ISBN 978-989-758-679-8, ISSN 2184-4321, pages 821-828

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22357 2025-03-31 cs.CV 71%

EchoFlow: A Foundation Model for Cardiac Ultrasound Image and Video Generation

Hadrien Reynaud, Alberto Gomez, Paul Leeson, Qingjie Meng, Bernhard Kainz

专题命中 预训练与数据 :foundation model(title)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15639 2025-03-14 cs.RO 71%

Low Fidelity Visuo-Tactile Pretraining Improves Vision-Only Manipulation Performance

Selam Gano, Abraham George, Amir Barati Farimani

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00412 2025-03-12 cs.CV 71%

TROI: Cross-Subject Pretraining with Sparse Voxel Selection for Enhanced fMRI Visual Decoding

Ziyu Wang, Tengyu Pan, Zhenyu Li, Ji Wu, Xiuxing Li, Jianyong Wang

专题命中 预训练与数据 :pretraining(title)

Comments ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03752 2025-03-07 cs.CY 71%

Multimodal Generative AI and Foundation Models for Behavioural Health in Online Gambling

Konrad Samsel, Mohammad Noaeen, Neil Seeman, Karim Keshavjee, Li-Jia Li, Zahra Shakeri

专题命中 预训练与数据 :foundation model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04896 2025-02-11 cs.CV 71%

Goku: Flow Based Video Generative Foundation Models

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

专题命中 预训练与数据 :foundation model(title)

Comments Demo: https://saiyan-world.github.io/goku/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06660 2025-01-14 cs.CV cs.RO 71%

MapGS: Generalizable Pretraining and Data Augmentation for Online Mapping via Novel View Synthesis

Hengyuan Zhang, David Paz, Yuliang Guo, Xinyu Huang, Henrik I. Christensen, Liu Ren

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03491 2024-11-07 cs.CV 71%

An Application-Agnostic Automatic Target Recognition System Using Vision Language Models

Anthony Palladino, Dana Gajewski, Abigail Aronica, Patryk Deptula, Alexander Hamme, Seiyoung C. Lee, Jeff Muri, Todd Nelling, Michael A. Riley, Brian Wong, Margaret Duff

专题命中 预训练与数据 :language model(title)

Comments Accepted to the Thirty-Seventh Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18147 2024-10-25 cs.CV 71%

SSP-RACL: Classification of Noisy Fundus Images with Self-Supervised Pretraining and Robust Adaptive Credal Loss

Mengwen Ye, Yingzi Huangfu, You Li, Zekuan Yu

专题命中 预训练与数据 :pretraining(title)

Comments IEEE BioCAS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15745 2024-09-25 eess.IV cs.CV 71%

ManiNeg: Manifestation-guided Multimodal Pretraining for Mammography Classification

Xujun Li, Xin Wei, Jing Jiang, Danxiang Chen, Wei Zhang, Jinpeng Li

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11638 2024-08-22 eess.AS 71%

Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining

Jonathan Greif, Florian Schmid, Paul Primus, Gerhard Widmer

专题命中 预训练与数据 :pretraining(title)

Comments Accepted to the DCASE Workshop 2024. Source code available: https://github.com/Jonathan-Greif/QBV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08961 2024-07-15 eess.IV cs.CV 71%

Tissue-Contrastive Semi-Masked Autoencoders for Segmentation Pretraining on Chest CT

Jie Zheng, Ru Wen, Haiqin Hu, Lina Wei, Kui Su, Wei Chen, Chen Liu, Jun Wang

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12730 2024-03-27 cs.CV 71%

A Closer Look at the Few-Shot Adaptation of Large Vision-Language Models

Julio Silva-Rodríguez, Sina Hajimiri, Ismail Ben Ayed, Jose Dolz

专题命中 预训练与数据 :language model(title)

Comments CVPR 2024. Code: https://github.com/jusiro/CLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13064 2024-03-21 cs.CV 71%

SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model

Armen Avetisyan, Christopher Xie, Henry Howard-Jenkins, Tsun-Yi Yang, Samir Aroudj, Suvam Patra, Fuyang Zhang, Duncan Frost, Luke Holland, Campbell Orme, Jakob Engel, Edward Miller, Richard Newcombe, Vasileios Balntas

专题命中 预训练与数据 :language model(title)

Comments see project page, https://projectaria.com/scenescript

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11440 2024-03-19 cs.CV 71%

Boosting Continuous Emotion Recognition with Self-Pretraining using Masked Autoencoders, Temporal Convolutional Networks, and Transformers

Weiwei Zhou, Jiada Lu, Chenkun Ling, Weifeng Wang, Shaowei Liu

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00385 2024-03-19 eess.IV cs.CV 71%

Cross-Shaped Windows Transformer with Self-supervised Pretraining for Clinically Significant Prostate Cancer Detection in Bi-parametric MRI

Yuheng Li, Jacob Wynne, Jing Wang, Richard L. J. Qiu, Justin Roper, Shaoyan Pan, Ashesh B. Jani, Tian Liu, Pretesh R. Patel, Hui Mao, Xiaofeng Yang

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16648 2023-12-29 cs.RO cs.CV 71%

LIP-Loc: LiDAR Image Pretraining for Cross-Modal Localization

Sai Shubodh Puligilla, Mohammad Omama, Husain Zaidi, Udit Singh Parihar, Madhava Krishna

专题命中 预训练与数据 :pretraining(title)

Comments To be presented at WACV-W 2024. Project page: https://shubodhs.ai/liploc

详情

展开后加载摘要…

URL PDF HTML 收藏