arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2511.07957 2026-03-05 astro-ph.IM astro-ph.HE 82%

In-Orbit GRB Identification Using LLM-based model for the CXPD CubeSat

利用基于大语言模型的模型进行轨道上伽马射线暴识别

Cunshi Wang, Zuke Feng, Difan Yi, Yuyang Li, Lirong Xie, Huanbo Feng, Yi Liu, Qian Liu, Yang Huang, Hongbang Liu, Xinyu Qi, Yangheng Zheng, Ali Luo, Guirong Xue, Jifeng Liu

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的轨道上伽马射线暴识别方法,通过模拟数据训练模型,实现高精度分类和光谱指数估计,为未来轨道上实时GRB检测提供技术基础。

Comments 16 pages, 8 figures, accepted by RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV 82%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11910 2026-02-26 cs.CV 82%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06657 2026-02-26 cs.CV cs.AI cs.CL cs.LG 82%

Renaissance: Investigating the Pretraining of Vision-Language Encoders

文艺复兴:探究视觉语言编码器的预训练

Clayton Fields, Casey Kennington

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 文艺复兴通过元分析探究视觉语言编码器预训练的最佳实践,展示冻结大部分模型可节省计算资源,同时探讨基于视觉或文本模型构建变压器的影响。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00168 2026-02-18 cs.CV 82%

SSL4EO-S12 v1.1: A Multimodal, Multiseasonal Dataset for Pretraining, Updated

SSL4EO-S12 v1.1:一种用于预训练的多模态、多季节数据集,更新版

Benedikt Blumenstiel, Nassim Ait Ali Braham, Conrad M Albrecht, Stefano Maurogiovanni, Paolo Fraccaro

机构 * IBM Research Europe(IBM欧洲研究中心) German Aerospace Center(德国航空航天中心) Julich Supercomputing Centre University of Iceland(朱利奇超级计算中心爱沙尼亚大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 SSL4EO-S12 v1.1通过增加多模态数据和改进数据结构,为预训练大规模基础模型提供了更高效、更全面的地球观测数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00736 2026-02-16 cs.CV 82%

Unifying Multiple Foundation Models for Advanced Computational Pathology

统一多种基础模型以推进高级计算病理学

Wenhui Lei, Yusheng Tan, Anqi Li, Hanyu Chen, Hengrui Tian, Ruiying Li, Zhengqun Jiang, Fang Yan, Xiaofan Zhang, Shaoting Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Washington University in St. Louis(华盛顿大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) Shanghai Innovation Institute(上海创新研究院) Sensetime Research(商汤科技研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。

Comments 50 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02603 2026-02-11 eess.IV cs.CV 82%

EchoJEPA: A Latent Predictive Foundation Model for Echocardiography

EchoJEPA:一种用于超声心动图的潜在预测基础模型

Alif Munim, Adibvafa Fallahpour, Teodora Szasz, Ahmadreza Attarpour, River Jiang, Brana Sooriyakanthan, Maala Sooriyakanthan, Heather Whitney, Jeremy Slivnick, Barry Rubin, Wendy Tsang, Bo Wang

机构 * University Health Network(大学健康网络) University of Toronto(多伦多大学) University of Chicago(芝加哥大学) University of California, San Francisco(加州大学旧金山分校) Vector Institute(向量研究所) Cohere Labs(Cohere实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 EchoJEPA通过潜在预测方法在超声心动图中实现鲁棒且可推广的医学AI,显著提升心室功能和压力估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06973 2026-02-10 cs.CL cs.AI cs.LG 82%

Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models

视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题

Lucky Susanto, Musa Izzanardi Wijanarko, Khumaisa Nur'aini, Farid Adilazuarda, Alham Fikri Aji, Derry Tanti Wijaya

机构 * Monash University Indonesia(墨尔本大学印尼分校) MBZUAI Boston University(波士顿大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。

Comments Submitted to ARR January

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03269 2026-02-04 q-bio.NC 82%

Systematic review of self-supervised foundation models for brain network representation using electroencephalography

基于脑网络表示的自监督基础模型系统综述:使用脑电图

Hannah Portmann, Yosuke Morishima

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文综述了基于脑电图的自监督基础模型,探讨了其预训练方法、模型架构及下游任务应用,指出需更多多样化数据和标准化评估以提升模型通用性。

Comments 19 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01954 2026-02-03 cs.CV 82%

Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images

超越开放词汇:面向遥感图像的目标检测多模态提示

Shuai Yang, Ziyue Huang, Jiaxin Chen, Qingjie Liu, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,中国)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract)

AI总结 RS-MPOD提出了一种多模态开放词汇检测框架,通过整合视觉和文本提示提升遥感图像中目标检测的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00604 2026-02-03 cs.SD eess.AS 82%

The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels

TMU系统用于XACLE挑战:利用CLAP伪标签训练大型音频语言模型

Ayuto Tsutsumi, Kohei Tanaka, Sayaka Shiota

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 TMU系统通过CLAP伪标签预训练,在XACLE挑战中实现0.632的SRCC成绩,优于基线系统并获得第三名。

Comments 3 pages; 2 figures; 2 tables; Accepted at ICASSP 2026 Workshop (SP Grand Challenges, GC-12: XACLE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23090 2026-02-02 cs.CE q-bio.QM 82%

Omni-fMRI: A Universal Atlas-Free fMRI Foundation Model

Omni-fMRI:一种无图谱的fMRI基础模型

Mo Wang, Wenhao Ye, Junfeng Xia, Junxiang Zhang, Xuanye Pan, Minghao Xu, Haotian Deng, Hongkai Wen, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 Omni-fMRI提出了一种无需图谱的fMRI基础模型,通过动态拼接机制实现高效预训练,提升了脑表示学习的可扩展性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21631 2026-01-30 cs.CY 82%

Turning Language Model Training from Black Box into a Sandbox

将语言模型训练从黑箱转变为沙盒

Nicolas Pope, Matti Tedre

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract)

AI总结 通过让学生直接训练语言模型,研究发现可视化训练过程能显著提升学生对AI数据驱动本质的理解。

Comments 4 pages, 2 figures, WIP, accepted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16451 2026-01-26 cs.CV 82%

VISTA-PATH: An interactive foundation model for pathology image segmentation and quantitative analysis in computational pathology

VISTA-PATH: 一种交互式的基础模型用于计算病理学中病理图像分割和定量分析

Peixian Liang, Songhao Li, Shunsuke Koga, Yutong Li, Zahra Alipour, Yucheng Tang, Daguang Xu, Zhi Huang

机构 * Department of Pathology and Laboratory Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学) Department of Electrical and System Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学) Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(生物医学工程系,佐治亚理工学院和埃默里大学) NVIDIA Corporation(NVIDIA公司) Department of Biostatistics, Epidemiology and Informatics, University of Pennsylvania(生物统计学、流行病学与信息学系,宾夕法尼亚大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 VISTA-PATH是一种交互式基础模型,通过整合专家反馈和多类分割,提升病理图像分割的临床应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09954 2026-01-26 cs.CV 82%

The Spatial Blindspot of Vision-Language Models

视觉-语言模型的空间盲区

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A, Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。

Comments Work done as part of the EleutherAI SOAR Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21184 2026-01-23 cs.LG cs.AI cs.CL 82%

Can Language Models Discover Scaling Laws?

语言模型能否发现扩展定律?

Haowei Lin, Haotian Ye, Wenzheng Feng, Quzhe Huang, Yujun Li, Hubert Lim, Zhengrui Li, Xiangyu Wang, Jianzhu Ma, Yitao Liang, James Zou

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SLDAgent,一种基于进化的代理,能够自动发现比人类衍生定律更准确的扩展定律,展示了AI在科学发现中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14765 2026-01-21 cs.CV 82%

Scaling Laws for Geospatial Foundation Models: A case study on PhilEO Bench

地理空间基础模型的扩展规律:以PhilEO基准测试为例

Nikolaos Dionelis, Riccardo Musto, Jente Bosmans, Simone Sarti, Giancarlo Paoletti, Peter Naylor, Valerio Marsocci, Sébastien Lefèvre, Bertrand Le Saux, Nicolas Longépé

机构 * 1. European Space Agency (ESA), -lab. 2. Leonardo Labs, Italy. 3. VITO. 4. IRISA, Université Bretagne Sud. 5. European Commission (EC)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文研究地理空间基础模型的扩展规律,通过不同数据集和架构的实验,发现CNN在低样本下表现优异,ViT-UPerNet在大规模数据上表现最佳,Mamba模型展现出效率优势但需进一步训练。

Comments 11 pages, 12 figures, 3 tables, Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20876 2026-01-13 cs.RO 82%

Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task

本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用

Kanata Suzuki, Shota Shimizu, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract)

AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14373 2026-01-13 cs.CL cs.AI cs.LG 82%

TURNA: A Turkish Encoder-Decoder Language Model for Enhanced Understanding and Generation

TURNA:一种用于增强理解和生成的土耳其编码器-解码器语言模型

Gökçe Uludoğan, Zeynep Yirmibeşoğlu Balal, Furkan Akkurt, Melikşah Türker, Onur Güngör, Susan Üsküdarlı

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TURNA是一种专为土耳其语设计的编码器-解码器语言模型,通过预训练在低资源环境下实现了对自然语言理解和生成任务的提升。

Journal ref Findings of the Association for Computational Linguistics: ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09779 2026-01-09 cs.CV 82%

MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models

MoIIE:多模态专家的混合模型用于大视觉语言模型

Dianyi Wang, Siyuan Wang, Zejun Li, Yikun Wang, Yitong Li, Duyu Tang, Xiaoyu Shen, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institut(上海创新研究院) University of Southern California(南加州大学) Huawei Technologies Co., Ltd(华为技术有限公司) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract)

AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02671 2026-01-07 cs.CL cs.AI cs.LG 82%

Extracting books from production language models

从生产语言模型中提取书籍

Ahmed Ahmed, A. Feder Cooper, Sanmi Koyejo, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过两阶段方法测试从生产LLM中提取书籍的可行性,发现部分模型可提取受版权保护文本,但需不同劫持策略,揭示生产LLM存在训练数据泄露风险。

Comments We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13891 2025-12-24 cs.CV 82%

Weakly Supervised Ephemeral Gully Detection In Remote Sensing Images Using Vision Language Models

基于视觉语言模型的弱监督瞬时沟壑遥感图像检测

Seyed Mohamad Ali Tousi, Ramy Farag, John A. Lory, G. N. DeSouza

机构 * Vision Guided and Intelligent Robotics Laboratory (ViGIR)(视觉引导与智能机器人实验室) EECS Dept.(电子工程与计算机科学系) Division of Plant Science and Technology(植物科学与技术系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文提出基于视觉语言模型的弱监督瞬时沟壑检测方法,通过半监督学习和噪声感知损失函数提升遥感图像检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10581 2025-12-23 cs.GR 82%

GraphTracer: Graph-Guided Failure Tracing in LLM Agents for Robust Multi-Turn Deep Search

GraphTracer: LLM代理中基于图的故障追踪以实现鲁棒多轮深度搜索

Heng Zhang, Yuling Shi, Xiaodong Gu, Haochen You, Zijian Zhang, Lubin Gan, Yilei Yuan, Jin Huang

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 GraphTracer通过信息流分析和依赖图构建,提升多代理系统在多轮深度搜索中的故障归因准确性与鲁棒性。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17817 2025-12-23 cs.CV 82%

Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding

Chorus:多教师预训练用于整体3D高斯场景编码

Yue Li, Qi Ma, Runyi Yang, Mengjiao Ma, Bin Ren, Nikola Popovic, Nicu Sebe, Theo Gevers, Luc Van Gool, Danda Pani Paudel, Martin R. Oswald

机构 * University of Amsterdam(阿姆斯特丹大学) ETH Zürich(苏黎世联邦理工学院) University of Trento(特伦托大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 Chorus通过多教师预训练方法,实现对3D高斯场景的高效编码,提升多任务表现并实现数据高效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17224 2025-12-22 cs.CV 82%

Any-Optical-Model: A Universal Foundation Model for Optical Remote Sensing

Any-Optical-Model: 一种通用的光学遥感基础模型

Xuyang Li, Chenyu Li, Danfeng Hong

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 Any-Optical-Model提出了一种通用的光学遥感基础模型,能够适应任意波段配置、传感器类型和分辨率尺度,通过多尺度自适应补丁嵌入和语义对齐机制实现光谱-空间关系建模,有效提升遥感任务的泛化能力和实际应用性能。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15862 2025-12-19 hep-ph 82%

Reusable theory representations for colliders: a demonstrator SMEFT foundation model

可重用的理论表示用于对撞机:SMEFT基础模型的演示

Supratim Das Bakshi, T. J. Hobbs, Brandon Kriesten

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究提出了一种基于对比表示的SMEFT基础模型,用于高能对撞机中对新物理的探索,通过训练编码器网络生成低维潜在流形,以捕捉SMEFT引起的Drell-Yan光谱变形的几何结构。

Comments 39 pages, 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21123 2025-12-17 cs.CR 82%

ExpShield: Safeguarding Web Text from Unauthorized Crawling and LLM Exploitation

ExpShield: 保护网络文本免受未经授权的爬虫和大语言模型利用

Ruixuan Liu, Toan Tran, Tianhao Wang, Hongsheng Hu, Shuo Wang, Li Xiong

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 ExpShield通过不可见扰动减轻大语言模型对网络文本的记忆化,同时保持可读性,并通过实例利用指标和优化方法有效防御数据泄露风险。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 82%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07452 2025-12-09 cs.IR 82%

From Show Programmes to Data: Designing a Workflow to Make Performing Arts Ephemera Accessible Through Language Models

从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问

Clarisse Bardiot, Pierre-Carl Langlais, Bernard Jacquemin, Jacob Hart, Antonios Lagarias, Nicolas Foucault, Aurélie Lemaître-Legargeant, Jeanne Fras

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。

Comments 19 pages, 8 figures, 5 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05127 2025-12-04 eess.IV cs.CV q-bio.QM 82%

PixCell: A generative foundation model for digital histopathology images

PixCell:数字病理图像的生成基础模型

Srikar Yellapragada, Alexandros Graikos, Zilinghan Li, Kostas Triaridis, Varun Belagali, Tarak Nath Nandi, Karen Bai, Beatrice S. Knudsen, Tahsin Kurc, Rajarsi R. Gupta, Prateek Prasanna, Ravi K Madduri, Joel Saltz, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Argonne National Laboratory(阿贡国家实验室) The University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 PixCell是首个针对数字病理图像的生成基础模型,通过扩散模型在大规模数据集上训练,实现隐私保护的数据生成和虚拟染色任务,提升病理学研究效率。

Comments Project page - https://histodiffusion.github.io/docs/projects/pixcell

详情

展开后加载摘要…

URL PDF HTML 收藏