arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 804 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 804 篇

2607.28796 2026-08-03 cs.CV 新提交 50%

Can Synthetic Data Overcome the Generalization Limits of AI-Based Flower and Pod Detection Across Cowpea Breeding Genotypes and Environments?

合成数据能否克服基于AI的豇豆花与荚果检测在不同育种基因型及环境下的泛化极限?

Hamid Kamangir, Jonathan Berlingeri, Earl Ranario, Isaac Kazuo Uyehara, Lars Lundqvist, Heesup Yun, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究针对AI豇豆花荚检测在不同基因型环境下泛化差的问题,发现优化的HDR合成数据仅需少量真实图像即可达到真实数据基线性能,证实合成数据可克服该检测的泛化极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 50%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 50%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28251 2026-07-31 eess.SY cs.SY 新提交 50%

Self-Evolving Learning for Embodied AI with Criticality Model

基于临界模型的具身智能自进化学习

Linxuan He, Yuying Tian, Lingxiang Fan, Jiaqi Pi, Yinqiao Lu, Shang Su, Mengkai Shi, Shuo Feng

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于临界模型的具身智能自进化学习方法,通过状态级临界模型引导采样易失败场景,在多类具身任务中显著降低失败率,性能优于基线及同类先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27841 2026-07-31 quant-ph 新提交 50%

Quantum machine learning interatomic potential: Application of variational quantum algorithm

量子机器学习原子间势:变分量子算法的应用

Kohei Numata, Wataru Mizukami, Kosuke Mitarai, Keisuke Fujii, Yutaka Imamura

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究将量子电路学习应用于MLIP,采用量子迁移学习架构再训练ANI模型,发现结合量子电路的MLIP在预训练模型精度有提升空间时,精度略高于全经典神经网络,可推进量子机器学习在MLIP中的应用。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26582 2026-07-30 cs.CV 新提交 50%

Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer

水平、锐度与语料:为何零样本分布外检测器的排名无法迁移

Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Stephen Gould, Damith Ranasinghe

专题命中 预训练与数据 :language model(abstract)

AI总结 本文通过审计证明零样本OOD检测器排名无法跨域迁移,提出CEG封装器,可降低检测器敏感性并提升GL-MCM与MCM的族平衡FPR95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26365 2026-07-30 cs.IR 新提交 50%

Embedding Items at Scale: Comparing GNN-Based and ID-Based Item Embeddings in the Yandex Ecosystem

大规模物品嵌入:Yandex生态系统中基于GNN和基于ID的物品嵌入比较

Sergei Makeev, Artem Matveev, Vladimir Baikalov, Kirill Khrylchenko

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文通过案例研究,在Yandex的三个产品场景中对比了基于GNN的预训练物品嵌入与端到端可训练物品嵌入,发现训练数据有限时预训练有帮助,大规模数据集上则无显著益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 50%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24159 2026-07-28 cs.RO cs.CV 新提交 50%

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

DeVA:用于机器人策略学习的具有物理引导的解耦视频-动作模型

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究可泛化机器人操纵策略,提出DeVA模型,通过专门的视频和动作专家、多级特征转移及物理显著引导,实现丰富信息交换,使策略学习更易处理,在模拟和实际实验中展现良好性能。

Comments Project page with videos, code, and checkpoints: https://deva-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 50%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18576 2026-07-22 cs.CV 新提交 50%

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

通过程序合成数据实现番茄表型的文本条件分割

Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb, Hakim Ghazzai, Jonathan Klein, Katja Froehlich, Soeren Pirk, Wojciech Palubicki, Gianluca Setti, Ahmed M. Eltawil, Dominik L. Michels

机构 * Computer, Electrical and Mathematical Sciences and Engineering Division, KAUST(计算机、电气与数学科学与工程系,沙特阿卜杜拉国王科技大学) Department of Computer Science, University of Calgary(卡尔加里大学计算机科学系) Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Artificial Intelligence, Adam Mickiewicz University(亚当·密茨凯维奇大学人工智能系) Department of Electronics and Telecommunications, Polytechnic University of Turin(都灵理工大学电子与电信系)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究针对温室作物表型分析中缺乏标注数据问题,提出结合合成数据生成与基础模型微调的框架,通过对商业樱桃番茄温室建模生成合成数据集,微调SAM 3,显著提升分割性能,还公开相关模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18155 2026-07-21 cs.SE 新提交 50%

Testing Retrieval-Augmented Generation Systems with Chunk Coverage

用块覆盖率测试检索增强生成系统

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 预训练与数据 :language model(abstract)

AI总结 研究用块覆盖率(CC)测试检索增强生成(RAG)系统的检索组件,CC衡量语料块检索比例,可指导测试选择与生成,通过实验表明CC引导测试能更快达覆盖率且提高故障检测有效性,无需测试预言机就能捕捉检索多样性。

Comments ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17638 2026-07-21 cs.CV 新提交 50%

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

通过诗歌复兴古画:一种用于对齐文化语义的色彩化框架

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对古画褪色问题,提出PoemColor框架,通过诗歌绘画投影仪和结构感知语义注意力,将诗歌文化语义与绘画恢复对齐,并构建混合数据集。实验证明该框架显著优于现有方法,能实现可控色彩化,恢复古画历史真实性与诗歌语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16285 2026-07-21 cs.CV 新提交 50%

A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition

用于部分标记多任务面部表情识别的共享潜在空间

Hong Hai Nguyen, Sy Phan Van, Soo-Hyung Kim, Van-Thong Huynh

机构 * Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT)(胡志明市理工大学计算机科学与工程学院) Dept. of AI, FPT University(FPT大学人工智能系) Department of Artificial Intelligence Convergence, Chonnam National University(全南国立大学人工智能融合系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对野外面部表情多任务且标注不完整不均衡的问题,提出将部分标记多任务学习视为对共享情感潜在空间的边缘化方法,在s-Aff-Wild2数据集上提升了表情和动作单元识别效果,得出相关结论并展示了小范围转移结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 50%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13178 2026-07-16 cs.CV 新提交 50%

A Masked Autoencoder Approach to Unsupervised Steel Surface Defect Recognition

一种用于无监督钢表面缺陷识别的掩码自动编码器方法

Shrey Patel

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对钢表面缺陷识别中标记数据稀缺问题,采用基于Transformer的掩码自动编码器,通过随机掩码部分图像块让轻量级解码器重建,联合辅助缺陷定位目标训练编码器,聚类预训练编码器特征,取得较高匹配准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11366 2026-07-14 cs.CV 新提交 50%

Self-supervised training for high-resolution close-range multispectral remote sensing imagery

高分辨率近程多光谱遥感影像的自监督训练

Leon-Friedrich Thomas, Mikael Änäkkälä, Antti Lajunen

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究探索自监督学习在高分辨率多光谱无人机影像用于精准农业的有效性,用MoCo-v3等对基于Transformer的编码器预训练,在作物-杂草语义分割任务中表现出色,展示跨传感器和区域泛化能力,还提供芬兰多光谱无人机数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11362 2026-07-14 cs.IR 新提交 50%

Boolean queries are all you need?

布尔查询就足够了吗?

Charles L. A. Clarke, Mark D. Smucker

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10537 2026-07-14 cs.SD cs.MM eess.AS 新提交 50%

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

利用未配对数据和对比对齐进行预训练的舞蹈音乐生成

Ryota Kimura, Sangheon Park, Natalia Polouliakh, Taketo Akama

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Keio University(庆应义塾大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对舞蹈音乐生成中高质量配对数据稀缺问题,提出利用未配对和配对数据的框架,结合预训练单峰编码器、对比预训练及控制网络模块,实验证明该方法提升了舞蹈音乐对齐和音频质量,优于现有技术。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07542 2026-07-09 cs.RO cs.CV 新提交 50%

SonoRank: Towards Calibration-Free Real-Time Finger Flexion Detection from Forearm Ultrasound Sequences

SonoRank:迈向无需校准的实时前臂超声序列手指弯曲检测

Dean Zadok, Alon Wolf, Alex M. Bronstein, Oren Salzman

机构 * Technion(以色列理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对动力假肢手因依赖sEMG功能受限的问题,提出SonoRank方法,通过对超声序列对排序学习及微调,实现无需校准的手指弯曲检测,在交叉验证中F1分数比直接分类基线提高28%,推动超声假肢实用化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 50%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07230 2026-07-09 cs.CV 新提交 50%

`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation

用于自监督视频对象分割的注意力引导跨时间聚类

Waqas Arshid, Mohammad Awrangjeb, Alan Wee-Chung Liew, Yongsheng Gao

机构 * Griffith University(格里菲斯大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对视频对象分割任务,现有自监督方法存在问题。本文提出跨时间一致性和聚类框架,结合注意力引导令牌选择与轻量级时间聚类,通过显著性加权目标对齐软部分分配,利用冻结变压器主干实现有效扩展,提升自监督视频对象分割性能。

Comments Accepted for publication in Machine Intelligence Research journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交 50%

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06238 2026-07-08 cs.CV 新提交 50%

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

PhyMRI-SR:迈向基于物理感知的MRI图像超分辨率

Lihua Wei, Huatong Gao, Jia Gong, Zhiyu Tan, Hao Li, Jun Liu, Zhihua Ren

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Academy of AI for Science(上海人工智能研究院) Fudan University(复旦大学) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学生物医学工程学院与先进医学材料与器械国家重点实验室) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决MRI图像超分辨率问题,将其视为物理感知重建问题。核心方法是采用2D高斯点渲染并引入三项创新,包括先验感知高斯表示、物理约束信号建模和元学习框架。主要贡献是在动态分辨率数据集和标准基准上实现领先性能,有临床部署潜力。

Comments Project Page: https://bio-med-i2-lab.github.io/projects/PhyMRI-SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03203 2026-07-07 eess.IV 新提交 50%

Mutually Exclusive Multiclass Lesion Segmentation in Neuroimaging: Binary-Guided Weak Supervision with Inter-Class Orthogonality

神经成像中的互斥多类病变分割:具有类间正交性的二元引导弱监督

Ashutosh Kumar, Vivek Dhamale, Vaanathi Sundaresan

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对神经成像中共存病变子类的弱监督分割难题,提出BiMEx-MS框架,将多类分割分解为全病变定位和排他性类分配,通过特定损失和形态学伪标签细化实现类间互斥,在多数据集上效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04747 2026-07-07 cs.CV 新提交 50%

MergeSurv: Merging-Based Continual Learning for Survival Analysis on Whole-Slide Images

MergeSurv:用于全切片图像生存分析的基于合并的持续学习

Vu Minh Tran, Doanh C. Bui, Maï K. Nguyen, Khang Nguyen

机构 * University of Information Technology(信息技术大学) Viet Nam National University Ho Chi Minh City(胡志明市越南国立大学) ETIS (UMR 8051), CY Cergy Paris University, ENSEA, CNRS, France(法国CY Cergy巴黎大学、ENSEA、法国国家科学研究中心联合建立的ETIS实验室(UMR 8051))

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究针对全切片图像生存分析,提出MergeSurv框架,独立微调病理视觉语言基础模型参数后合并,还探究两种推理策略,实验表明其优于其他方法且能减少灾难性遗忘。

Comments 10 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04400 2026-07-07 cs.NI 新提交 50%

On the Physical Plausibility and Distribution Alignment for Sim-to-Real RF Positioning

关于从仿真到实际射频定位的物理合理性与分布对齐

Ararat Saribekyan, Armen Manukyan, Hrant Khachatrian, Theofanis P. Raptis

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究基站校准、物理逼真度、合成数据规模及 RSSI 分布对齐对仿真到实际数据传输的影响。通过调整基站参数校准,对比不同校准方式及数据集,发现分布对齐对射频定位更重要。

Comments This work was supported by funding under the bilateral agreement between CNR (Italy) and HESC MESCS RA (Armenia) as part of the DeepRF project for the 2025-2026 biennium, and by the HESC MESCS RA grant No. 22rl-052 (DISTAL)

Journal ref 2026 International Conference on Computer, Information and Telecommunication Systems (CITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30988 2026-07-07 cs.RO 新提交 50%

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

多感官持续学习:将预训练的视觉运动策略适应到力觉

Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02139 2026-07-03 cs.CV 新提交 50%

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting

AdaCount: 基于相似性引导的空间与特征自适应无训练零样本目标计数

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫萨德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 针对零样本目标计数在密集小目标场景下的漏检和分割不佳问题,提出无训练框架AdaCount,通过原型驱动相似性图引导空间扭曲和特征调制,提升SAM3对目标区域的表征能力,达到新SOTA。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00223 2026-07-02 cs.CV 新提交 50%

Does Your ViT Still Need U-Net for Segmentation?

你的ViT做分割还需要U-Net吗?

Xin Li, Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Yanxi Chen, Yujian Xiong, Hao Wang, Oana M. Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Mayo Clinic(梅奥诊所)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文探究现代ViT骨干网络下医学图像分割是否仍需U-Net解码器,并提出基于查询的纯编码器分割框架EoSeg,在多个数据集上取得优异性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏