arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 973 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 973 篇

2608.20556 2026-08-24 cs.RO cs.LO eess.SY 新提交 50%

Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model

Logic-VLA:一种时序逻辑条件下的视觉-语言-动作模型

Celina Shiyu Wang, Yiqi Zhao, Junjie Ye, Yue Wang, Jyotirmoy V. Deshmukh

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :preference optimization(abstract)

AI总结 Logic-VLA是感知形式化需求的VLA模型,以STL规约为条件,经两阶段适配后,在四旋翼导航仿真中大幅提升STL满足率,仅小幅降低常规NL任务成功率,可适配不同形式化需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20448 2026-08-24 cs.GR cs.CV 新提交 50%

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube:具有部件级语义与空间控制的组合式三维生成

Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

专题命中 指令微调 :prompting(abstract)

AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19637 2026-08-21 cs.CV 新提交 50%

TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters

TextRefine:提升产品海报文本编辑中的文本保真度、空间位置与字形渲染

Honglie Wang, Jia Sun, Zijun Li, Junlong Wu, Pengcheng Wei, Jiyuan Wang, Yongrui Heng, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao, Yan-Ming Zhang

专题命中 指令微调 :post-training(abstract)

AI总结 研究针对产品海报文本编辑中通用模型的缺陷,提出TextRefine框架与OpenTextEdit数据集,在文本保真度、位置可靠性等指标上优于基线方法,提升了产品海报文本编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交 50%

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

专题命中 指令微调 :language model(abstract)

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: https://carldegio.github.io/latent_action.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17475 2026-08-19 cs.CV 新提交 50%

S$^3$AM: A Single-Stream SAM with Reliability-Calibrated Frequency Adapter for Multi-modal Salient Object Detection

S³AM:一种用于多模态显著目标检测的、具备可靠性校准频率适配器的单流SAM

Ruichao Hou, Boyue Xu, Tongwei Ren, Dongming Zhou, Gangshan Wu, Jinde Cao

机构 * China Pharmaceutical University(中国药科大学) Nanjing University(南京大学) Yunnan University(云南大学) Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究针对多模态显著目标检测的冗余计算问题,提出融合可靠性校准频率适配器的单流SAM框架,仅用12.20M参数即实现竞争力性能,相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14750 2026-08-18 eess.IV cs.CV 新提交 50%

A Unified DINOv2-Based Framework for LVEF Estimation, GLS Dysfunction Classification, and Early Cardiotoxicity Prediction

基于DINOv2的左室射血分数估计、整体纵向应变功能障碍分类及早期心脏毒性预测统一框架

Xiaotong Zhang, Mingyue Cui, Qing Cao, Jingming Xia

专题命中 指令微调 :foundation model(abstract)

AI总结 本研究提出基于DINOv2的统一框架,结合LoRA与时序聚合等技术,实现LVEF估计、GLS功能障碍分类及早期心脏毒性预测,在多任务中取得良好性能,还引入专用模型优化LVEF估计。

Comments Accepted as an oral at the EchoRisk Challenge Workshop, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15353 2026-08-18 cs.CV 新提交 50%

Decomposing Whole Slide Image Report Generation with Graph-Constrained Multiple Instance Learning Workflows

用图约束的多实例学习工作流分解全切片图像报告生成

Antony Gitau, Martyna Borak, Bjørn-Jostein Singstad, Martin Paulson, Karl Thomas Hjelmervik, Ola Marius Lysaker, Veralia Gabriela Sanchez

机构 * Faculty of Technology, Natural Sciences and Maritime Sciences, University of South-Eastern Norway(东南挪威大学技术、自然科学与海洋科学学院) Center for Cancer and Blood Diseases, Vestfold Hospital Trust(西福尔信托医院癌症与血液疾病中心) Faculty of Biomedical Engineering, Silesian University of Technology(西里西亚工业大学生物医学工程学院)

专题命中 指令微调 :language model(abstract)

AI总结 该研究提出图约束的多实例学习分解框架,结合Virchow2嵌入与器官条件图,提升WSI报告生成性能,明确器官路由是域转移瓶颈,支持错误定位。

Comments Accepted at the MICCAI 2026 REG Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15045 2026-08-18 cs.CV 新提交 50%

MOSS-VL Technical Report

MOSS-VL 技术报告

Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen, Xingyang He, Huazheng Zeng, Jijun Cheng, Chenghao Wang, Xiaomeng Qian, Pengfei Wang, Zhan Huang, Shanqing Gao, Wei Huang, Longjun Cao, Wu Ran, Jie Liu, Changtai Zhu, Hongkai Wang, Yixian Tian, Chenghao Liu, Zhen Ye, Xinghao Wang, Botian Jiang, Guoguo Feng, Zhaoye Fei, Ruixiao Li, Mingshu Chen, Yang Gao, Qinyuan Cheng, Shimin Li, Xipeng Qiu

专题命中 指令微调 :language model(abstract)

AI总结 本研究提出开源视觉-语言模型MOSS-VL,通过全栈协同设计实现实时交互能力,在流式基准测试中表现优异,大幅领先同类开源模型,发布了相关检查点与代码。

Comments 22 pages. Project page: https://openmoss.ai/MOSS-VL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13969 2026-08-17 cs.CV 新提交 50%

PPOM: Marginalizing Patch-Grid Phase for CLIP-Based Generalizable Vision-Language Prompt Tuning

PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化

Liang Wang, Haoyang Li, Chao Wang, Guodong Long, Jing Jiang, Yan Peng

机构 * Shanghai University(上海大学) University of Technology Sydney(悉尼科技大学)

专题命中 指令微调 :language model(abstract)

AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11329 2026-08-13 cs.SD cs.CV cs.MM 新提交 50%

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型

Maryam Dehdashti

机构 * Inference Matter Labs(推理物质实验室)

专题命中 指令微调 :language model(abstract)

AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。

Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10870 2026-08-12 cs.CV 新提交 50%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 指令微调 :language model(abstract)

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09223 2026-08-11 cs.CV 新提交 50%

PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection

PatchHead:学习空间块证据以实现可泛化的AI生成图像检测

Shengbo Qi, Hongyi Fang, Benjia Zhou, Rui Mao

专题命中 指令微调 :foundation model(abstract)

AI总结 针对AI生成图像检测器泛化能力差的问题,提出保留DINO块token二维结构的PatchHead,仅优化少量参数,在9个跨数据集基准上表现优异,提升了检测准确率并降低了域差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08867 2026-08-11 cs.CV 新提交 50%

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

基于粗到细VLM跟踪流水线的零样本交通事故检测

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid

机构 * Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出一种无需训练的双通粗到细流水线,结合Qwen3-VL-32B-Instruct、YOLO11x与BoT-SORT,在零样本约束下于ACCIDENT @ CVPR基准测试中实现22%相对优势,达成0.504的三方调和均值得分。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026, Denver, CO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08336 2026-08-11 cs.CV 新提交 50%

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

面向计算高效的Transformer适配的电路微调

Uri Z. Kialy, Gil Ben-Artzi

专题命中 指令微调 :language model(abstract)

AI总结 提出电路微调(CFT)框架,通过电路发现选择ViT待微调子图,仅微调该子图,可大幅降低训练FLOPs与时间,在多类视觉任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07981 2026-08-11 cs.CV 新提交 50%

Distilling Physical Priors into Streaming World Models

将物理先验知识蒸馏为流式世界模型

Liangliang Zhao, Junying Wang, Danni Yang, Yifan Chang, Bin Fu, Yu Qiao, Bowen Zhou, Yihao Liu

专题命中 指令微调 :pretraining(abstract)

AI总结 本文提出PhyS三阶段框架,构建120K物理交互数据集,经微调、蒸馏及在线强化学习结合TCR方法,提升流式世界模型的物理一致性,在PhysicsIQ等基准上取得显著性能提升。

Comments 9 pages, 7 figures. Project page: https://lyongo.github.io/PhyS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 50%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 指令微调 :language model(abstract)

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交 50%

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

专题命中 指令微调 :language model(abstract)

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05036 2026-08-06 cs.CR 新提交 50%

When Do PEFT Adaptations Leak Structure? Measuring Black-Box Structural Bounds in Public-Base Model Services

参数高效微调(PEFT)适配何时会泄露结构?测量公共基础模型服务中的黑盒结构边界

Zhongjiang Yao, Shuangshuang Liang, Chun Yang, LiWei Chen, Gang Shi

专题命中 指令微调 :foundation model(abstract)

AI总结 本研究提出VectorHijack-SR方法,测量公共基础模型PEFT适配的结构泄露边界,发现PEFT服务会泄露结构与版本信息,且存在可见性-可利用性差距。

Comments Submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04791 2026-08-06 cs.CV 新提交 50%

On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing

遥感领域基于视觉语言模型的联邦学习中适配策略的有效性研究

Simon Lösche, Barış Büyüktaş, Mathis Adler, Angelos Zavras, Ioannis Papoutsis, Begüm Demir

机构 * BIFOLD - Berlin Institute for the Foundations of Learning and Data(BIFOLD - 柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) National Technical University of Athens(雅典国家技术大学) National Observatory of Athens(雅典国家天文台) Harokopio University of Athens(哈罗科皮奥雅典大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文针对遥感图像分类场景,首次对比全微调、LoRA等四种VLM适配策略在联邦学习中的表现,给出不同约束下的策略选择指南。

Comments Accepted at the SPIE Artificial Intelligence and Image and Signal Processing for Remote Sensing, Edinburgh, Scotland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03357 2026-08-05 cs.CV 新提交 50%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 指令微调 :prompting(abstract)

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03267 2026-08-05 cs.CR 新提交 50%

FedGSA: Geometry-Consistent Subspace Aggregation for Differentially Private Federated LoRA

FedGSA:用于差分隐私联邦LoRA的几何一致子空间聚合

Lele Zheng, Ruijie Hu, Tao Zhang, Ke Cheng, Yulong Shen

专题命中 指令微调 :language model(abstract)

AI总结 FedGSA是用于差分隐私联邦LoRA的几何一致子空间聚合框架,通过格拉斯曼流形上的基不变子空间聚合减少更新扭曲,在GLUE等任务上较基线提升2.17%、2.27%且无额外隐私损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 50%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 指令微调 :language model(abstract)

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01530 2026-08-04 cs.CV 新提交 50%

ST-LoRA: Single Trajectory LoRA Ensemble for Uncertainty Aware Agricultural Segmentation

ST-LoRA:用于不确定性感知农业分割的单轨迹LoRA集成

Mohamed Farag, Genc Hoxha, Yahia Maleki, Chris McCool, Ribana Roscher

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence, University of Bonn(波恩大学拉马尔机器学习与人工智能研究所) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织(CSIRO))

专题命中 指令微调 :language model(abstract)

AI总结 ST-LoRA结合LoRA与快照集成,从单轨迹构建高效集成,在农业分割任务中,其性能优于多种基线方法,能高效实现不确定性感知。

Comments Submitted to Computers and Electronics in Agriculture (Elsevier). Currently under review (first revision round)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00678 2026-08-04 cs.CV 新提交 50%

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

打破水平先验:从长尾方向偏差到抗翻滚单目深度估计

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究针对单目深度估计中受水平先验(长尾方向偏差)导致的相机翻滚鲁棒性差问题,提出训练时监督策略ID-Constraint,经多基准数据集实验验证了方法的有效性。

Comments The code is publicly available on GitHub: https://github.com/KaihuaTang/Horizontal-Prior

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29033 2026-08-03 cs.CV 新提交 50%

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

SAM+D:通过深度路由LoRA与深度移位实现SAM系列模型的参数高效维度提升

Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究提出SAM+D框架,通过DRLoRA与DSM两个轻量模块,以仅微调约2.8%(SAM)或3.7%(SAM2)参数的方式,实现2D SAM至3D、SAM2至4D的高效分割,在多个基准上取得具竞争力结果。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28987 2026-08-03 cs.SE 新提交 50%

A Formalism-Aware Reward Loop for Handwritten UML-to-PlantUML Generation

面向手写UML到PlantUML生成的形式化感知奖励循环

Mersedeh Sadeghi, Simon Scholz, Adrian Psoch-Bajraktari

专题命中 指令微调 :language model(abstract)

AI总结 本研究提出形式化感知奖励循环,通过微调视觉-语言模型结合Group Relative Policy Optimisation生成PlantUML,提升了转换质量,为建模评估提供了新方向。

Comments Accepted for publication in the Proceedings of the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026). This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25355 2026-07-29 cs.SD 新提交 50%

From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

从语义到读出:时间音频接地微调后音频令牌的机制理解

Yujian Ma, Jinqiu Sang, Ruizhe Li, Jiaao Yu, Ang Li

专题命中 指令微调 :language model(abstract)

AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24465 2026-07-28 cs.CV 新提交 50%

Rethinking Expert Training for Model Merging with Prompt Learning

重新思考用于模型合并和提示学习的专家训练

Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno, Simone Calderara, Dimosthenis Karatzas, Joost van de Weijer

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) AImageLab, University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学AImageLab)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究重新思考模型合并的专家训练,提出基于提示自适应的强大基线,引入双调谐专家两阶段训练策略,可减少特定任务参数更新幅度,提升合并性能,组合异构专家集时也有效。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23694 2026-07-28 cs.CV 新提交 50%

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

用于提示驱动手术概念分割的 SAM3 的参数高效适配

Changjing Liu, Yiming Huang, Beilei Cui, Liangjing Shao, Long Bai, Yanheng Li, Haoxuan Che, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) XGEN Labs(XGEN实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对手术数据与预训练数据的领域差距及现有方法计算消耗大效率低的问题,提出用低秩适配(LoRA)对 SAM3 进行参数高效适配用于手术概念分割,该方法在单个 GPU 上训练且性能优于主流基线,结果可支持下游手术场景重建和模拟。

Comments Accepted by The 2nd MICCAI Workshop on Efficient Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23511 2026-07-28 cs.CV 新提交 50%

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

MOJITO:用于统一端到端自动驾驶的模态联合学习

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(理想汽车) University of New South Wales(新南威尔士大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究针对端到端自动驾驶系统问题,提出基于模态联合学习的MOJITO框架,去除级联接口,执行逐块模态联合注意力更新多模态特征,在数据集上取得新的最优成绩,展现出强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏