arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 973 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 973 篇

2607.23042 2026-07-28 cs.DC 新提交 50%

Application-Driven Architecture Exploration for Cross-Layer Heterogeneous Systems

跨层异构系统的应用驱动架构探索

Yuchen Fan, Minghong Sun, Jikui Ma, Yunpeng Xu, Shunyu Mao, Liu He, Shunan Dong, Jiahao Yang, Yu Zhu, Xinhao Yang, Tianyan Zhong, Haoran Sun, Daoqi Liu, Zongle Huang, Xinyuan Lin, Huazhong Yang, Maokun Li, Yongpan Liu, Yu Wang, Zhenhua Zhu, Hongyang Jia, Shuwen Deng

专题命中 指令微调 :LLM(abstract)

AI总结 研究跨层异构系统设计空间难探索的问题,提出应用驱动框架CHASE,通过分层图表示候选方案,用解耦两级循环避免联合硬件映射搜索难的问题,在稀疏计算和大语言模型工作负载上评估,实现加速并降本降耗。

Comments 20 pages, 15 figures. The first five authors contributed equally. Zhenhua Zhu, Hongyang Jia, and Shuwen Deng are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22331 2026-07-27 hep-ph 新提交 50%

SMEFT-Pheno-Agent: a natural-language-driven AI agent for machine-learning-assisted Standard Model Effective Field Theory phenomenology

SMEFT-现象学智能体:一种由自然语言驱动的人工智能智能体,用于机器学习辅助的标准模型有效场论现象学

Yu-Chen Guo, Jie Wang, Ji-Chong Yang

专题命中 指令微调 :LLM(abstract)

AI总结 介绍SMEFT-现象学智能体这一Python工作流程,由自然语言AI引导,用于高能对撞机的SMEFT现象学研究。它协调多阶段,自动生成参数文件等,委托工具计算,记录相关工件,建立了可重复性和审核可追溯性。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21417 2026-07-24 cs.CV 新提交 50%

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Software, Beihang University(北京航空航天大学软件学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20900 2026-07-24 cs.CV 新提交 50%

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整

Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 50%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 50%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 指令微调 :SFT(abstract)

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19836 2026-07-23 cs.IR cs.DL 新提交 50%

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

使用分层控制词汇表理解历史照片集中CLIP检索失败的原因

Ratan Sebastian, Anett Hoppe, Christoph Rippe, Ralph Ewerth

专题命中 指令微调 :language model(abstract)

AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 50%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 指令微调 :post-training(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17987 2026-07-21 cs.SE 新提交 50%

Chiral Analysis of Smart Contracts: Detecting Vulnerabilities from Relational Inconsistencies Across Business Paths

智能合约的手性分析:从业务路径间的关系不一致中检测漏洞

Yue Xue

专题命中 指令微调 :LLM(abstract)

AI总结 研究智能合约因业务路径关系不一致产生的漏洞,提出手性分析,将配对路径视为隐式规范,形式化关系并推导义务。通过ChiralDetector实现,经初步评估能减少候选对、产生去重结果,揭示难用单功能规则表达的漏洞类并控制成本与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 50%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 指令微调 :post-training(abstract)

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16546 2026-07-21 cs.CV 新提交 50%

AffectFuse: Cross-Task Feature Fusion with Temporal Modeling for Multi-Task Affective Behavior Analysis

AffectFuse:用于多任务情感行为分析的具有时间建模的跨任务特征融合

Dipit Saha, Mohammad Raihan Rashid, Shah Mohammad Abdul Mannan, Ahnaf Tahmid, Md. Mehedi Hasan

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对自然环境情感行为识别,提出AffectFuse系统,通过编码器后适配,利用冻结主干提供特征,特定模块选择信号,采用MAE-Face与LoRA及专家路由识别动作单元,消融实验确定配置,有效构建MTL管道且无需训练新基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16280 2026-07-21 cs.CV 新提交 50%

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 指令微调 :language model(abstract)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14727 2026-07-17 cs.CV 新提交 50%

WorkDrive: Roadwork Chain of Causation for Autonomous Driving

WorkDrive:自动驾驶的道路施工因果链

Tianyi Jiang, Wen Zhang, Sihan Yang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动汽车)

专题命中 指令微调 :language model(abstract)

AI总结 针对自动驾驶视觉语言模型在道路施工区域的难题,提出WorkDrive框架,通过自动化多任务感知管道提取场景事实,经监督微调与强化学习,在ROADWork数据集上降低轨迹平均位移误差,实现渐进改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12820 2026-07-15 cs.CV 新提交 50%

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 指令微调 :SFT(abstract)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12450 2026-07-15 cs.CV 新提交 50%

Let RGB Be the Language of Vision

让 RGB 成为视觉的语言

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰·霍普金斯大学) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学) Rice University(莱斯大学)

专题命中 指令微调 :language model(abstract)

AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 50%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 指令微调 :language model(abstract)

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11591 2026-07-14 cs.CV 新提交 50%

Similarity-Guided Curriculum Fine-Tuning of LLMs for Neural Architecture Synthesis

用于神经架构合成的基于相似度引导的大语言模型课程微调

Anujaya Vijayakumar, Radu Timofte, Dmitry Ignatov

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI,维尔茨堡大学)

专题命中 指令微调 :LLM(abstract)

AI总结 研究为基于大语言模型的神经架构搜索构建基于MinHash的相似度调度框架,通过对源代码分片划分相似度带进行渐进式课程微调,在CIFAR-10等实验中评估,揭示了接口修复和课程调度针对不同失败模式,还观察了跨数据集转移情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10532 2026-07-14 cs.IR 新提交 50%

Implicit Fine-tuning via Context Engineering: A Curriculum Learning Framework for Multimodal Entity Alignment

通过上下文工程进行隐式微调:多模态实体对齐的课程学习框架

Yunpeng Hong, Chenyang Bu, Di Wu, Yi He, Xindong Wu

专题命中 指令微调 :LLM(abstract)

AI总结 研究多模态实体对齐问题,提出PTFEA课程学习框架,通过自适应难度调制和三阶段渐进推理将微调策略转化为上下文工程,实验证明该框架性能优越,提供了统一上下文工程和微调的理论框架。

Comments Accepted by KDD 2026

Journal ref SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10308 2026-07-14 cs.CV 新提交 50%

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

通过虚拟模态合成将大型多模态模型推广到通用视觉模态

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)

专题命中 指令微调 :instruction tuning(abstract)

AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。

Comments Accepted by the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09005 2026-07-13 physics.geo-ph 新提交 50%

Benchmarking Universal Machine Learning Force Fields for Molecular Dynamics of Lunar Regolith Minerals

用于月球风化层矿物分子动力学的通用机器学习力场基准测试

Ziyu Huang, Ken-ichi Nomura

专题命中 指令微调 :foundation model(abstract)

AI总结 研究对六个通用机器学习力场模型用于月球矿物分子动力学模拟进行基准测试,通过多种方式评估结构保真度,测试羟基化表面,还进行性能基准测试,为模型应用提供初步基准并明确未来关键方向。

Comments 14 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 50%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 指令微调 :pretraining(abstract)

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07529 2026-07-09 cs.GT 新提交 50%

FedMark-FM: Auditable, Risk-Adjusted Data Markets for Federated Foundation-Model Adaptation

FedMark-FM:用于联邦基础模型适配的可审计、风险调整数据市场

Phat T. Tran-Truong, Xuan-Bach Le, Minh Nhat Nguyen

专题命中 指令微调 :foundation model(abstract)

AI总结 研究联邦基础模型适配中激励机制问题,提出FedMark-FM框架,将客户端视为工件卖家,用S3Val估计贡献,转换支付惩罚不良行为,经多任务评估表现出色,证明管道有序估值独特性,能在一定规模下保留专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07195 2026-07-09 cs.CV 新提交 50%

DiffCVE: Diffusion-based Compressed Video Enhancement

DiffCVE:基于扩散的压缩视频增强

Wenqiang Xiao, Wenzhuo Ma, Junxi Zhang, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 指令微调 :prompting(abstract)

AI总结 针对严重压缩视频感知质量增强难题,提出DiffCVE方法。设计CPDC分支联合建模,引入CDSP机制与CPWF模块,利用编码先验及条件提示等,经实验验证该方法能有效提升感知质量,尤其在严重压缩时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 50%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 50%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 指令微调 :language model(abstract)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02708 2026-07-07 cs.CV 新提交 50%

When Does Resolution Help a Frozen Backbone? Global Attention at Resolution Predicts Scalable Adaptation for Camouflaged and Marine Animal Segmentation

分辨率何时有助于冻结的主干网络?分辨率下的全局注意力预测伪装和海洋动物分割的可扩展适应性

Tyler Rust, Chandra Kambhamettu

机构 * University of Delaware(特拉华大学) University of South Florida(南佛罗里达大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究适应冻结视觉基础模型进行细粒度分割时主干网络选择的影响,通过控制实验建立主干网络应用全局注意力与分辨率、低秩适配器效果的关系模式,特定主干网络在多数据集上表现优。

Comments 9 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02559 2026-07-07 cs.CV 新提交 50%

How many labels do you need? A decision framework for cross-habitat marine species recognition

你需要多少标签?跨栖息地海洋物种识别的决策框架

Alzayat Saleh, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(詹姆斯·库克大学科学与工程学院) Centre for AI and Data Science Innovation, James Cook University(詹姆斯·库克大学人工智能与数据科学创新中心)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出跨海洋栖息地转移视觉系统时标记工作量与识别准确性权衡的决策框架,用五个数据集等评估四个模型及策略,发现少量标记图像即可,可据此规划标记工作。

Comments 29 pages, 12 figures, 4 tables. Includes supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02158 2026-07-03 cs.CV 新提交 50%

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

面向资源受限消费级GPU的视觉模型与VLM的高效PEFT方法及自适应检查点技术

Altay Toktassyn, Jurn-Gyu Park

机构 * Department of Computer Science, Nazarbayev University(计算机科学系,纳扎尔拜耶夫大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文在2GB VRAM限制下,比较了五种PEFT方法在Transformer和Mamba视觉骨干上的表现,并提出了自适应梯度检查点算法,在CIFAR-100和DTD上评估了准确率、训练时间、能耗及多目标指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00338 2026-07-02 cs.CV 新提交 50%

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

DroneFINE: 面向无人机图像的视觉-语言检测器的域感知参数高效微调

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室) Innovation Center for Intelligent System Cognition and Decision-Making, Beijing, China(智能系统认知与决策创新中心) Information Science Academy of China Electronics Technology Group Corporation, Beijing, China(中国电子科技集团有限公司信息科学研究院)

专题命中 指令微调 :language model(abstract)

AI总结 针对无人机图像与视觉语言模型预训练数据之间的域差异,提出包含HyperAdapter和SemanticGate的域感知参数高效微调方法,在减少可训练参数的同时达到与全微调相当的性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31258 2026-07-01 cs.CV 新提交 50%

WarpHammer: Densifying Scene Warps with 3D Object Priors for Extreme View Synthesis

WarpHammer: 利用3D物体先验稠密化场景扭曲以实现极端视角合成

Michael Green, Gavriel Habib, Dvir Samuel, Tal Berkovitz Shalev, Issar Tzachor, Rami Ben-Ari, Or Litany

机构 * OriginAI, Israel(OriginAI,以色列) NVIDIA(英伟达) Technion(以色列理工学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对投影条件新视角合成在大轨道运动下扭曲稀疏导致生成失败的问题,提出无需训练的WarpHammer框架,通过引入3D生成先验的物体显式重建来补充缺失前景并遮挡不应可见的背景点,恢复外观和相机线索,并首次支持融合外部辅助物体视图。

详情

展开后加载摘要…

URL PDF HTML 收藏