arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2604.16175 2026-04-20 cs.AI cs.CV 62%

MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation

MARCH:多智能体放射科临床层级用于CT报告生成

Yi Lin, Yihao Ding, Yonghui Wu, Yifan Peng

机构 * Weill Cornell Medicine(韦尔·科恩医学中心) University of Western Australia(西澳大学) University of Florida(佛罗里达大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MARCH通过模拟放射科专业层级,采用多智能体框架提升CT报告生成的临床准确性和语言准确性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13777 2026-04-14 cs.CV cs.AI cs.SD 62%

Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping

Sat2Sound:一种用于零样本声音景观映射的统一框架

Subash Khanal, Srikumar Sastry, Aayush Dhakal, Adeel Ahmad, Abby Stylianou, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Taylor Geospatial(泰勒地理空间) Saint Louis University(圣路易斯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Sat2Sound通过融合多模态数据,实现地球表面声音分布的零样本映射,通过对比学习和代码本对齐学习发现跨模态的'声音景观概念',在GeoSound和SoundingEarth基准上取得最佳性能。

Comments Accepted to EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 62%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09228 2026-04-07 cs.CV cs.AI 62%

Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation

清晰的道路,清晰的视野:智能交通中多天气恢复的进展

Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary

机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) SPACE42 Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03454 2026-04-07 cs.CV cs.AI 62%

RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation

RDFace:一种用于罕见疾病面部图像分析的基准数据集,在极端数据稀缺和表型意识合成生成下

Ganlin Feng, Yuxi Long, Hafsa Ali, Erin Lou, Fahad Butt, Qian Liu, Yang Wang, Pingzhao Hu

机构 * Western University(西安大略大学) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) University of Winnipeg(温尼伯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RDFace包含456张儿童面部图像,涵盖103种罕见遗传疾病,旨在开发和评估在低数据条件下高效的人工智能模型,通过合成生成和数据增强提升诊断准确率。

Comments Accepted to CVPR 2026. 8 pages main paper + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03296 2026-04-07 cs.CV cs.AI 62%

3D-IDE: 3D Implicit Depth Emergent

3D-IDE: 3D隐式深度涌现

Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li

机构 * School of Computing, Australian National University(澳大利亚国立大学计算学院) School of EECS, The University of Queensland(昆士兰大学电气工程与计算机科学学院) FreiNexus School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-IDE方法,通过几何自监督学习实现3D感知的隐式涌现,消除了深度和姿态依赖,提升推理效率和多任务性能。

Comments CVPR 2026 accepted. Project page: https://chushanzhang.github.io/3D-IDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00799 2026-04-06 cs.CV cs.CL cs.LG 62%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11448 2026-03-31 cs.LG cs.CV 62%

Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification

层次化概念嵌入与追求用于可解释的图像分类

Nghia Nguyen, Tianjiao Ding, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出HCEP框架,通过在潜在空间中诱导概念嵌入的层次结构,利用层次稀疏编码恢复图像中的概念,提升分类可解释性与精度。

Comments To be published in Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23627 2026-03-26 cs.CV cs.AI 62%

Ukrainian Visual Word Sense Disambiguation Benchmark

乌克兰视觉词义消歧基准

Yurii Laba, Yaryna Mohytych, Ivanna Rohulia, Halyna Kyryleyza, Hanna Dydyk-Meush, Oles Dobosevych, Rostyslav Hryniv

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个评估乌克兰视觉词义消歧任务的基准,通过八种多语言大模型测试,发现乌克兰与英语在该任务上存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV 62%

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 62%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06340 2026-03-09 cs.CV cs.AI 62%

K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging

K-MaT: 基于知识的流形传输用于医学影像中的跨模态提示学习

Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 K-MaT通过基于知识的流形传输实现跨模态提示学习,提升医学影像模型在不同模态间的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03278 2026-03-04 cs.RO cs.AI cs.CV 62%

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校) Dyna Robotics(Dyna机器人技术)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。

Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15008 2026-03-04 cs.LG cs.AI stat.ML 62%

Know When to Abstain: Optimal Selective Classification with Likelihood Ratios

知何时退避:基于似然比的最优选择性分类

Alvin Heng, Harold Soh

机构 * Department of Computer Science, National University of Singapore(计算机科学系,国立新加坡大学) Smart Systems Institute, National University of Singapore(智能系统研究所,国立新加坡大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于似然比的最优选择性分类方法,通过 Neyman-Pearson 引理统一并改进了选择性分类在协变量偏移下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22975 2026-03-03 cs.CV cs.GR cs.LG 62%

VoMP: Predicting Volumetric Mechanical Property Fields

VoMP:预测体积机械属性场

Rishit Dagli, Donglai Xiang, Vismay Modi, Charles Loop, Clement Fuji Tsang, Anka He Chen, Anita Hu, Gavriel State, David I. W. Levin, Maria Shugrina

机构 * NVIDIA University of Toronto(多伦多大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 VoMP通过训练几何变换器预测3D物体的体积机械属性场,结合多视角特征和现实世界数据集,实现高精度和高速度的属性估计。

Comments Project Page and hi-res paper: https://research.nvidia.com/labs/sil/projects/vomp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08919 2026-03-03 cs.CV cs.LG 62%

PHyCLIP: $\ell_1$-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性

Daiki Yoshikawa, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性。

Comments 24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00159 2026-03-03 cs.CV cs.AI cs.MM cs.SD 62%

FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation

FlowPortrait:基于强化学习的音频驱动肖像视频生成

Weiting Tan, Andy T. Liu, Ming Tu, Xinghua Qu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22299 2026-02-27 cs.MM cs.AI cs.CL cs.LG 62%

Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads

解码钩子:一种多模态大语言模型框架用于分析视频广告的钩子阶段

Kunpeng Zhang, Poppy Zhang, Shawndra Hill, Amel Awadelkarim

机构 * University of Marland, College Park(马里兰大学 College Park分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种多模态大语言模型框架,用于分析视频广告的钩子阶段,通过多策略采样和主题提炼提升广告初期效果分析的准确性与实用性。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20520 2026-02-25 cs.CV cs.AI 62%

How Do Inpainting Artifacts Propagate to Language?

图像修复伪影如何传播到语言?

Pratham Yashwante, Davit Abrahamyan, Shresth Grover, Sukruth Rao

机构 * UC San Diego(圣迭戈大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究图像修复伪影对视觉-语言模型语言生成的影响,通过两阶段诊断方法分析重建保真度与描述质量的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19357 2026-02-24 cs.CV cs.LG 62%

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

MentalBlackboard: 通过数学变换评估空间可视化能力

Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 MentalBlackboard通过数学变换评估模型的空间可视化能力,揭示其在预测和规划任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18262 2026-02-23 cs.CL cs.AI cs.LG 62%

Simplifying Outcomes of Language Model Component Analyses with ELIA

用ELIA简化语言模型组件分析的结果

Aaron Louis Eidt, Nils Feldhus

机构 * Technische Universität Berlin(柏林技术大学) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 ELIA通过交互式界面和AI生成的自然语言解释,简化了语言模型组件分析,帮助非专家理解复杂模型。

Comments EACL 2026 System Demonstrations. GitHub: https://github.com/aaron0eidt/ELIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16979 2026-02-20 cs.CV cs.CL cs.LG 62%

Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling

基于监督潜在变量建模的模态预测影响分析

Divyam Madaan, Sumit Chopra, Kyunghyun Cho

机构 * New York University(纽约大学) Grossman School of Medicine(格罗斯曼医学院) Genentech(基因泰克) CIFAR(加拿大弗雷德里克·班克特研究所)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 PRIMO是一种监督潜在变量插补模型,用于量化多模态学习中缺失模态的预测影响,通过方差度量评估模态对预测的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08785 2026-02-10 cs.CV cs.AI 62%

DeltaSpace: A Semantic-aligned Feature Space for Flexible Text-guided Image Editing

DeltaSpace: 一种语义对齐的特征空间用于灵活的文本引导图像编辑

Yueming Lyu, Kang Zhao, Bo Peng, Huafeng Chen, Yue Jiang, Yingya Zhang, Jing Dong, Caifeng Shan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DeltaSpace通过语义对齐的特征空间实现文本引导图像编辑的灵活训练和推理,支持零样本推理和无需文本的训练。

Comments 18 pages. arXiv admin note: text overlap with arXiv:2303.06285

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01683 2026-02-03 cs.CV cs.AI 62%

FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding

FreshMem: 基于大脑的频率-空间混合内存用于流视频理解

Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FreshMem通过频率-空间混合内存网络,提升流视频理解的连续感知能力,实现短期保真与长期一致性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19659 2026-01-28 cs.CV cs.LG 62%

KeepLoRA: Continual Learning with Residual Gradient Adaptation

KeepLoRA: 基于残差梯度适应的持续学习

Mao-Lin Luo, Zi-Hao Zhou, Yi-Lin Zhang, Yuanyu Wan, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(教育部计算机网络与信息集成重点实验室) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 KeepLoRA通过残差梯度适应方法实现持续学习,有效平衡知识保留、任务知识保持和新知识获取,取得最佳性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15552 2026-01-27 cs.CL cs.AI cs.CV 62%

Multimodal Evaluation of Russian-language Architectures

多模态评估框架MERA Multi对俄语架构的评估

Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan Sviridov, Amina Miftakhova, Ilseyar Alimova, Alexander Panchenko, Alexander Kapitanov, Alena Fenogenova

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MERA Multi框架,用于评估俄语多模态架构,包含18个新任务和统一的评估方法,旨在解决俄语多模态基准缺失的问题。

Comments EACL main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09867 2026-01-26 cs.CV cs.AI cs.CL 62%

Hierarchy-Aware Multimodal Unlearning for Medical AI

层次感知的多模态反遗忘用于医疗AI

Fengli Wu, Vaidehi Patil, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。

Comments Dataset and Code: https://github.com/fengli-wu/MedForget

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15854 2026-01-15 cs.CV cs.LG 62%

Privacy-Preserving in Connected and Autonomous Vehicles Through Vision to Text Transformation

通过视觉到文本转换实现连接和自动驾驶车辆中的隐私保护

Abdolazim Rezaei, Mehdi Sookhak, Ahmad Patooghy, Shahab S. Band, Amir Mosavi

机构 * organization= Department of Computre Science, Texas A\&M University Corpus Christi , addressline= 6300 Ocean Dr , city= Corpus Christi , postcode= 78412 , state= Texas , country= USA organization= Department of Information Management, International Graduate School of Artificial Intelligence, National Yunlin University of Science organization= Institute of the Information Society, Ludovika University of Public Service , city= Budapest , postcode= 78412 , country= Hungary organization= North Carolina A\&T State University , addressline= 601 E Market , city= Greensboro , postcode= 27411 , country= USA

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出利用强化学习和视觉-语言模型,通过视觉到文本转换实现对连接和自动驾驶车辆中敏感视觉信息的隐私保护,提升了隐私保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06475 2026-01-13 cs.CV cs.AI 62%

VVTRec: Radio Interferometric Reconstruction through Visual and Textual Modality Enrichment

VVTRec: 通过视觉和文本模态增强进行无线电干涉图重建

Kai Cheng, Ruoqi Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VVTRec通过融合视觉和文本模态增强,提升无线电干涉图重建的图像质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏