arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2602.09586 2026-03-17 cs.CV 57%

Delving into Spectral Clustering with Vision-Language Representations

深入探讨基于视觉-语言表示的谱聚类

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11301 2026-03-17 cs.AI 57%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02184 2026-03-17 cs.LG 57%

Retrieval-augmented Decoding for Improving Truthfulness in Open-ended Generation

基于检索的解码方法用于提升开放式生成中的真实性

Manh Nguyen, Sunil Gupta, Hung Le

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出Retrieval-Augmented Decoding方法,通过构建紧凑的参考 grounding 空间,在推理过程中利用检索到的上下文信息调整模型logits,提升生成文本的真实性。

Comments updated experiments and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV 57%

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 57%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV 57%

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12553 2026-03-16 cs.RO cs.CV 57%

Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation

超越密集未来:世界模型作为机器人操作的结构化规划器

Minghao Jin, Mozheng Liao, Mingfei Han, Zhihui Li, Xiaojun Chang

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI 57%

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11617 2026-03-13 cs.CV 57%

Noise-aware few-shot learning through bi-directional multi-view prompt alignment

通过双向多视图提示对齐实现噪声感知的少样本学习

Lu Niu, Cheng Xue

机构 * Southeast University(东南大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11220 2026-03-13 cs.CV cs.CL 57%

Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models

频率调制的视觉修复用于Matryoshka大多模态模型

Qingtao Pan, Zhihao Dou, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13723 2026-03-13 cs.CV 57%

SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models

SOTA: 自适应最优传输用于多基础模型的零样本分类

Zhanxuan Hu, Qiyu Xu, Yu Duan, Yonghang Tai, Huafeng Li

机构 * Yunnan Normal University(云南师范大学) Xidian University(西安电子科技大学) Xi’an University of Posts and Telecommunications(西安邮电大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SOTA通过自适应最优传输方法整合多基础模型,提升零样本分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08544 2026-03-10 cs.RO cs.LG 57%

The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search

神经罗盘:基于概率相对特征场的机器人搜索

Gabriele Somaschini, Adrian Röfer, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.LG

AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。

Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07295 2026-03-10 cs.AI 57%

A Cortically Inspired Architecture for Modular Perceptual AI

一种模块化感知人工智能的皮层启发架构

Prerna Luthra

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种受皮层启发的模块化感知人工智能架构,通过分解感知为专门模块,提升可解释性和推理透明度。

Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07163 2026-03-10 cs.CV 57%

PromptGate Client Adaptive Vision Language Gating for Open Set Federated Active Learning

PromptGate:面向开放集联邦主动学习的客户端自适应视觉语言门控

Adea Nesturi, David Dueñas Gaviria, Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科诊所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 PromptGate通过动态视觉语言模型门控框架提升开放集联邦主动学习的标注效率,实现高纯度和高召回率的样本筛选。

Comments 3 Figures, 2 Tables, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07039 2026-03-10 cs.AI 57%

Self-Supervised Multi-Modal World Model with 4D Space-Time Embedding

具有4D空间-时间嵌入的自监督多模态世界模型

Lance Legel, Qin Huang, Brandon Voelker, Daniel Neamati, Patrick Alan Johnson, Favyen Bastani, Jeff Rose, James Ryan Hennessy, Robert Guralnick, Douglas Soltis, Pamela Soltis, Shaowen Wang

机构 * Ecological Intelligence Lab(生态智能实验室) School of Complex Adaptive Systems(复杂适应系统学院) University of Houston(休斯顿大学) Geosensing Systems Engineering & Sciences Lab(传感系统工程与科学实验室) Stanford University(斯坦福大学) Allen Institute for Artificial Intelligence(人工智能研究院) Spatial Intelligence Lab(空间智能实验室) Department of Computer Science(计算机科学系) Georgia Institute of Technology(佐治亚理工学院) Florida Museum of Natural History(佛罗里达自然历史博物馆) University of Florida(佛罗里达大学) NSF Institute for Geospatial Understanding(国家科学基金会地理理解研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 DeepEarth通过4D空间-时间嵌入实现自监督多模态世界模型,在生态预测中取得最佳性能。

Comments 8 pages, 5 figures, 1 table. Presented at 2026 World Modeling Workshop, Mila Quebec

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 57%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06403 2026-03-09 cs.LG 57%

Adapter-Augmented Bandits for Online Multi-Constrained Multi-Modal Inference Scheduling

适配器增强的带状机用于在线多约束多模态推断调度

Xianzhi Zhang, Yue Xu, Yinlin Zhu, Di Wu, Yipeng Zhou, Miao Hu, Guocong Quan

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, 510006, China.(中山大学计算机科学与工程学院) School of Computing, Macquarie University, NSW 2109, Australia(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG

AI总结 M-CMAB通过多适配器增强框架,实现多模态任务调度中的多约束优化,提升推断效率和预算利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06038 2026-03-09 cs.CV cs.GR 57%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17938 2026-03-09 cs.CL cs.LG 57%

SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization

SPINE:基于熵带正则化的令牌选择性测试时间强化学习

Jianghao Wu, Yasmeen George, Jin Ye, Yicheng Wu, Daniel F. Schmidt, Jianfei Cai

机构 * Monash University(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG

AI总结 SPINE通过令牌选择性和熵带正则化提升测试时间推理稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06986 2026-03-09 cs.CV cs.CL 57%

Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs

重新思考多模态大语言模型中视觉编码器混合范式以提升视觉理解

Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 LEO通过轻量级融合设计提升多模态大语言模型的视觉理解能力,并在自动驾驶领域展现良好泛化性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04851 2026-03-06 cs.LG cs.CL 57%

Why Is RLHF Alignment Shallow? A Gradient Analysis

为什么RLHF对齐是浅层的?一种梯度分析

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 57%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV 57%

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10118 2026-03-05 cs.CV cs.CL 57%

Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering

为何1+1<1在视觉令牌修剪中:通过多目标平衡覆盖超越简单整合

Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学) Chongqing Institute of East China Normal University(华东师范大学重庆研究院) Shanghai University of Engineering Science(上海工程技术大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 MoB通过多目标平衡覆盖方法,解决视觉令牌修剪中提示对齐与视觉保留的权衡问题,实现高效且高性能的修剪效果。

Comments 31 pages,9 figures,conference

Journal ref Advances in Neural Information Processing Systems 39 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00251 2026-03-05 cs.SE cs.AI cs.SY eess.SY 57%

GENAI WORKBENCH: AI-Assisted Analysis and Synthesis of Engineering Systems from Multimodal Engineering Data

GenAI Workbench: 人工智能辅助从多模态工程数据中分析和合成工程系统

H. Sinan Bank, Daniel R. Herber

机构 * Colorado State University(科罗拉多州立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 GenAI Workbench通过整合AI技术,实现从多模态工程数据中辅助分析和合成工程系统,促进更集成和数据驱动的工程设计方法。

Comments 7 pages, 3 figures, accepted to be presented at IISE Annual Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI 57%

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18453 2026-03-03 cs.AI cs.CL 57%

Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation

像放射科医生一样推理:用于可验证报告生成的推理链和强化学习

Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Huichi Zhou, Zhengqing Yuan, Zhifan Gao, Lei Zhu, Giorgos Papanastasiou, Yingying Fang, Guang Yang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09285 2026-03-03 cs.CV 57%

Spotlight on Token Perception for Multimodal Reinforcement Learning

多模态强化学习中的token感知聚焦

Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。

Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00805 2026-03-03 cs.CV cs.MA 57%

NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code

NERFIFY:一个将NeRF论文转化为代码的多智能体框架

Seemandhar Jain, Keshav Gupta, Kunal Gupta, Manmohan Chandraker

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 NERFIFY通过多智能体框架将NeRF论文转化为可训练的代码,提升复现效率和质量。

Comments Accepted to CVPR 2026. Project page: https://seemandhar.github.io/NERFIFY/

详情

展开后加载摘要…

URL PDF HTML 收藏