arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-15 至 2025-12-15 共收录 6
2512.11749 2025-12-15 cs.CV

SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder

SVG-T2I: 在视觉基础模型表示空间中扩展文本到图像的潜在扩散模型而不使用变分自编码器

Minglei Shi, Haolin Wang, Borui Zhang, Wenzhao Zheng, Bohan Zeng, Ziyang Yuan, Xiaoshi Wu, Yuanxing Zhang, Huan Yang, Xintao Wang, Pengfei Wan, Kun Gai, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Kling Team, Kuaishou Technology(快手技术团队)

AI总结 SVG-T2I通过在视觉基础模型表示空间中直接进行文本到图像生成,实现了高质量的图像合成并验证了VFM在生成任务中的能力。

Comments Code Repository: https://github.com/KlingTeam/SVG-T2I; Model Weights: https://huggingface.co/KlingTeam/SVG-T2I

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11525 2025-12-15 cs.LG cs.AI

NeuralOGCM: Differentiable Ocean Modeling with Learnable Physics

NeuralOGCM:可微海洋建模与可学习物理

Hao Wu, Yuan Gao, Fan Xu, Fan Zhang, Guangliang Liu, Yuxuan Liang, Xiaomeng Huang

机构 * Tsinghua University, Beijing, China(清华大学) University of Science and Technology of China, Hefei, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科学与技术大学(广州))

AI总结 NeuralOGCM通过融合可微编程与深度学习,实现高效且物理合理的海洋建模,提升科学计算的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11401 2025-12-15 cs.CV

Collaborative Reconstruction and Repair for Multi-class Industrial Anomaly Detection

多类工业异常检测的协同重建与修复

Qishan Wang, Haofeng Wang, Shuyong Gao, Jia Guo, Li Xiong, Jiaqi Li, Dengxuan Bai, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) College of Physics and Electromechanical Engineering, Hexi University(物理与机电工程学院,河西大学) College of Design and Innovation, Tongji University(设计与创新学院,同济大学) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan university(智能信息处理上海重点实验室,计算机科学与人工智能学院,复旦大学) School of Biomedical Engineering, Tsinghua University(生物医学工程学院,清华大学)

AI总结 本研究提出协同重建与修复框架,通过优化解码器和引入特征遮蔽技术,有效解决工业异常检测中的身份映射问题,提升多类异常检测性能。

Comments Accepted to Data Intelligence 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11369 2025-12-15 cs.CV

Assisted Refinement Network Based on Channel Information Interaction for Camouflaged and Salient Object Detection

基于通道信息交互的辅助细化网络用于伪装和显著物体检测

Kuan Wang, Yanjun Qin, Mengge Lu, Liejun Wang, Xiaoming Tao

机构 * Department of Physics, J.K. Institute of Science(物理系,J.K.科学研究院) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) School of Computer Science and Technology, Xinjiang University(计算机科学与技术学院,新疆大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

AI总结 本文提出基于通道信息交互的辅助细化网络,用于提升伪装和显著物体检测的性能,通过改进的解码架构和多尺度增强模块实现更准确的边界和区域重建。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10867 2025-12-15 cs.CV

From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models

从宏观到微观:通过视觉-语言模型在分子上基准测试微观空间智能

Zongzhao Li, Xiangzhe Kong, Jiahui Su, Zongyang Ma, Mingze Li, Songyou Li, Yuelin Zhang, Yu Rong, Tingyang Xu, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) SKL-ESPC & SEPKL-AERM, College of Environmental Sciences and Engineering, Peking University(环境科学与工程学院,北京大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团 DAMO Academy,中国杭州) Hupan Lab, Hangzhou, China(杭州实验室)

AI总结 本文提出MiSI-Bench基准测试框架,评估视觉-语言模型在分子微观空间智能任务中的表现,发现微调模型在空间转换任务上超越人类,但需整合领域知识以推动科学AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏