arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-23 至 2025-12-23 共收录 15
2412.11154 2025-12-23 cs.CV

From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point Supervision

从易到难:基于单点监督的红外小目标检测渐进主动学习框架

Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Sicheng Zhao, Yimian Dai, Xiangyu Yue

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Nankai University(南开大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出渐进主动学习框架,通过模型预启动和双更新策略提升单点监督下红外小目标检测的性能和稳定性。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19287 2025-12-23 cs.AI

Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6

Vibe Reasoning: 引导前沿AI数学能力——以IMO 2025问题6的案例研究

Jiaao Wu, Xian Zhang, Fan Yang, Yinpeng Dong

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

AI总结 Vibe Reasoning通过结合AI与人类协作,利用元提示和代理编排解决复杂数学问题,展示了前沿AI在组合优化中的应用与改进。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18988 2025-12-23 cs.RO

DTCCL: Disengagement-Triggered Contrastive Continual Learning for Autonomous Bus Planners

DTCCL:基于脱钩触发的对比连续学习用于自动驾驶巴士规划

Yanding Yang, Weitao Zhou, Jinhai Wang, Xiaomin Guo, Junze Wen, Xiaolong Liu, Lang Ding, Zheng Fu, Jinyu Miao, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学) Dongfeng Motor Corporation Research and Development General Institute(东风汽车集团研发总院) Dongfeng Yuexiang Technology Co., Ltd.(东风悦铃科技有限公司)

AI总结 DTCCL通过脱钩触发对比连续学习,提升自动驾驶巴士在动态城市环境中的规划性能,有效解决传统方法在稀疏脱钩数据下的过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18730 2025-12-23 cs.LG

A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models

通过能量模型的理论视角提升强化学习调优语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

AI总结 本文通过能量模型视角,揭示了强化学习调优语言模型的理论基础,证明了其在指令遵循和推理任务中的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17020 2025-12-23 cs.CV

CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms

CrossLMM: 通过双交叉注意力机制解耦长视频序列与LMMs

Shilin Yan, Jiaming Han, Joey Tsai, Hongwei Xue, Rongyao Fang, Lingyi Hong, Ziyu Guo, Ray Zhang

机构 * Accio Team, Alibaba Group(阿里集团阿奇奥团队) CUHK MMLab(CUHK多模态实验室) Tsinghua University(清华大学)

AI总结 CrossLMM通过双交叉注意力机制解耦长视频序列,有效减少视觉token数量并保持性能,适用于多种视频多模态模型基准测试。

Comments Project page: https://github.com/shilinyan99/CrossLMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14579 2025-12-23 cs.CV cs.AI

GSRender: Deduplicated Occupancy Prediction via Weakly Supervised 3D Gaussian Splatting

GSRender: 通过弱监督的3D高斯点划法实现去重的占用预测

Qianpu Sun, Changyong Shu, Sifan Zhou, Runxi Cheng, Yongxian Wei, Zichen Yu, Dawei Yang, Sirui Han, Yuan Chun

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Houmo AI Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 GSRender通过弱监督3D高斯点划法和射线补偿模块,有效减少占用预测中的重复问题,提升户外自动驾驶的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05491 2025-12-23 cs.CV cs.CR

One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models

一次扰动就足够:针对视觉-语言预训练模型生成通用对抗扰动

Hao Fang, Jiawei Kong, Wenbo Yu, Bin Chen, Jiawei Li, Hao Wu, Shutao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出C-PGC方法,通过对比学习生成通用对抗扰动,攻击视觉-语言预训练模型的多模态对齐能力。

Comments Accepted by ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18264 2025-12-23 cs.CV cs.AI cs.CR

Who Can See Through You? Adversarial Shielding Against VLM-Based Attribute Inference Attacks

谁能穿透你?基于VLM的属性推断攻击的对抗防护

Yucheng Fan, Jiawei Chen, Yu Tian, Zhaoxia Yin

机构 * East China Normal University(东华大学) Zhongguancun Academy(中关村学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)

AI总结 本文提出了一种基于视觉一致性约束的隐私保护方法,通过VPI-COCO基准验证,有效降低隐私泄露风险并保持视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02366 2025-12-23 cs.CL

LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications

LiveSecBench: 一种动态且事件驱动的安全基准,用于中文语言模型应用

Yudong Li, Peiru Yang, Feng Huang, Zhongliang Yang, Kecheng Wang, Haitian Li, Baocheng Chen, Xingyu An, Ziyu Liu, Youdan Yang, Kejiang Chen, Sifang Wan, Xu Wang, Yufei Sun, Liyan Wu, Ruiqi Zhou, Wenya Wen, Xingchi Gu, Tianxin Zhang, Yue Gao, Yongfeng Huang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) IntokenTech

AI总结 LiveSecBench通过动态更新和多维度评估,为中文大模型的安全性提供持续改进的标准和排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10200 2025-12-23 cs.CV

LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解

Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 LVAgent通过多轮动态协作的MLLM代理提升长视频理解性能,实现80%的准确率并在LongVideoBench上提升13.3%

Comments accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02341 2025-12-23 cs.CV cs.AI cs.LG

GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning

GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估

Zhun Mou, Bin Xia, Zhengchao Huang, Wenming Yang, Jiaya Jia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) Department of Computer Science(计算机科学系) Engineering, The Hong Kong University of Science(工程,香港科学大学)

AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14596 2025-12-23 cs.LG

HUTFormer: Hierarchical U-Net Transformer for Long-Term Traffic Forecasting

HUTFormer:分层U-Net变换器用于长期交通预测

Zezhi Shao, Fei Wang, Tao Sun, Chengqing Yu, Yuchen Fang, Guangyin Jin, Zhulin An, Yang Liu, Xiaobo Qu, Yongjun Xu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Planning, Design, and Technology of Architecture, Sapienza University of Rome(罗马大学建筑规划、设计与技术系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院)

AI总结 HUTFormer通过分层U-Net变换器解决长期交通预测问题,采用多尺度表示和高效嵌入策略提升预测性能。

Comments Accepted for publication in the Communications in Transportation Research on December 2025. 38 paqes with 9 fiqures and 6 tables

Journal ref Communications in Transportation Research. 5, 100218 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏