arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-11-27 至 2025-11-27 共收录 14
2511.21663 2025-11-27 cs.CV cs.AI

Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models

基于注意力的视觉-语言-动作模型中逐块稀疏对抗攻击

Naifu Zhang, Wei Tao, Xi Xiao, Qianpu Sun, Yuxin Zheng, Wentao Mo, Peiqiang Wang, Nan Zhang

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Huazhong University of Science and Technology, Wuhan, China(华中科技大学) Ping An Technology, Shenzhen, China(平安科技)

AI总结 ADVLA通过注意力引导实现低振幅、稀疏的对抗攻击,有效削弱VLA模型的下游动作预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21653 2025-11-27 cs.CV

CaFlow: Enhancing Long-Term Action Quality Assessment with Causal Counterfactual Flow

CaFlow:通过因果反事实流增强长期动作质量评估

Ruisheng Han, Kanglei Zhou, Shuang Chen, Amir Atapour-Abarghouei, Hubert P. H. Shum

机构 * Durham University(杜伦大学) Tsinghua University(清华大学)

AI总结 CaFlow通过整合因果反事实正则化与双向时间条件流,提升长期动作质量评估的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21610 2025-11-27 cs.CL

Auxiliary Metrics Help Decoding Skill Neurons in the Wild

辅助度量帮助解码野生中的技能神经元

Yixiu Zhao, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种方法,通过辅助度量解码技能神经元,验证了其在多种任务中的有效性。

Comments 7 pages, 7 figures. Includes additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21365 2025-11-27 cs.CV

PFF-Net: Patch Feature Fitting for Point Cloud Normal Estimation

PFF-Net:点云法向量估计的补丁特征拟合

Qing Li, Huifang Feng, Kanle Shi, Yue Gao, Yi Fang, Yu-Shen Liu, Zhizhong Han

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) School of Computer and Software Engineering, Xihua University(计算机与软件工程学院,西华大学) School of Software, Tsinghua University(软件学院,清华大学) Kuaishou Technology(快手科技) Center for Artificial Intelligence and Robotics, New York University Abu Dhabi(人工智能与机器人中心,纽约大学阿布扎克校区) Department of Computer Science, Wayne State University(计算机科学系,韦恩州立大学)

AI总结 PFF-Net通过多尺度特征融合和聚合,实现点云法向量估计的高效准确预测。

Comments Accepted by TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21150 2025-11-27 cs.CV cs.AI

LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs

LLaVA-UHD v3:渐进式视觉压缩用于多模态大语言模型中的高效原分辨率编码

Shichu Sun, Yichen Zhang, Haolin Song, Zonghao Guo, Chi Chen, Yidan Zhang, Yuan Yao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

AI总结 LLaVA-UHD v3通过渐进式视觉压缩方法,实现高效原分辨率编码,减少TTFT并提升多模态大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21129 2025-11-27 cs.CV cs.GR

CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion

通过统一多模态视频扩散实现可控视频生成

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, Xi Qiu, Jialun Liu, Hao Pan, Yuchi Huo, Rui Wang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学)

AI总结 CtrlVDiff通过统一多模态视频扩散模型,实现可控视频生成,支持多模态输入并提升生成的可控性和保真度。

Comments 27 pages, 18 figures, 9 tables. Project page: https://tele-ai.github.io/CtrlVDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20736 2025-11-27 cs.CY cs.AI cs.CL

Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts

大语言模型在社会法律情境中对非法指令的共谋回应

Xing Wang, Huiyuan Xie, Yiyan Wang, Chaojun Xiao, Huimin Chen, Holli Sargeant, Felix Steffek, Jie Shao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) University of Cambridge(剑桥大学)

AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20726 2025-11-27 cs.LG cs.AI

Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge

从风险学习:利用先验知识的LLM引导的安全关键场景生成

Yuhang Wang, Heye Huang, Zhenhua Xu, Kailai Sun, Baoshen Guo, Jinhua Zhao

机构 * Chinese Academy of Sciences, China(中国科学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院)

AI总结 本文提出利用LLM和CVAE生成安全关键场景的方法,通过知识驱动优化提升自动驾驶系统在罕见高风险事件下的鲁棒性与可控性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11473 2025-11-27 cs.CV

VA-GS: Enhancing the Geometric Representation of Gaussian Splatting via View Alignment

VA-GS: 通过视图对齐增强高斯散射的几何表示

Qing Li, Huifang Feng, Xun Gong, Yu-Shen Liu

机构 * Southwest Jiaotong University(西南交通大学) Xihua University(西华大学) Tsinghua University(清华大学)

AI总结 VA-GS通过视图对齐提升高斯散射的几何表示,结合边缘感知和可见性感知损失,优化表面重建与多视图一致性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03394 2025-11-27 cs.CV

Learning Normals of Noisy Points by Local Gradient-Aware Surface Filtering

通过局部梯度感知的表面过滤学习噪声点的法线

Qing Li, Huifang Feng, Xun Gong, Yu-Shen Liu

机构 * Southwest Jiaotong University(西南交通大学) Xihua University(西华大学) Tsinghua University(清华大学)

AI总结 本文提出一种基于局部梯度感知的表面过滤方法,用于从噪声点云中学习法线,通过隐式函数和投影约束提升法线估计和表面重建性能。

Comments Accepted by ICCV 2025. Project page: https://leoqli.github.io/LGSF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12336 2025-11-27 cs.CV

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09474 2025-11-27 cs.SE cs.AI cs.OS

MigGPT: Harnessing Large Language Models for Automated Migration of Out-of-Tree Linux Kernel Patches Across Versions

MigGPT:利用大语言模型实现跨版本的Linux内核非官方补丁自动化迁移

Pucheng Dang, Di Huang, Dong Li, Kang Chen, Yuanbo Wen, Qi Guo, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

AI总结 MigGPT通过新颖的代码指纹结构和三个精心设计的模块,提高非官方内核补丁迁移的准确性和效率,平均完成率达74.07。

详情

展开后加载摘要…

URL PDF HTML 收藏