Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training
为什么强化学习比监督微调在泛化能力上更优?一种以数据为中心的视觉语言模型后训练视角
Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun
机构
*
College of Computer Science, Sichuan University(四川大学计算机科学学院)
;
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
机构
*
College of Mathematics and System Science, Xinjiang University, Urumqi, Xinjiang, China(数学与系统科学学院,新疆大学)
;
Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(地理科学与自然资源研究所,中国科学院)
;
Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hong Kong, China(工业与系统工程系,香港理工大学)
;
Xinya College, Tsinghua University, Beijing, China(清华学院)
;
College of Architectural Engineering, Xinjiang University, Urumqi, Xinjiang, China(建筑工程学院,新疆大学)
1%>100%: High-Efficiency Visual Adapter with Complex Linear Projection Optimization
1%>100%: 高效视觉适配器与复杂线性投影优化
Dongshuo Yin, Xue Yang, Deng-Ping Fan, Shi-Min Hu
机构
*
BNRist, Department of Computer Science
;
Technology, Tsinghua University, Beijing, China
;
School of Automation
;
Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China
;
Nankai lnternational Advanced Research Institute (Shenzhen Futian) \& SLAI, Shenzhen, China
ArtisanGS: Interactive Tools for Gaussian Splat Selection with AI and Human in the Loop
ArtisanGS: 带有AI和人机协作的高斯点选择交互工具
Clement Fuji Tsang, Anita Hu, Or Perel, Carsten Kolve, Maria Shugrina
机构
*
NVIDIA
;
NVIDIA Canada(NVIDIA 加拿大)
;
University of Toronto Canada(多伦多大学 加拿大)
;
NVIDIA France(NVIDIA 法国)
;
University of Toronto(多伦多大学)
;
Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致)
;
Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所)
;
Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度)
;
Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国)
;
Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
跨模态冲突下的全方位安全:漏洞、动态机制和高效对齐
Kun Wang, Zherui Li, Zhenhong Zhou, Yitong Zhang, Yan Mi, Kun Yang, Yiming Zhang, Junhao Dong, Zhongxiang Sun, Qiankun Li, Yang Liu
机构
*
Nanyang Technological University(南洋理工大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Tsinghua University(清华大学)
;
Fudan University(复旦大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Renmin University of China(中国人民大学)
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准
Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, Chen Gao, Wei Wu, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Yong Li
机构
*
Tsinghua University, Beijing, China(清华大学)
;
Shanghai Jiao Tong University, Shanghai, China(上海交通大学)
;
The University of Hong Kong, Hong Kong SAR, China(香港大学)
;
Princeton University, Princeton, NJ, USA(普林斯顿大学)
;
Chinese Academy of Sciences, Beijing, China(中国科学院)
;
University of Science(科学技术大学)
;
Peking University, Beijing, China(北京大学)
;
National University of Singapore, Singapore(新加坡国立大学)
DiffuTester: Accelerating Unit Test Generation for Diffusion LLMs via Mining Structural Pattern
DiffuTester: 通过挖掘结构模式加速扩散大语言模型的单元测试生成
Lekang Yang, Yuetong Liu, Yitong Zhang, Jia Li
机构
*
College of AI, Tsinghua University(清华大学人工智能学院)
;
School of Software, Beihang University(北航软件学院)
;
School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)
PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试
Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma
机构
*
The University of Sydney(悉尼大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Fudan University(复旦大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Michigan State University(密歇根州立大学)
;
Tsinghua University(清华大学)
;
Beihang University(北航大学)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
从无害到有害:通过对抗隐喻 jailbreak 语言模型
Yu Yan, Sheng Sun, Zenghao Duan, Teli Liu, Min Liu, Zhiyi Yin, Jingyu Lei, Qi Li
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
People’s Public Security University of China(中国人民公安大学)
;
Tsinghua University(清华大学)