Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing
对齐的辩证法:利用不安全知识实现动态安全路由
Maryam Hashemzadeh, Jerry Huang, Minseon Kim, Marc-Alexandre Côté, Sarath Chandar
机构
*
Chandar Research Lab(Chandar研究实验室)
;
Mila – Quebec AI Institute(魁北克AI研究所)
;
Université de Montréal(蒙特利尔大学)
;
Microsoft Research(微软研究院)
;
Polytechnique Montréal(蒙特利尔理工学院)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
Comments11 pages, 1 figure. v3: substantially revised and reframed as a measurement-methodology paper. Code, data, and an immutable Zenodo archive are available at https://github.com/Nakammura/effective-rank-audit (DOI: 10.5281/zenodo.20341444)
Safety Must Precede the Deployment of Open-Ended AI
安全必须优先于开放式AI的部署
Ivaxi Sheth, Jan Wehner, Sahar Abdelnabi, Ruta Binkyte, Mario Fritz
机构
*
CISPA-Helmholtz Center of Information Security(CISPA-海德堡信息安全中心)
;
MPI for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(智能系统Max Planck研究所、图宾根ELLIS研究所、图宾根人工智能中心)
A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models
面向临床神经科学中基于Transformer的语言模型的稳定可解释性的单语义归因框架
Michail Mamalakis, Tiago Azevedo, Cristian Cosentino, Chiara D'Ercoli, Subati Abulikemu, Zhongtian Sun, Richard Bethlehem, Pietro Lio
机构
*
Department of Computer Science and Technology(计算机科学与技术系)
;
Cancer Research UK(癌症研究英国公司)
;
Cambridge Institute(剑桥研究所)
;
University of Cambridge(剑桥大学)
;
United Kingdom(英国)
;
DIMES(迪梅斯)
;
University of Calabria(卡拉布里亚大学)
;
Italy(意大利)
;
Department of Computer Automatic and Management Engineering (DIAG)(计算机自动与管理工程系)
;
Sapienza Università di Roma(罗马大学萨皮恩扎)
;
Department of Psychiatry(精神病学系)
;
School of Computing(计算学院)
;
University of Kent(肯特大学)
;
Department of Psychology(心理学系)
Dynamic Proxy-Mixing: Transferring Replay Controllers from Small to Large Models for Continual Instruction Tuning
动态代理混合:将重放控制器从小模型迁移到大模型以进行持续指令微调
Ibne Farabi Shihab, Fariya Afrin, Anuj Sharma
机构
*
Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系)
;
Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系)
;
Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建筑与环境工程系)
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
SCOPE: 信号校准的在线策略蒸馏增强与双路径自适应加权
Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu, Kepeng Lin, Benchang Zhu, Ke Zeng, Xunliang Cai
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Meituan LongCat Interaction Team(美团 LongCat 交互团队)
;
Nanjing University(南京大学)
;
Fudan University(复旦大学)
;
Huazhong University of Science and Technology(华中科技大学)
HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems
HarnessForge:面向自适应智能体系统的协同框架与策略进化
Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou
机构
*
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学)
;
Tsinghua University(清华大学)