When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception
当LLM学会一致错误:合成欺骗的线性表示的多模型研究
Vahideh Zolfaghari
机构
*
Algoverse AI Research
;
Medical Sciences Education Research Center, Mashhad University of Medical Sciences(马什哈德大学医学科学教育研究中心)
;
Student Research Committee, Department of Health Information Technology and Management, Medical Informatics, School of Allied Medical Sciences, Shahid Beheshti University of Medical Sciences(谢赫·贝赫什提大学医学科学学院学生研究委员会,健康信息科技与管理系,医学信息学)
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
SPARD: 通过安全投影与相关性-多样性数据选择防御有害微调攻击
Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang
机构
*
Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系)
;
Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)
;
Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)
;
Platform and Content Group, Tencent(腾讯平台与内容组)
;
Chinese Medicine Guangdong Laboratory(广东中医实验室)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
原子技能是前提:当强化学习合成组合推理时,以及当它仅放大时
Sitao Cheng, Xunjian Yin, Ruiwen Zhou, Yuxuan Li, Xinyi Wang, Liangming Pan, William Yang Wang, Victor Zhong
机构
*
University of Waterloo(滑铁卢大学)
;
Duke University(杜克大学)
;
National University of Singapore(新加坡国立大学)
;
Princeton University(普林斯顿大学)
;
Peking University(北京大学)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion
超越温度:超拟合作为晚期几何扩展
Meimingwei Li, Yuanhao Ding, Esteban Garces Arias, Christian Heumann
机构
*
Department of Statistics, LMU Munich(慕尼黑大学统计系)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))
;
School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking
ECPO:基于证据的策略优化用于证据认证的候选者排序
Miaobo Hu, Shuhao Hu, BoKun Wang, Yina Sa, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)