International AI Safety Report 2026
2026国际人工智能安全报告
专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 2026国际人工智能安全报告由全球29国及国际组织共同参与,汇集超过100位专家意见,全面评估通用人工智能系统的安全性和潜在风险。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
2026国际人工智能安全报告
专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 2026国际人工智能安全报告由全球29国及国际组织共同参与,汇集超过100位专家意见,全面评估通用人工智能系统的安全性和潜在风险。
基于扩展Scenic DSL的LLM驱动场景生成流水线用于自动驾驶安全验证
专题命中 其他安全 :safety(title,abstract)
AI总结 本文提出基于扩展Scenic DSL和LLM的场景生成流水线,实现高精度自动驾驶安全验证。
ID-LoRA: 基于矩阵插值分解的高效低秩适应
机构 * Tianjin University(天津大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 ID-LoRA通过基于矩阵插值分解的低秩适应方法,在减少可训练参数的同时保持模型容量,优于现有PEFT技术。
PromptCD:通过极性提示对比解码提升测试时行为
专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.AI
AI总结 PromptCD通过极性提示对比解码在测试时提升LLM和VLM的行为一致性,实现无需额外训练的广泛增强。
通过反向传播编程:在微调LLMs时,一条指令的价值相当于100个示例
机构 * FLAIR, University of Oxford(FLAIR,牛津大学) ; Cohere & Cohere Labs(Cohere及Cohere实验室) ; Anthropic ; UCL AI Centre(UCL人工智能中心) ; MIT(麻省理工学院)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过反向传播编程(PBB)使LLMs能从声明性指令中学习程序性知识,提升训练效率并减少对大量示例的依赖。
GLM-5:从振动编码到代理工程
机构 * GLM-5 Team(GLM-5团队) ; Zhipu AI(智谱AI) ; Tsinghua University(清华大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 GLM-5通过异步强化学习和DSA技术实现高效训练与推理,展现卓越的软件工程能力。
数据并行全微调中的沉默不一致:诊断工作级别优化不一致
机构 * School of Transportation Southeast University(交通学院东南大学) ; Department of Logistics and Maritime Studies The Hong Kong Polytechnic University(物流与海运研究部香港理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种轻量诊断框架,用于检测数据并行微调中工作级别优化的不一致问题,通过损失分散度、梯度范数分散度和方向一致性指标,揭示隐藏的不稳定性模式。
Comments 9 pages, 8 figures
CryoLVM: 从冷冻电镜密度图中利用大视觉模型进行自监督学习
机构 * State Key Laboratory of Membrane Biology, Beijing Frontier Research Center of Biological Structures, Tsinghua-Peking Joint Center for Life Sciences, School of Life Sciences, Tsinghua University, Beijing, China(膜生物学国家重点实验室,北京生物结构前沿研究中心,清华-北大联合生命科学中心,生命科学学院,清华大学,北京,中国) ; State Key Laboratory of Membrane Biology-Membrane Structure and Artificial Intelligence Biology Branch,Hangzhou, China(膜生物学国家重点实验室-膜结构与人工智能生物学分支,杭州,中国) ; State Key Laboratory of Membrane Biology, Beijing Tsinghua Institute for Frontier Interdisciplinary Innovation, Beijing, China(膜生物学国家重点实验室,北京清华大学前沿交叉创新研究院,北京,中国)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 CryoLVM通过自监督学习从冷冻电镜密度图中提取结构信息,结合JEPA与SCUNet实现高效适应多种下游任务,提升密度图处理性能。
构建AgentOS:从令牌级上下文到涌现的系统级智能
机构 * Yishu Research(亿舒研究) ; Fukuoka Institute of Technology(福冈技术学院) ; National University of Singapore(新加坡国立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出AgentOS框架,通过重构LLM为推理内核,引入深度上下文管理和语义切片机制,旨在构建具备系统级智能的自主认知环境。
Comments 16 pages,9 figures
BioX-Bridge:生物信号跨模态知识迁移的模型桥接
机构 * Department of Engineering Science University of Oxford(工程科学系 奥克大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 BioX-Bridge通过轻量级桥接网络实现生物信号跨模态无监督知识迁移,显著减少可训练参数并提升迁移性能。
混合LLM嵌入对话代理用于学习者反思:设计响应性且理论驱动的互动
机构 * University of Pittsburgh(匹兹堡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Bowie State University(鲍威州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出一种混合对话系统,结合LLM的响应能力与理论驱动的规则框架,以支持学习者反思,但发现其在提高反思深度的同时也带来了一些挑战。
ParkDiffusion++: 基于扩散模型的多智能体轨迹预测用于自动化停车的自我意图条件联合预测
机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) ; CARIAD SE
专题命中 其他安全 :safety(abstract)
AI总结 ParkDiffusion++通过联合学习多智能体轨迹预测与自我意图预测,实现自动化停车中的高效假设决策与安全预测。
Comments ICRA 2026 Camera Ready Version
GatedCLIP:用于仇恨表情包检测的门控多模态融合
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 其他安全 :alignment(abstract)
AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。
Comments Preprint