Self-QA: Unsupervised Knowledge Guided Language Model Alignment
专题命中 其他安全 :alignment(title);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 其他安全 :alignment(title);分类 cs.CL
专题命中 其他安全 :alignment(title);分类 cs.CL
Comments Accepted to Findings of EMNLP, 2022
专题命中 其他安全 :alignment(title);分类 cs.CL
Comments CVPR 2022
专题命中 其他安全 :alignment(title);分类 cs.LG
Comments Code available: https://github.com/biolearning-stadius/chemgrapher-self-rich-labeling
专题命中 其他安全 :alignment(title);分类 cs.LG
专题命中 其他安全 :safety(title);分类 cs.LG
Comments 5 pages, 7 figures
Journal ref 2021 12th International Conference on Computing Communication and Networking Technologies (ICCCNT)
专题命中 其他安全 :alignment(title);分类 cs.CL
Comments Accepted at MRQA Workshop 2021
专题命中 其他安全 :alignment(title);分类 cs.CL
Comments Accepted at NAACL2021
专题命中 其他安全 :alignment(title);分类 cs.LG
专题命中 其他安全 :safety(title);分类 cs.LG
Comments In the Conference on Robotic Learning 2020
专题命中 其他安全 :alignment(title);分类 cs.LG
Comments 6 pages, 7 figures, 2019 18th IEEE International Conference on Machine Learning and Applications (ICMLA)
专题命中 其他安全 :safety(title);分类 cs.CY
Comments Presented at AAAI FSS-19: Artificial Intelligence in Government and Public Sector, Arlington, Virginia, USA
专题命中 其他安全 :safety(title);分类 cs.LG
Comments 16 pages, 15 figures, 4 tables
专题命中 其他安全 :alignment(title);分类 cs.CL
Comments Published at ACL-SRW 2018
Journal ref Proceedings of ACL 2018, Student Research Workshop. 2018
专题命中 其他安全 :safety(title);分类 cs.AI
Comments 4 pages, 1 figure
Journal ref published in ACM Chapters Computer Science in Cars Symposium (CSCS-17). Munich, Germany. 2017
专题命中 其他安全 :safety(title);分类 cs.AI
Journal ref EPTCS 224, 2016
专题命中 其他安全 :alignment(title);分类 cs.AI
Journal ref Decision Support Systems 42, 608-625, 2006
智能体何时可以停止?带证据的工具使用大语言模型终止机制
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。
面向时间序列的ORBIT:基础模型的训练机制
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对时间序列基础模型训练分布控制不足的问题,提出ORBIT训练范式,结合多级采样与增量训练,训练Falcon-2.0模型并引入Rank引导跨深度对齐,在多基准测试中展现优异零样本预测性能。
如何验证概率断言的一致性
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
FedVAR:用于视频异常识别的原型对齐联邦框架
机构 * Chungbuk National University(忠北国立大学) ; Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) ; University of Central Florida(中佛罗里达大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。
通过模型投毒规避思维链监控
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。
Comments 15 pages, 2 figures
构造驱动注入:用于大语言模型的基于语言基础编辑的代码混合指纹
专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型易被滥用问题,提出统一指纹框架。通过LCF按规则构造代码混合指纹,再用LCFEdit结合多语言表示和跨语言对齐注入指纹,实现构造感知注入,确保更新稳定,能持续验证所有权且对模型效用影响小。
机械性地引发语言模型中的潜在行为
机构 * Principles of Intelligence(智能原理研究所) ; Anthropic(Anthropic公司) ; Independent(独立)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。
噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标
机构 * Independent Researcher(独立研究员)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。
可操作的可解释性必须根据对称性来定义
机构 * University of Oxford(牛津大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文论证AI可解释性研究存在根本性问题,提出可操作的可解释性应基于四种对称性来定义,以形式化可解释模型并统一可解释推理。
MidSteer:用于引导生成模型的最优仿射框架
机构 * University of Basel(巴塞尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。
真相、信任与麻烦:边缘上的医疗AI
机构 * Jamia Hamdard(贾迈亚哈姆达德大学) ; DSEU-Okhla ; Macquarie University(麦考瑞大学) ; Center for SDGC, Stanford University(SDGC中心,斯坦福大学)
专题命中 其他安全 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 通过一个包含1000多个健康问题的基准测试框架,评估Mistral-7B、BioMistral-7B-DARE和AlpaCare-13B三个模型在诚实、有用性和无害性方面的表现,发现AlpaCare-13B准确率最高(91.7%)且无害性最佳(0.92),而领域微调可提升安全性,少样本提示能提高准确率,但复杂查询下有用性下降。
Comments Accepted at EMNLP 2025 (Industry Track)
何时与多久?时间推理中的读出-中介角度
机构 * Bioscope AI
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 通过测量线性探针与模型实际计算子空间之间的角度,发现探针可能学习与模型无关的正交方向,从而揭示基于探针的可解释性存在根本缺陷。