Chart What I Say: Exploring Cross-Modality Prompt Alignment in AI-Assisted Chart Authoring
专题命中 其他安全 :alignment(title)
Comments Will be published In Extended Abstracts of the CHI Conference on Human Factors in Computing Systems (CHI EA 2024)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 其他安全 :alignment(title)
Comments Will be published In Extended Abstracts of the CHI Conference on Human Factors in Computing Systems (CHI EA 2024)
专题命中 其他安全 :safety(title)
专题命中 其他安全 :alignment(title)
专题命中 其他安全 :alignment(title)
专题命中 其他安全 :alignment(title)
专题命中 其他安全 :alignment(title)
Comments Accepted in INTERSPEECH 2021
专题命中 其他安全 :safety(title)
专题命中 其他安全 :safety(title)
Comments 8 tables, 2 figures, 7 pages, accepted after peer review as a workshop paper in ACM Conference on Health, Inference, and Learning (CHIL) 2020 https://www.chilconference.org/agenda/
专题命中 其他安全 :safety(title)
Comments The 38th AIAA/IEEE Digital Avionics Systems Conference (DASC)
专题命中 其他安全 :alignment(title)
Comments 30 pages, 15 figures
专题命中 其他安全 :alignment(title)
Comments 6 figures
专题命中 其他安全 :safety(title)
RACE:LLM神经元中功能一致性的可扩展统计估计
机构 * Nantong University(南通大学) ; Chongqing University of Post and Telecommunications(重庆邮电大学) ; China Southern Power Grid Company Limited(中国南方电网有限责任公司) ; Meituan(美团)
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI
AI总结 针对LLM神经元功能一致性的可扩展统计估计难题,提出RACE框架,其领域特异性更优、计算开销低两个数量级,可有效评估Transformer神经元的全领域功能一致性。
Comments EMNLP-26 Main Conference
人工智能引发的哲学眩晕
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CY
AI总结 该研究提出人工智能引发的哲学眩晕概念,分析其产生、传播路径,关联临床妄想案例,指出AI将参与重构人类认知环境,并提出哲学可修正性作为应对对策。
Comments 29 pages, no figures. Source formatting revised to improve arXiv HTML accessibility; article text unchanged
链式思维验证器的在线可学习性:正确性与完备性的权衡
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Northwestern University(西北大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出一种在线学习框架,用于学习链式思维验证器,通过检查解决方案的正确性,解决生成器与验证器之间的反馈循环导致的分布偏移问题,并引入新的Littlestone维度扩展以优化验证器的学习。
Comments The abstract has been abridged due to arXiv length constraints
长期测量:迈向对人机交互的纵向理解
机构 * Google Research(谷歌研究院) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究针对语言模型融入生活引发的长期人机交互风险,结合社会科学测量与NLP计算方法,提出通过长期测量建模人类行为变化,实现问题行为在线检测以缓解用户长期风险。
诊断推理模型中的病理链式思维
机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) ; Imperial College London, London, UK(伦敦帝国学院) ; McGill University, Montreal, Canada(麦吉尔大学) ; Geodesic Research, Cambridge, UK(Geodesic研究)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。
利用知识图谱和大语言模型自动化因果规范生成
机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。
压缩感知在大语言模型能力定位中的应用
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。
关于提示条件语言模型作为通用学习器的局限性
机构 * Queen Mary University London(伦敦玛丽女王大学) ; University College London(伦敦大学学院)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。
说服指数:一个理论指导的说服分析框架
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; New York University(纽约大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 提出基于心理学和传播学理论的15维说服指数(PI)及55个子特征实现,在四个数据集上验证其能解释说服相关修辞模式,并提供轻量级预测信号。
基于场景的大型语言模型文化价值观探测与引导——扩展版
机构 * University of Copenhagen(哥本哈根大学) ; Aalborg University(奥尔堡大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 提出基于场景的行为困境方法,通过令牌级概率和激活引导探测并调整LLM在英格尔哈特-韦尔泽尔文化轴上的潜在价值观,发现不同文化维度的引导存在耦合效应。
Comments 18 pages
AI的不可预测性
机构 * Computer Engineering and Computer Science University of Louisville(计算机工程与计算机科学路易斯维尔大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文研究了AI安全领域中一个核心问题,即智能系统的行为预测难题,证明了即使知道终端目标,也无法准确预测超人类智能系统的行为,对AI安全产生了深远影响。
机制设计是不够的:面向合作AI的亲社会智能体
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Institute for Decentralized AI(去中心化人工智能研究所) ; Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室及向量研究所) ; EuroSafeAI ; University of Pennsylvania(宾夕法尼亚大学) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文证明仅靠机制设计无法最大化LLM智能体的社会福利,并提出亲社会智能体(兼顾他人福利)能弥补这一差距,实现更优的社会与个体结果。
Comments 42 pages
LoRA适配器的特征几何:微调语言模型中表示差异的稀疏自编码器分析
机构 * Independent AI Safety Researcher(独立人工智能安全研究员)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本研究使用稀疏自编码器分析LoRA微调引起的表示几何变化,发现LoRA特征字典与预训练特征存在弱几何对齐,且适配器特定SAE能更有效重建delta激活。
诊断并非处方:语言共适应解释了LLM流水线中的修补危害
机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) ; NAVER Corp.(NAVER公司)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。
Comments Preprint. Under review at EMNLP 2026 (ARR)
DualOptim+: 联合与解耦优化器状态的桥梁以提升大语言模型中的机器反遗忘
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出DualOptim+,一种改进大语言模型中机器反遗忘的新优化框架,通过引入基础状态和delta状态,有效平衡遗忘与保留目标,同时提出8位量化变体以减少内存开销,实验表明其在多个任务中均表现出色。
Comments Accepted by ICML 2026
从整体到模块:分解转换器以实现高效的world建模
机构 * Department of Informatics, University of Sussex(Sussex大学信息学院) ; Beyond Institute for Theoretical Science (BITS)(理论科学研究所) ; ETH Zürich(苏黎世联邦理工学院) ; Principles of Intelligent Behaviour in Biological and Social Systems (PIBBSS)(生物和社会系统智能行为原理研究所) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Araya Inc.(Araya公司) ; Sussex AI and Sussex Centre for Consciousness Science, University of Sussex(Sussex大学人工智能与意识科学中心) ; Centre for Complexity Science and Center for Psychedelic Research, Department of Brain Sciences, Imperial College London(复杂科学中心和迷幻研究中心,伦敦帝国理工学院脑科学系) ; Center for Eudaimonia and Human Flourishing, University of Oxford(幸福与人类繁荣中心,牛津大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出了一种分解复杂world建模的方法,通过转换器框架将世界模型分解为多个模块,从而提高计算效率并支持分布式推理,为AI安全和现实应用提供基础。
通过反馈控制器激活控制
机构 * Department of Mathematics(数学系) ; Center for AI Research(人工智能研究中心) ; National University of Singapore(新加坡国立大学) ; VinUniversity(文大学) ; Torilab(Torilab实验室)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出PID激活控制方法,基于控制理论构建激活控制框架,通过P、I、D项实现激活对齐、误差累积和抑制超调,提升大语言模型行为控制的鲁棒性和可靠性。
Comments 10 pages in the main text. ICLR2026 Poster
走出洞穴:JAM用于对齐独立训练的视觉和语言模型
机构 * Computation and Neural Systems(计算与神经系统) ; California Institute of Technology(加利福尼亚理工学院) ; Computation and Mathematical Sciences(计算与数学科学) ; Google DeepMind(谷歌DeepMind)
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出JAM方法,通过联合训练模态特定的自编码器,优化视觉和语言模型的对齐,提升细粒度上下文区分能力。