Endogenous Resistance to Activation Steering in Language Models
语言模型中激活引导的内生抵抗
机构 * University of Washington(华盛顿大学)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
语言模型中激活引导的内生抵抗
机构 * University of Washington(华盛顿大学)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。
基于LLM的数字孪生的心理测量可比性
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 提出构念效度框架,评估LLM数字孪生在聚合、项目、网络和决策层面的心理测量可比性,发现其在高聚合准确性和网络结构上接近人类,但在项目级相关、启发式偏差和时变敏感性上存在差异。
Comments Also available as a preprint on OSF Preprints https://osf.io/preprints/psyarxiv/965yg_v2
隐喻是大推理模型跨领域失调的根源
机构 * The University of New South Wales(新南威尔士大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现训练数据中的隐喻会导致大推理模型在推理输出中出现跨领域失调,通过隐喻干预可显著改变失调程度,并设计出高精度检测器。
Comments 19 pages, 6 figures
FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则
机构 * Meharry Medical College(梅哈里医学院) ; The University of Texas at El Paso(德克萨斯理工大学) ; The University of Alabama(阿拉巴马大学) ; National Security Agency(国家安全局)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出FALCON框架,通过新颖的CTI-规则语义评分器实现规则检索、生成和验证,解决签名型入侵检测系统中规则创建的手动瓶颈和验证难题,在Snort和YARA平台上达到0.72平均相关性。
Comments 17 pages, 10 figures, 8 tables
从构建到注入:面向大型语言模型的基于编辑的指纹
机构 * East China Normal University(华东师范大学) ; Hasso Plattner Institute/University of Potsdam(哈索罗普拉特纳研究所/波茨坦大学)
专题命中 其他安全 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出端到端注入指纹框架,通过代码混合指纹和多候选编辑方法,解决黑盒部署中指纹的不可感知性和鲁棒性挑战。
Comments preprint
CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成
机构 * Pontificia Universidad Católica de Chile(智利天主教大学) ; CENIA ; iHEALTH ; KAUST(科威特皇家科学与技术局)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。
Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289
概念分配区:追踪概念如何跨越Transformer深度形成
机构 * Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。
Comments v2: substantial revision. Cross-architecture ordering statistic and MHA/GQA cohort-split claim retracted per recomputation; corpus and companion-paper citations refreshed. See paper's "Changes from Version 1" section for the full list of superseded values
TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。
Comments Accepted to Transactions on Machine Learning Research, 2026
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索
机构 * University of Michigan(密歇根大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。
面向红外光谱化学传感与分析的仿真到真实迁移学习:从分子到复杂样品
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Jilin University(吉林大学) ; University of Auckland(奥克兰大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Hunan University(湖南大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究针对红外光谱化学传感的迁移难题,提出超1亿参数的红外光谱基础模型UltraIR,经6000万仿真光谱预训练后,在多类化学分析任务中性能优于基线,且适配性与数据效率优异。
洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动
机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。
Comments Accepted at the Conference on Language Modeling (COLM) 2026
探索用于视觉参数高效微调的小波稀疏性
机构 * Dept. of Electrical and Electronics Engineering, Koç University(电子工程系,科奇大学) ; Codeway AI Research(Codeway人工智能研究) ; Dept. of Computer Engineering, Middle East Technical University(计算机工程系,中东技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出小波微调(WaveFT),利用权重矩阵小波域的稀疏更新实现细粒度参数控制,在视觉任务的参数高效微调方法中达最优,已纳入Hugging Face PEFT库。
欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。
自发现意图感知变换器用于多模态车辆轨迹预测
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于Transformer的多模态车辆轨迹预测模型,通过分离空间模块和轨迹生成模块提升预测性能,并通过预测残差偏移学习有序轨迹。
Comments 11 pages, 5 figures
全栈FP4:通过量化投影、优化器和注意力进行稳定的语言模型预训练
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sichuan University(四川大学) ; Beijing Zhongguancun Academy(北京中关村科学院) ; Zhejiang University(浙江大学) ; Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑科学与类脑研究中心通用人工智能大模型北京市重点实验室) ; Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑机智能技术重点实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究针对4位预训练中优化器状态等未充分探索的问题,提出全栈FP4框架。通过模块精度策略解决稳定性瓶颈,如用LoRA-SVD抑制量化噪声,设计优化器变换,采用混合精度方案,实现稳定高效的端到端预训练。
Comments Fix experiment bugs and some statement, update current developed hardware efficiency result on 5090
通过局部化架构增强AI可解释性与安全性
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 针对大型生成式AI模型可解释性差、计算成本高的问题,提出局部化机器学习架构,通过降低带宽、提高节点表达能力来提升可解释性和效率,并评估了多种硬件实现方案的适用性。
对称性揭示逐层动力学:Transformer如何执行上下文分类
机构 * Boston University, Departments of Computer Science
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 通过强制特征和标签排列等变性,从Transformer中提取出显式的深度索引递归更新规则,揭示了上下文分类的几何驱动算法。
Comments appears in the Proceedings of the 43rd International Conference on Machine Learning (ICML '26)
大型语言模型在创造性思维过程中与人类大脑对齐
机构 * EPFL(瑞士联邦理工学院洛桑) ; Università della Svizzera italiana (USI)(意大利语区大学(瑞士)) ; Wesleyan University(卫斯理大学) ; Paris Brain Institute (ICM)(巴黎大脑研究所) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了在创造性思维过程中,fMRI数据揭示了大脑与不同规模LLM之间的对齐关系,发现模型大小和想法原创性影响对齐程度,且训练目标影响表示与人类创造力神经几何的匹配程度。
Comments Accepted at COLM 2026
位置:可信的状态完整性在网络物理系统中——为什么模块主权解决塑性-稳定性悖论
机构 * Software/Hardware Integration Lab (LISHA), Department of Statistics and Informatics, UFSC, Florianópolis, Brazil(软件/硬件集成实验室(LISHA)、统计与信息学系,UFSC,弗洛里亚诺波利斯,巴西)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出模块主权范式,通过冻结领域特定专家和不确定性感知融合,解决网络物理系统中塑性-稳定性悖论,确保状态完整性和可验证性。
Comments v2, 15 pages, (8 main text, 6 references and appendices), 2 figures
ToolUniverse:一个让AI科学家开发民主化的开放平台
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Harvard College, Harvard University(哈佛大学哈佛学院) ; Massachusetts Institute of Technology(麻省理工学院) ; MIT Lincoln Laboratory(MIT林肯实验室) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Broad Institute of MIT and Harvard(MIT与哈佛联合广谱研究所) ; Harvard Data Science Initiative(哈佛数据科学计划)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 ToolUniverse是支持从各类模型构建AI科学家的开放平台,通过AI-工具交互标准规范工具调用,已应用于大量科学工具,案例中可完成多领域端到端分析。
Comments https://aiscientist.tools
LF²AR:考虑分层动态以改进语言模型的多模态适配
机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) ; Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) ; LIA, Avignon Université, France(法国阿维尼翁大学LIA) ; LIUM, Le Mans Université, France(法国勒芒大学LIUM) ; Zenidoc, Marseille, France(法国马赛Zenidoc)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。
Comments Published as a conference paper at COLM 2026
DeepLoop:循环变换器的深度缩放
机构 * Princeton University(普林斯顿大学) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。
Comments 25 pages
从专家演示中进行奖励分配的最小要素
机构 * New York University(纽约大学) ; New York University Abu Dhabi(纽约大学阿布扎赫尔分校) ; Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning, NYU Shanghai(上海前沿科学中心(人工智能与深度学习))
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 该研究探究从专家演示分配奖励的最小结构,通过32个基准测试和三种下游RL算法,发现离线场景仅需接近度,在线或多演示时需轻量级时间对应,倡导奖励设计的算法极简主义。
Comments Accepted by Reinforcement Learning Conference 2026
通过资源感知型语音编码器混合模型打破多对多语音到文本翻译中的多语言性诅咒
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对多对多语音到文本翻译中的多语言性诅咒问题,提出资源感知型MoSE框架与五阶段课程学习策略,其4B参数模型在45种语言的全方向翻译任务上实现最优性能,显著提升低资源语言表现且不损害高资源性能。
整合气象与运营数据:一种理解芬兰铁路延误的新方法
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本研究整合芬兰铁路运营与气象数据,首次公开用于分析铁路延误的多维数据集,通过时空对齐和工程特征提取,为预测延误和评估天气影响提供机器学习支持。
Comments 13 pages, 8 figures, database: https://www.kaggle.com/datasets/viniborin/finland-integrated-train-weather-dataset-fi-tw
大语言模型的解释可解释大脑中的语言表征
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究探究LLM与脑语言表征对齐的驱动因素,利用XAI的归因方法结合fMRI数据,发现梯度归因可稳健对齐脑活动,且不同层归因的特性与脑区域对齐模式存在差异。
平行四边形反击:LLM生成的类比优于人类
机构 * Princeton University(普林斯顿大学) ; The University of Hong Kong(香港大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究比较了人类和LLM在类比任务中的表现,发现LLM生成的类比更符合平行四边形结构,且人类在生成关系保持的类比时表现较差。
基于大语言模型的生成式推荐的隐式推理
机构 * University of Virginia(弗吉尼亚大学) ; Snap Inc.(Snap公司)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型用于生成式推荐时显式推理的三大局限(世界知识表达弱化、语义ID与自然语言嵌入空间不对齐、推理质量敏感),提出轻量级隐式推理范式PauseRec,在性能、训练成本和推理速度上均优于显式方法。
预测后扩散:面向扩散大语言模型的自适应响应长度计算
机构 * IEEE
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Predict-then-Diffuse框架,通过自适应响应长度预测器和安全机制,实现计算预算下的高效推理,减少计算成本并保持输出质量。
Comments Accepted for publication in IJCNN 2026 (International Joint Conference on Neural Networks)
记忆如何影响基于LLM的社会粒子群中的集体和合作行为
机构 * Graduate School of Informatics(信息学研究生院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大型语言模型代理的内部对齐特性如何影响记忆对其集体和合作动态的影响。通过将社会粒子群模型中的规则代理替换为具有大五人格特质和不同记忆长度的LLM代理,发现记忆长度是决定集体行为的关键参数,且不同模型对记忆的解读影响合作结果。
Comments 11 pages, 4 figures and 2 tables