Beyond Her: Safety Dynamics in Role-play AI Companions
超越《她》:角色扮演AI伴侣中的安全动态
专题命中 安全评测 :safety(title,abstract)
AI总结 通过混合方法研究,揭示角色扮演AI伴侣使用中用户内化问题、AI角色人格和风险互动模式共同塑造安全动态,并发现短期情绪缓解与长期恶化并存的趋势,提出自适应安全防护设计。
Comments Under review
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
超越《她》:角色扮演AI伴侣中的安全动态
专题命中 安全评测 :safety(title,abstract)
AI总结 通过混合方法研究,揭示角色扮演AI伴侣使用中用户内化问题、AI角色人格和风险互动模式共同塑造安全动态,并发现短期情绪缓解与长期恶化并存的趋势,提出自适应安全防护设计。
Comments Under review
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
专题命中 安全评测 :safety(title,abstract)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
RefAlign:参考到视频生成的表示对齐
机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) ; Baidu Inc.(百度公司) ; PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) ; College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
专题命中 安全评测 :alignment(title,abstract)
AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。
Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/
CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; Khalifa University(哈利法大学)
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。
SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估
专题命中 安全评测 :safety(title,abstract)
AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。
Comments Accepted by DAC 2026
Jolia: 用于3D CT对比学习的概念级视觉-语言对齐
机构 * Raidium ; Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP(欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) ; Faculté de Santé, Université Paris-Cité(巴黎西岱大学健康学院) ; HEKA, INRIA(HEKA,法国国家信息与自动化研究所) ; Imaging Department, Fondation Ophtalmologique Adolphe de Rothschild(阿道夫·罗斯柴尔德眼科基金会影像科)
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出ConQuer方法,通过概念查询将报告拆分为特定概念部分,学习交叉注意力查询以匹配图像特征,实现概念级对齐,在胸部与腹部CT上训练的Jolia模型在多项任务中超越CLIP基线。
使用取证知识图谱的可信图像认证
机构 * Drexel University(德雷塞尔大学)
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。
Comments Accepted and Published at ECCV 2026
为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐
专题命中 安全评测 :alignment(title,abstract)
AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。
TDML -- 一个可信的分布式机器学习框架
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出TDML框架,利用区块链协调远程训练器并验证工作负载,实现隐私、透明和高效的模型训练,克服性能限制和恶意节点检测。
一种65纳米可信赖的低血糖预测引擎,每次推理能耗11.3 nJ
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出基于概率决策树的低血糖预测引擎,采用混合架构降低复杂度,在65 nm CMOS上实现11.3 nJ/推理和0.825的F1分数,对传感器噪声鲁棒性提升4.1-16.1倍。
Comments Submitted to IEEE Transactions on Circuits and Systems I: Regular Papers (TCAS-I)
SwarmSense-DNN:面向消费物联网中主动异常防御的可信去中心化神经框架
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出SwarmSense-DNN,一种结合群体智能与深度神经网络的去中心化框架,通过分层联邦学习与图注意力机制实现分布式IoT环境中的协同异常检测,在五个基准数据集上达到95.44%平均检测精度并降低67%通信开销。
Comments 11 pages, 14 figures
什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断
机构 * HKUST(香港理工大学) ; FDU(福建大学) ; ZJU(浙江大学) ; NUS(新加坡国立大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。
TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) ; Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。
Comments 20 pages, 13 figures, 14 tables
迈向可信的AI代理无线网络优化数字孪生:挑战、解决方案与机遇
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出一种新的数字孪生评估框架,用于确保AI代理基于网络优化的数字孪生的可信度,通过任务导向的评估方法减少训练和测试成本,同时保持部署性能。
大语言模型时代的可信推荐:机遇与挑战
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文系统综述了大语言模型增强推荐系统在可信性方面的双重影响,识别出13个机遇和18个挑战,并构建了新的分类体系。
当AI遇见华尔街:金融科技中可信AI综述
专题命中 安全评测 :trustworthy(title);prompt injection(abstract)
AI总结 本文提出一个以生命周期为中心、机制驱动的统一框架,将金融AI分为训练更新、部署推理、运营监控三个阶段,并构建金融AI安全与鲁棒性分类法,涵盖17种攻击子类型,分析其算法策略、可行性约束、隐蔽性与持久性及下游金融后果,最后指出开放挑战并规划研究议程。
原型引导的潜在对齐用于分子基础模型的数据高效微调
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出基于原型的对齐方法,通过将目标域原子的能量贡献对齐到源域原型,实现分子基础模型在低数据下的高效微调,在rMD17和SPICE数据集上能量MAE降低高达18%。
Comments 17 pages, 3 figures
城市交叉口异构移动体的可微分模型预测安全
机构 * School of Business(商学院) ; Department of Mechanical Engineering(机械工程系) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 提出可微分模型预测安全(DMPS)框架,将模型预测控制的前瞻性嵌入数据驱动的端到端强化学习架构,通过可微分安全评价器实现精确在线安全校正,在高密度混合交通仿真中将碰撞率降至5.6%以下。
Comments 6 pages. Published in IEEE IARCE 2025
Journal ref 2025 IEEE 5th International Conference on Industrial Automation, Robotics and Control Engineering (IARCE), Chongqing, China, 2025, pp. 1-6
大型预训练视觉语言模型能否成为有效的施工安全检查员?
机构 * Mechanical Engineering(机械工程)
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出ConstructionSite 10k数据集,包含1万张施工图像及三项任务标注,评估大型预训练视觉语言模型在零样本和小样本下的泛化能力,为施工安全检查提供基准。
无证书,不执行:认证轨迹作为可信AI代理的基础
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。
MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型
机构 * University of Georgia(佐治亚大学) ; Harvard Medical School(哈佛医学院) ; Chungbuk National University(Chungbuk国立大学) ; Chungnam National University Hospital(Chungnam国立大学医院) ; National University of Singapore(新加坡国立大学) ; New York University(纽约大学) ; University of Sydney(悉尼大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。
重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡
专题命中 安全评测 :safety(title,abstract)
AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。
Comments 19 pages, 3 figures
PseudoBridge: 伪代码作为连接语义与逻辑的桥梁以提升代码检索性能
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出PseudoBridge框架,通过引入伪代码作为中间半结构化模态,解决自然语言与编程语言之间的语义和逻辑对齐问题,实验表明其在代码检索任务中表现优异,尤其在零样本场景中效果显著。
Comments 42 pages, 14 figures, 8 tables
生成车辆-行人交互的安全关键场景
机构 * Transportation Informatics Lab, Department of Civil and Environmental Engineering, Old Dominion University(交通信息实验室,土木与环境工程系,旧 Dominion 大学) ; Inner Mongolia Center for Transportation Research, Inner Mongolia University(内蒙古交通研究所,内蒙古大学) ; School of Transportation and Logistics, National Engineering Laboratory of Integrated Transportation Big Data Application Technology, National and Local Joint Engineering Research Center of Integrated Transportation Intelligence, Southwest Jiaotong University(交通运输学院,国家集成交通大数据应用技术工程实验室,国家与地方联合集成交通智能工程研究中心,西南交通大学)
专题命中 安全评测 :safety(title,abstract)
AI总结 本文提出了一种三阶段框架,结合现实数据与自适应模拟,生成大规模行为真实的安全关键场景,通过多智能体状态空间Transformer增强DDPG算法,在车辆-行人交互中实现了高精度的避让行为生成,最终生成了VPSCI数据集。
Comments 49 pages, 13 figures, 11 table
全面的漏洞分析对于可信的LLM-MAS至关重要
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。
VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型
机构 * Peking University(北京大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 安全评测 :alignment(title,abstract)
AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。
OpenSGA: 在开放世界中高效的3D场景图对齐
机构 * Autonomous Multi-Robots Lab, Department of Cognitive Robotics, School of Mechanical Engineering, Delft University of Technology, 2628 CD, Delft, Netherlands(代尔夫特理工大学机械工程学院认知机器人学系自主多机器人实验室) ; Mobile Robotics Lab, School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院移动机器人实验室)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出OpenSGA框架,通过融合视觉-语言、文本和几何特征实现高效的3D场景图对齐,包含空间注意力编码器、最小成本流分配器和全局场景嵌入生成器模块,实验表明在F2S和S2S任务中表现最佳。
Comments 13 figures
探索临床因素在零样本分割VLMs中的提示对齐用于NSCLC肿瘤分割
机构 * Artificial Intelligence in Medicine Program, Mass General Brigham, Harvard Medical School, USA(麻省总医院布里奇沃特医学中心人工智能医学项目,哈佛医学院,美国)
专题命中 安全评测 :alignment(title,abstract)
AI总结 研究通过分析VoxTell在NSCLC肿瘤数据集上的提示对齐方向,发现解剖位置主导空间注意力,零样本分割VLMs在NSCLC肿瘤分割中表现优于其他模型。
架构隔离作为边缘AI医疗设备的定时安全原语:在共享硅平台上的受控实验证据
专题命中 安全评测 :safety(title,abstract)
AI总结 研究通过受控实验验证架构隔离在保持准确性与输出稳定性的同时,如何影响边缘AI医疗设备的定时约束,提出联合STER和延迟验证作为FDA指南的候选方法。
Comments 10 pages, 3 figures, 5 tables. Submitted to IEEE Embedded Systems Letters
弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。