The Impact of Heatwaves on Population Health: A Large Language Model-Enhanced Agent-Based Simulation
热浪对人口健康的影响:一种增强型大语言模型的群体模拟
专题命中 安全评测 :safety(abstract)
AI总结 本文通过增强型大语言模型进行群体模拟,研究热浪对人口健康的影响,发现心理社会因素在社区韧性中的作用,并提出针对脆弱群体的干预措施。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
热浪对人口健康的影响:一种增强型大语言模型的群体模拟
专题命中 安全评测 :safety(abstract)
AI总结 本文通过增强型大语言模型进行群体模拟,研究热浪对人口健康的影响,发现心理社会因素在社区韧性中的作用,并提出针对脆弱群体的干预措施。
反向流动:大型多模态模型中的生成到理解协同效应
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出生成到理解协同效应,通过生成过程作为中间推理步骤提升多模态理解,揭示生成与理解的双向关系及模型自我反思的不足。
Comments Accepted by CVPR 2026 Findings
UntrustVul: 一种自动识别漏洞检测模型中不可信警报的方法
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出UntrustVul方法,通过识别与漏洞无关的代码行来自动检测不可信的漏洞预测,实验表明其在AUC和F1-score上优于现有方法。
Comments Preprints, Accepted to IEEE Transactions on Software Engineering
PCASim:可提示的闭环对抗模拟用于城市交通环境
机构 * Shenzhen Research Institute of Shandong University(山东大学深圳研究院) ; School of Airspace Science and Engineering(空天科学与工程学院) ; School of Computer Science and Technology(计算机科学与技术学院)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出PCASim框架,通过结合对抗场景生成与安全代理训练,提升城市交通环境中的安全性和鲁棒性,实验表明其在领域特定语言生成准确率、场景转换成功率和避障能力方面均有显著提升。
Real2Sim在HOI中的应用:从单目视频中向物理合理性迈进的HOI重建
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tencent IEG(腾讯IEG)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出HA-HOI框架,通过单目视频重建物理合理的4D HOI动画,改进了人-物对齐、接触一致性、时间稳定性及模拟准备性。
DAPL: 文本基于人物搜索中正负描述的整合
机构 * Sichuan University(四川大学) ; Renmin University of China(中国人民大学)
专题命中 安全评测 :alignment(abstract)
AI总结 DAPL通过整合正负描述提升文本基于人物搜索中视觉-语言模型的解释准确性,结合DIAC和SIAM学习,引入DTS损失以平衡视觉与文本嵌入的粗细粒度对齐,提升匹配精度和鲁棒性。
Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)
生成3D行人纹理多样化以实现自动驾驶感知的鲁棒性
机构 * BIT Technology Solutions GmbH(比特技术解决方案 GmbH) ; Mannheim University of Applied Sciences(曼海姆应用科学大学)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出一种简单有效的方法,通过StyleGAN2生成多样化的3D行人资产,用于合成场景生成,提升自动驾驶感知的鲁棒性。
Comments Published at SAIAD 2026 Workshop at CVPR 2026
Qwen-Image-VAE-2.0 技术报告
机构 * Qwen Team(通义实验室)
专题命中 安全评测 :alignment(abstract)
AI总结 Qwen-Image-VAE-2.0 提出了一种高压缩变分自编码器,通过改进架构和训练方法,提升了重建保真度和扩散能力,同时引入了新的评估基准。
将代理模型整合到开放仿真架构中以用于自动驾驶车辆的基于场景测试
机构 * Institute for Automotive Engineering, RWTH Aachen University(汽车工程研究所,亚琛工业大学)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出一种标准化模块化仿真架构,用于在不同仿真环境中集成交通代理模型,通过Open Simulation Interface和Functional Mock-up Interface实现跨平台一致性验证。
Journal ref at - Automatisierungstechnik - 2026 - Band 74, Heft 5 - Special Issue: AI for automated driving
UNIV:用于红外和可见模态的统一基础模型
机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 安全评测 :alignment(abstract)
AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。
TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Google DeepMind(谷歌DeepMind)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。
Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/
图像与句子:扩展交错指令以实现统一的视觉生成
机构 * ByteDance Seed(字节跳动种子)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出INSET模型,通过将图像作为文本指令中的原生词汇,解决复杂交错指令下的视觉生成问题,提升多图像一致性和文本对齐性能。
迈向细粒度多维语音理解:数据管道、基准和模型
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出FMSU-Bench基准和FM-Speech模型,通过数据管道优化、细粒度建模和渐进式课程训练,提升语音多维感知能力,验证现有语音LLM在细粒度多维理解上仍需改进。
在自动驾驶中基于视觉基础模型的输入监控基准测试
机构 * Continental AG(大陆汽车集团) ; Technical University of Munich(慕尼黑技术大学) ; University of Lübeck(吕贝克大学) ; University of Oxford(牛津大学) ; University of Wuppertal(伍珀塔尔大学)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出了一种基于视觉基础模型和密度建模技术的统一方法,用于检测语义和协变量偏移,通过全面基准测试评估了VFM在复杂条件下的OOD分类能力,并证明其在识别高风险输入方面优于现有方法。
CheXTemporal:用于胸部X光影像中时间感知推理的数据集
机构 * Stanford University(斯坦福大学) ; University of Oxford(牛津大学) ; University of California, Berkeley(加州大学伯克利分校) ; HOPPR ; University Hospital Zurich(苏黎世大学医院)
专题命中 安全评测 :alignment(abstract)
AI总结 该研究提出CheXTemporal数据集,用于胸部X光影像中时间感知推理,包含前后X光片及时间空间标注,评估了多种视觉语言模型在零样本设定下的接地和进展分类任务,发现模型在空间接地和时间推理方面存在局限。
你的驾驶世界模型是全能选手吗?
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。
Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens
TINS: 测试时ID-原型分离的负语义学习用于OD检测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; University of Electronic Science and Technology of China(电子科学与技术大学)
专题命中 安全评测 :alignment(abstract)
AI总结 TINS通过测试时ID-原型分离负语义学习方法,提升OOD检测性能,实验显示在Four-OOD基准上FPR95显著降低。
个性化深度研究:以用户为中心的框架、数据集和混合评估方法用于知识发现
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出PDR框架,结合用户上下文动态调整检索深度和广度,通过混合评估方法提升检索效用和报告相关性,验证了个性化知识获取的可行性。
Comments Accepted to SIGIR 2026
FLARE:全模态长视频音频视觉检索基准测试与用户模拟查询
专题命中 安全评测 :alignment(abstract)
AI总结 FLARE基准测试通过全模态长视频和用户模拟查询,评估视频检索在多模态大语言模型中的表现,揭示用户查询对模型行为的影响及音频语言对齐的关键瓶颈。
Med-StepBench:一种用于评估医学视觉-语言模型幻觉的分层推理框架
机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,越南科学与技术大学) ; SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,法国电信南巴黎学院,巴黎理工学院) ; Military Central Hospital, Vietnam(越南108军中心医院)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出Med-StepBench,首个针对3D肿瘤PET/CT图像的分步幻觉检测基准,通过12000张图像和100万对图像-陈述数据,揭示了现有VLMs在多步临床推理中的系统性缺陷。
Comments Accepted at IJCAI-ECAI 2026
基于SAM的频率适应器用于通用医学图像分割
机构 * Sungkyunkwan University, Korea(成均馆大学,韩国)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出FSAM框架,结合LoRA和频率适配器提升医学图像分割的域泛化能力,通过提取域不变高频特征缓解频率相关域偏移。
Comments Under review, 10 pages, 1 figure, 2 tables
TSNBench:评估大语言模型在时间敏感网络中能力的基准测试
专题命中 安全评测 :safety(abstract)
AI总结 本文提出TSNBench,首个评估大语言模型在时间敏感网络中的能力的基准测试,包含939道专家验证的多项选择题和100道开放性问题,揭示LLM在安全关键网络领域的能力不足。
统一科学交流:跨科学媒体的细粒度对应
机构 * IIIT Hyderabad(IIIT海得拉尔学院) ; Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026
迈向量子多体模拟的可验证和自校正人工智能物理学家
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出QMP-Bench基准和PhysVEC框架,通过自验证和纠错机制提升AI在量子多体模拟中的可靠性与准确性,显著优于现有LLM基线。
探索多模态聊天机器人作为治疗艺术活动的促进者
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出一种基于多模态大语言模型的聊天机器人,通过实时分析视觉创作并促进反思对话,探讨其在艺术治疗中的应用潜力及未来发展方向。
KEPIL: 基于知识增强的提示-图像学习用于提示鲁棒疾病检测
机构 * University of Bern(伯尔尼大学) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(放射肿瘤科、Inselspital伯尔尼大学医院及伯尔尼大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 KEPIL通过整合 curated 医学知识,提升零样本推理性能,采用动态提示增强、语义感知对比损失和实体中心报告标准化方法,在多个基准测试中实现 state-of-the-art 成绩,提升 AUC 6.37% 在 CheXpert 上。
生成推荐的综述:数据、模型与任务
专题命中 安全评测 :alignment(abstract)
AI总结 本文综述生成推荐领域,探讨数据、模型与任务维度,分析生成模型在推荐中的应用与挑战,提出智能推荐助手的发展方向。
SPECTRA-Net:可扩展的可解释跨域张量表示可解释性AI生成图像检测流水线
机构 * The National School of Artificial Intelligence(国家人工智能学院)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出SPECTRA-Net,通过多视角图像表示结合全局语义特征、频谱分析、局部补丁异常检测和统计描述符,实现跨域AI生成图像检测的高准确性和泛化能力。
Comments 13 pages, 2 figures, submitted to a journal
注意间隙:从不重叠视角进行几何准确的生成重建
机构 * Jagiellonian University(雅盖隆大学) ; IDEAS Research Institute(IDEAS研究机构) ; Poznań University of Technology(波兹南技术大学) ; Warsaw University of Technology(华沙技术大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出了一种新的生成重建范式,针对不重叠视角下的几何重建问题,提出GLADOS框架,通过生成桥梁、鲁棒粗重建和迭代上下文扩展优化,解决传统方法在零重叠场景下的失败问题。
ShellfishNet:面向海洋软体动物视觉识别的领域专用基准数据集
机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) ; Fudan University(复旦大学) ; DP Technology(DP技术)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文构建了ShellfishNet数据集,包含8691张图像,用于评估视觉模型在真实环境下的泛化能力,测试了80种神经网络模型及多模态大语言模型的性能。