Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency
驱动思考:VLA推理-轨迹一致性的运行时监测
专题命中 其他安全 :safety(abstract)
AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
驱动思考:VLA推理-轨迹一致性的运行时监测
专题命中 其他安全 :safety(abstract)
AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。
用于自主水下航行器(AUV)作业的共享自主权认知架构
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院)
专题命中 其他安全 :safety(abstract)
AI总结 本文提出一种由本体和多个LLMs构成的AUV作业共享自主权认知架构,经对比Llama3、GPT-OSS、Qwen2.5后,发现GPT-OSS在可行性评估等任务中表现最优,Qwen2.5则擅长识别自然语言输入的任务类型。
Comments IEEE OES AUV Symposium 2026 Southampton
SGPDFuse:语义引导的物理解耦通用多模态图像融合
机构 * Dalian University of Technology(大连理工大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。
Comments Accepted by ACM Multimedia 2026
用通用大语言模型破解暗网验证码
专题命中 其他安全 :alignment(abstract)
AI总结 本研究针对暗网验证码,提出结合MLLM与经典计算机视觉的混合框架,通过任务重构或专用工具缓解MLLM的几何处理局限,实现90%以上的破解成功率。
Comments 13 pages, 5 figures, 5 tables
持续异质性:大语言模型驱动交通中的一种涌现集体机制
专题命中 其他安全 :safety(abstract)
AI总结 本研究在LLM控制的交通中识别出持续异质性这一新兴集体机制,通过实验得出密度相关的关键LLM渗透率p_c,表明需在动力学层强制执行稳定性。
Comments 41 pages, 5 figures
面向以人为中心场景中AI生成图像检测的视觉证据定位与解释
专题命中 其他安全 :alignment(abstract)
AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。
InLiER:通过中间混合基数结构关键点令牌化实现无学习的异构激光雷达地点识别
专题命中 其他安全 :alignment(abstract)
AI总结 研究针对机器人平台结合多种激光雷达致现有描述符性能下降的问题,提出无学习管道InLiER,通过混合基数令牌ID编码关键点信息,经三个检索阶段处理,在相关数据集和实验中表现出色,优于基于学习的基线。
Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 8 figures
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 10, pp. 11275-11282, 2026
VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Huazhong University of Science and Technology(华中科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(abstract)
AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。
Comments Home page: https://zhxie0117.github.io/VideoRAE
学习聚焦:用于医学图像分类的解剖学引导注意力正则化
机构 * University of Virginia(弗吉尼亚大学) ; Ahsanullah University of Science and Technology(阿山努拉科技大学) ; University of Utah(犹他大学)
专题命中 其他安全 :alignment(abstract)
AI总结 针对医学图像分类中标准分类损失缺乏空间监督的问题,提出Locus框架,利用预训练分割基础模型引导分类器关注诊断相关解剖结构,引入正则化项平衡注意力,在多数据集上验证,提升了分类性能和解剖学注意力。
超越思维链:重写作为生成式多模态嵌入的通用接口
机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 其他安全 :alignment(abstract)
AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。
Comments Accepted by ACMMM 2026
GeoGR: 一种面向空间时间感知的POI推荐生成框架
专题命中 其他安全 :alignment(abstract)
AI总结 GeoGR是一种面向空间时间感知的POI推荐生成框架,通过两阶段设计提升POI推荐的准确性和可扩展性。
LogICL: 通过蒸馏大语言模型推理来弥合跨域日志异常检测中的语义鸿沟
专题命中 其他安全 :alignment(abstract)
AI总结 LogICL通过蒸馏大语言模型推理,提升跨域日志异常检测的语义理解与泛化能力,实现更准确的检测与解释。