Evolving LLM-Derived Control Policies for Residential EV Charging and Vehicle-to-Grid Energy Optimization
进化LLM衍生的控制策略用于住宅电动车充电和车辆到电网能源优化
专题命中 安全评测 :safety(abstract)
AI总结 本研究利用LLM驱动的进化计算生成透明且可检查的电动车充电控制策略,通过混合提示策略实现118%的利润提升,发现复杂行为如前瞻性套利。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
进化LLM衍生的控制策略用于住宅电动车充电和车辆到电网能源优化
专题命中 安全评测 :safety(abstract)
AI总结 本研究利用LLM驱动的进化计算生成透明且可检查的电动车充电控制策略,通过混合提示策略实现118%的利润提升,发现复杂行为如前瞻性套利。
RAP: 3D 像素化增强端到端规划
机构 * EPFL(苏黎世联邦理工学院) ; Sorbonne Université(索邦大学)
专题命中 安全评测 :alignment(abstract)
AI总结 RAP通过3D像素化增强端到端规划,利用轻量级像素化和特征对齐实现可扩展的数据增强,提升闭环鲁棒性和长尾泛化能力。
柏拉图的形:通过原型表示向 LLMs 提供后门防御即服务
专题命中 安全评测 :alignment(abstract)
AI总结 PROTOPURIFY通过原型表示实现LLMs的后门防御即服务,有效降低后门攻击成功率并保持模型性能。
基于统计的软件故障预测指标阈值设置方法:在固件项目中的工业经验
专题命中 安全评测 :safety(abstract)
AI总结 本文提出基于统计的软件故障预测指标阈值设置方法,通过实证研究验证了其在工业环境中的有效性,为故障预测提供可解释的解决方案。
机器学习从业者在欧盟监管要求下的数据质量观点:一项欧洲在线调查
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文通过欧洲在线调查,探讨了欧盟监管下机器学习从业者对数据质量的认知与实践,揭示了当前数据质量实践与监管要求之间的差距,并提出改进数据质量工具和协作的建议。
策略证明排名聚合的不可能性
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文证明了在至少四个选项的情况下,不存在同时满足一致性和策略证明性的排名聚合方法。
Comments Published as full paper at AAMAS 2026
FloorplanVLM:一种用于平面图向量化的视觉-语言模型
机构 * Beike(贝克)
专题命中 安全评测 :alignment(abstract)
AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。
DreamHome-Pano: 基于设计意识和无冲突的全景室内生成
机构 * Beike(贝克)
专题命中 安全评测 :alignment(abstract)
AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。
DuoDrama: 通过LLM辅助的人类反思支持剧本润色
专题命中 安全评测 :alignment(abstract)
AI总结 DuoDrama通过LLM辅助人类反思,提升剧本润色阶段的反馈质量和反思深度。
Comments Accepted by CHI 2026
HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University(南京大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。
3D高斯散射资产的知识产权保护:一篇综述
机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) ; The University of Melbourne(墨尔本大学) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫迪·本·扎耶德人工智能大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文综述了3D高斯散射资产的知识产权保护,分析了其底层机制、保护范式及鲁棒性挑战,并提出了六个研究方向以推动可靠保护技术的发展。
Comments A collection of relevant papers is summarized and will be continuously updated at \url{https://github.com/tmllab/Awesome-3DGS-IP-Protection}
边缘优化的视觉-语言模型用于地下基础设施评估
机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) ; University of New Orleans(新奥尔良大学)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。
Cargo Sherlock: 基于 SMT 的软件信任成本检查器
专题命中 安全评测 :trustworthy(abstract)
AI总结 Cargo Sherlock 是一种基于 SMT 的软件信任成本检查器,通过结合形式化方法和人为因素,用于检测供应链攻击并评估软件依赖项的信任成本。
Comments 12 pages, 7 figures. To appear at the International Conference on Formal Methods for Software Engineering (FormaliSE), April 2026
Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?
机构 * University of Rochester(罗切斯特大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 安全评测 :alignment(abstract)
AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。
代码数字孪生:面向AI辅助复杂软件开发的知识基础设施
专题命中 安全评测 :trustworthy(abstract)
AI总结 代码数字孪生通过整合混合知识表示和多阶段提取管道,为AI辅助复杂软件开发提供可持续的演进路径。
Comments A vision paper that will be continuously updated
从C到Rust的代码质量分析
专题命中 安全评测 :safety(abstract)
AI总结 本文研究了三种C到Rust翻译器的代码质量,发现尽管新技术减少了部分问题,但引入了新的问题,揭示了翻译质量的多维挑战。
ScratchEval:一种用于块式编程中LLM的多模态评估框架
专题命中 安全评测 :alignment(abstract)
AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。
用于调度的机器学习:从以求解器为中心到以数据为中心的方法范式转变
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文探讨了从求解器为中心到数据为中心的调度方法转变,分析了机器学习在提升计算效率和动态决策中的作用,并提出了适应性、智能和可信的调度系统的发展路径。
多功能行为扩散用于通用交通代理模拟
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; NVIDIA Research(NVIDIA研究)
专题命中 安全评测 :safety(abstract)
AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。
对边界的理解:LLM生成的边界测试解释
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文研究LLM生成的边界解释在软件测试中的有效性,通过调查和访谈发现,清晰结构、权威来源引用和可操作示例能提升解释质量,提出七项要求的检查表以指导未来工具设计。
Comments This is the author's accepted manuscript of a paper accepted for publication at AST 2026. The final version will appear in the ACM Digital Library
基于风险的受监管软件中LLM功能测试框架
专题命中 安全评测 :safety(abstract)
AI总结 本文提出了一种针对受监管软件中LLM功能的风险测试框架,包含风险分类、分层测试策略及案例研究,以应对LLM在安全关键应用中的风险挑战。
Journal ref David C. Wyld et al. Eds CSML, AISCA, DNLP, SOEA, NET, BDHI, SIPO 2026 pp. 107-124, 2026. CS & IT CSCP 2026
在实验室中评估生成式AI:方法学挑战与指南
专题命中 安全评测 :alignment(abstract)
AI总结 本文探讨了在实验室环境中评估生成式AI的方法学挑战,提出了五个指南和十八项建议,以帮助研究人员设计更透明和稳健的评估研究。
Comments 18 pages, 3 figures, IUI '26 (the 31st International Conference on Intelligent User Interfaces)
评估大型语言模型在航空航天软件时间序列异常检测中的应用
专题命中 安全评测 :safety(abstract)
AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。
Comments This paper has been accepted by ASE 2025
AudioEval: 文本到音频生成的自动双视角和多维度评估
机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院)
专题命中 安全评测 :alignment(abstract)
AI总结 AudioEval通过大规模数据集和Qwen-DisQA基线,提供文本到音频生成的多维度自动评估方法,支持模型性能比较与评估体系优化。
DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解
机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) ; NUCES(努赛斯大学) ; NUST(努斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 安全评测 :alignment(abstract)
AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。
Comments Accepted to EACL-2026 (Main Track)
EgoHandICL: 以自身为中心的3D手重建与上下文学习
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) ; Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) ; Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)
专题命中 安全评测 :alignment(abstract)
AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。
Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL
基于人工智能的无人机智能城市生态系统入侵检测:综述
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。
Comments 68 pages, 13 figures, 6 tables, journal
理解代理AI生成代码的主导主题
专题命中 安全评测 :alignment(abstract)
AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。
视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估
机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)
专题命中 安全评测 :alignment(abstract)
AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。
Comments Work in progress
Saliency-Bench: 一个全面的评估视觉解释的基准测试
机构 * Emory University(埃默里大学) ; Stanford University(斯坦福大学) ; University of Michigan(密歇根大学)
专题命中 安全评测 :alignment(abstract)
AI总结 Saliency-Bench是一个全面的视觉解释评估基准测试,通过多个数据集和标准流程评估显著性方法的解释质量。