arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2602.07275 2026-02-10 cs.NE 50%

Evolving LLM-Derived Control Policies for Residential EV Charging and Vehicle-to-Grid Energy Optimization

进化LLM衍生的控制策略用于住宅电动车充电和车辆到电网能源优化

Vishesh Purnananda, Benjamin John Wruck, Mingyu Guo

专题命中 安全评测 :safety(abstract)

AI总结 本研究利用LLM驱动的进化计算生成透明且可检查的电动车充电控制策略,通过混合提示策略实现118%的利润提升,发现复杂行为如前瞻性套利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04333 2026-02-10 cs.CV cs.RO 50%

RAP: 3D Rasterization Augmented End-to-End Planning

RAP: 3D 像素化增强端到端规划

Lan Feng, Yang Gao, Eloi Zablocki, Quanyi Li, Wuyang Li, Sichao Liu, Matthieu Cord, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院) Sorbonne Université(索邦大学)

专题命中 安全评测 :alignment(abstract)

AI总结 RAP通过3D像素化增强端到端规划,利用轻量级像素化和特征对齐实现可扩展的数据增强,提升闭环鲁棒性和长尾泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06887 2026-02-09 cs.CR 50%

Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations

柏拉图的形:通过原型表示向 LLMs 提供后门防御即服务

Chen Chen, Yuchen Sun, Jiaxin Gao, Yanwen Jia, Xueluan Gong, Qian Wang, Kwok-Yan Lam

专题命中 安全评测 :alignment(abstract)

AI总结 PROTOPURIFY通过原型表示实现LLMs的后门防御即服务,有效降低后门攻击成功率并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06831 2026-02-09 cs.SE 50%

Statistical-Based Metric Threshold Setting Method for Software Fault Prediction in Firmware Projects: An Industrial Experience

基于统计的软件故障预测指标阈值设置方法:在固件项目中的工业经验

Marco De Luca, Domenico Amalfitano, Anna Rita Fasolino, Porfirio Tramontana

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于统计的软件故障预测指标阈值设置方法,通过实证研究验证了其在工业环境中的有效性,为故障预测提供可解释的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06594 2026-02-09 cs.DB 50%

Machine Learning Practitioners' Views on Data Quality in Light of EU Regulatory Requirements: A European Online Survey

机器学习从业者在欧盟监管要求下的数据质量观点:一项欧洲在线调查

Yichun Wang, Kristina Irion, Paul Groth, Hazar Harmouch

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文通过欧洲在线调查,探讨了欧盟监管下机器学习从业者对数据质量的认知与实践,揭示了当前数据质量实践与监管要求之间的差距,并提出改进数据质量工具和协作的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06582 2026-02-09 cs.GT econ.TH 50%

The Impossibility of Strategyproof Rank Aggregation

策略证明排名聚合的不可能性

Manuel Eberl, Patrick Lederer

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文证明了在至少四个选项的情况下,不存在同时满足一致性和策略证明性的排名聚合方法。

Comments Published as full paper at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06507 2026-02-09 cs.CV 50%

FloorplanVLM: A Vision-Language Model for Floorplan Vectorization

FloorplanVLM:一种用于平面图向量化的视觉-语言模型

Yuanqing Liu, Ziming Yang, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 安全评测 :alignment(abstract)

AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06494 2026-02-09 cs.CV 50%

DreamHome-Pano: Design-Aware and Conflict-Free Panoramic Interior Generation

DreamHome-Pano: 基于设计意识和无冲突的全景室内生成

Lulu Chen, Yijiang Hu, Yuanqing Liu, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 安全评测 :alignment(abstract)

AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05854 2026-02-06 cs.HC 50%

DuoDrama: Supporting Screenplay Refinement Through LLM-Assisted Human Reflection

DuoDrama: 通过LLM辅助的人类反思支持剧本润色

Yuying Tang, Xinyi Chen, Haotian Li, Xing Xie, Xiaojuan Ma, Huamin Qu

专题命中 安全评测 :alignment(abstract)

AI总结 DuoDrama通过LLM辅助人类反思,提升剧本润色阶段的反馈质量和反思深度。

Comments Accepted by CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04535 2026-02-05 cs.SD 50%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03878 2026-02-05 cs.CV cs.CR 50%

Intellectual Property Protection for 3D Gaussian Splatting Assets: A Survey

3D高斯散射资产的知识产权保护:一篇综述

Longjie Zhao, Ziming Hong, Jiaxin Huang, Runnan Chen, Mingming Gong, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) The University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪·本·扎耶德人工智能大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了3D高斯散射资产的知识产权保护,分析了其底层机制、保护范式及鲁棒性挑战,并提出了六个研究方向以推动可靠保护技术的发展。

Comments A collection of relevant papers is summarized and will be continuously updated at \url{https://github.com/tmllab/Awesome-3DGS-IP-Protection}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 50%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12553 2026-02-04 cs.LO cs.SE 50%

Cargo Sherlock: An SMT-Based Checker for Software Trust Costs

Cargo Sherlock: 基于 SMT 的软件信任成本检查器

Muhammad Hassnain, Anirudh Basu, Ethan Ng, Caleb Stanford

专题命中 安全评测 :trustworthy(abstract)

AI总结 Cargo Sherlock 是一种基于 SMT 的软件信任成本检查器,通过结合形式化方法和人为因素,用于检测供应链攻击并评估软件依赖项的信任成本。

Comments 12 pages, 7 figures. To appear at the International Conference on Formal Methods for Software Engineering (FormaliSE), April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 50%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 安全评测 :alignment(abstract)

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07967 2026-02-03 cs.SE 50%

Code Digital Twin: A Knowledge Infrastructure for AI-Assisted Complex Software Development

代码数字孪生:面向AI辅助复杂软件开发的知识基础设施

Xin Peng, Chong Wang

专题命中 安全评测 :trustworthy(abstract)

AI总结 代码数字孪生通过整合混合知识表示和多阶段提取管道,为AI辅助复杂软件开发提供可持续的演进路径。

Comments A vision paper that will be continuously updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00840 2026-02-03 cs.SE 50%

Code Quality Analysis of Translations from C to Rust

从C到Rust的代码质量分析

Biruk Tadesse, Vikram Nitin, Mazin Salah, Baishakhi Ray, Marcelo d'Amorim, Wesley Assunção

专题命中 安全评测 :safety(abstract)

AI总结 本文研究了三种C到Rust翻译器的代码质量,发现尽管新技术减少了部分问题,但引入了新的问题,揭示了翻译质量的多维挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 50%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22642 2026-02-03 math.OC 50%

Machine Learning for Scheduling: A Paradigm Shift from Solver-Centric to Data-Centric Approaches

用于调度的机器学习:从以求解器为中心到以数据为中心的方法范式转变

Anbang Liu, Shaochong Lin, Jingchuan Chen, Peng Wu, Zuojun Max Shen

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨了从求解器为中心到数据为中心的调度方法转变,分析了机器学习在提升计算效率和动态决策中的作用,并提出了适应性、智能和可信的调度系统的发展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02524 2026-02-03 cs.RO 50%

Versatile Behavior Diffusion for Generalized Traffic Agent Simulation

多功能行为扩散用于通用交通代理模拟

Zhiyu Huang, Zixu Zhang, Ameya Vaidya, Yuxiao Chen, Chen Lv, Jaime Fernández Fisac

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) NVIDIA Research(NVIDIA研究)

专题命中 安全评测 :safety(abstract)

AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22791 2026-02-02 cs.SE 50%

Understanding on the Edge: LLM-generated Boundary Test Explanations

对边界的理解:LLM生成的边界测试解释

Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文研究LLM生成的边界解释在软件测试中的有效性,通过调查和访谈发现,清晰结构、权威来源引用和可操作示例能提升解释质量,提出七项要求的检查表以指导未来工具设计。

Comments This is the author's accepted manuscript of a paper accepted for publication at AST 2026. The final version will appear in the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17292 2026-02-02 cs.SE 50%

Risk-based test framework for LLM features in regulated software

基于风险的受监管软件中LLM功能测试框架

Zhiyin Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种针对受监管软件中LLM功能的风险测试框架,包含风险分类、分层测试策略及案例研究,以应对LLM在安全关键应用中的风险挑战。

Journal ref David C. Wyld et al. Eds CSML, AISCA, DNLP, SOEA, NET, BDHI, SIPO 2026 pp. 107-124, 2026. CS & IT CSCP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16740 2026-01-30 cs.HC 50%

Evaluating Generative AI in the Lab: Methodological Challenges and Guidelines

在实验室中评估生成式AI:方法学挑战与指南

Hyerim Park, Khanh Huynh, Malin Eiband, Jeremy Dillmann, Sven Mayer, Michael Sedlmair

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了在实验室环境中评估生成式AI的方法学挑战,提出了五个指南和十八项建议,以帮助研究人员设计更透明和稳健的评估研究。

Comments 18 pages, 3 figures, IUI '26 (the 31st International Conference on Intelligent User Interfaces)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12448 2026-01-30 cs.SE 50%

Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software

评估大型语言模型在航空航天软件时间序列异常检测中的应用

Yang Liu, Yixing Luo, Xiaofeng Li, Xiaogang Dong, Bin Gu, Zhi Jin

专题命中 安全评测 :safety(abstract)

AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。

Comments This paper has been accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14570 2026-01-30 cs.SD eess.AS 50%

AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation

AudioEval: 文本到音频生成的自动双视角和多维度评估

Hui Wang, Jinghua Zhao, Junyang Cheng, Cheng Liu, Yuhang Jia, Haoqin Sun, Jiaming Zhou, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 AudioEval通过大规模数据集和Qwen-DisQA基线,提供文本到音频生成的多维度自动评估方法,支持模型性能比较与评估体系优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19898 2026-01-28 cs.CV 50%

DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding

DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解

Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) NUCES(努赛斯大学) NUST(努斯特大学) Australian National University(澳大利亚国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。

Comments Accepted to EACL-2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 50%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 安全评测 :alignment(abstract)

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19345 2026-01-28 cs.CR 50%

AI-driven Intrusion Detection for UAV in Smart Urban Ecosystems: A Comprehensive Survey

基于人工智能的无人机智能城市生态系统入侵检测:综述

Abdullah Khanfor, Raby Hamadi, Noureddine Lasla, Hakim Ghazzai

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。

Comments 68 pages, 13 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19287 2026-01-28 cs.SE 50%

Understanding Dominant Themes in Reviewing Agentic AI-authored Code

理解代理AI生成代码的主导主题

Md. Asif Haider, Thomas Zimmermann

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18698 2026-01-27 cs.CV 50%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08537 2026-01-27 cs.CV 50%

Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations

Saliency-Bench: 一个全面的评估视觉解释的基准测试

Yifei Zhang, James Song, Siyi Gu, Tianxu Jiang, Bo Pan, Guangji Bai, Liang Zhao

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Saliency-Bench是一个全面的视觉解释评估基准测试,通过多个数据集和标准流程评估显著性方法的解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏