arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2508.02602 2026-08-21 stat.ML astro-ph.IM cs.LG stat.AP stat.ME 79%

Trustworthy scientific inference with generative models

可信的生成模型科学推断

James Carzon, Luca Masserano, Joshua D. Ingram, Alex Shen, Antonio Carlos Herling Ribeiro Junior, Tommaso Dorigo, Michele Doro, Joshua S. Speagle, Rafael Izbicki, Ann B. Lee

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 FreB通过提供可解释的诊断和有效性保证,实现可信的科学推断,尤其在直接似然评估不可行的领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13605 2026-08-21 cs.CL 79%

KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge

Jiyoung Lee, Minwoo Kim, Seungho Kim, Junghwan Kim, Seunghyun Won, Hwaran Lee, Edward Choi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted at ACL 2024 Findings (35 pages, 7 figures, 16 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16895 2026-08-20 cs.CY physics.soc-ph 版本更新 79%

Orphan risks at the frontier of artificial intelligence: What diverging safety and compliance frameworks reveal about how AI companies choose the risks they prioritize

人工智能前沿的孤儿风险:不同的安全与合规框架揭示了AI公司如何选择其优先处理的风险

Andrew D. Maynard

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文对比四家前沿AI公司2023-2026年的安全合规文件,识别出其风险选择的四个筛选标准,提出“安全差异”概念,揭示了孤儿风险的成因及轻量应对工具。

Comments 21 pages, 40 references. Also available on SSRN: https://dx.doi.org/10.2139/ssrn.7068898

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18017 2026-08-19 cs.AI 新提交 79%

Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach

大语言模型能否解释飞行安全事件?一种先验引导的基于语义大语言模型的方法

Lu Xu, Xu Li, Linjiang Zheng, Fan Li, Riquan Zhang, Jiaxing Shang

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Sichuan Flight Engineering Technology Research Center, Civil Aviation Flight University of China(中国民航飞行学院四川飞行工程技术研究中心) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海对外经贸大学统计与数据科学学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对飞行安全事件解释难题,提出FlightLLM方法,结合特征工程、语义离散化、CatBoost先验引导及对比小样本学习等技术,在704个A320飞行样本上实现了良好分类与合理事件原因解释。

Comments 14 pages, 6 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 79%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28850 2026-08-18 cs.LG q-fin.CP 版本更新 79%

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

表示签名与LLM交易智能体中的风险反馈对齐

Weicheng Xue

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12341 2026-08-14 cs.CL 新提交 79%

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

大语言模型在文化禁忌安全方面的“知识-行为差距”

Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) Huawei(华为)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12025 2026-08-13 cs.SE cs.AI 新提交 79%

From Safety Documentation to Safety Knowledge Support: An Evidence-Grounded LLM Framework for Medical Devices

从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架

Tuhinangshu Gangopadhyay, Rasmus Adler, Peter Liggesmeyer, Jan Reich

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。

Comments ISSRE 2026, AISQ, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09476 2026-08-11 cs.CR cs.AI 新提交 79%

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

ActBench:协作智能体行为安全的自演进基准

Hongwei Yao, Yiming Liu, Meihui Chen, Jieling Chen, Zikun Chen, Yiling He, Wangze Ni, Cong Wang, Kui Ren

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。

Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08210 2026-08-11 cs.AI 新提交 79%

Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue

对齐的错觉:检测协同对话中的隐藏分歧

Kaiming Liu, Fuwen Luo, Ziyue Wang, Jinrui Ju, Yuxuan Liu, Xuanyu Lei, Yunghwei Lai, Peng Li, Yang Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute for AI, Tsinghua University(清华大学人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本研究针对协同对话中存在的对齐的错觉(IoA)问题,构建IoA-Suite数据集,训练IoA-Prober-8B模型检测隐藏分歧,该模型可揭示真人会议中未表达的分歧,还能提升多智能体协作的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28503 2026-08-11 cs.AI 版本更新 79%

InfoOps Bench: A live information operations safety benchmark

InfoOps Bench:实时信息行动安全基准

Dorian Quelle, Lisa-Maria Neudert, Jonathan Bright, John Gallacher

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出实时信息行动安全基准InfoOps Bench,测试17个前沿语言模型抵御国家支持信息行动的能力,发现多数模型可被利用,中国开发模型对涉华事实主张合规性显著下降,凸显模型可用性与安全性的平衡挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07176 2026-08-10 cs.CV cs.AI 新提交 79%

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H. N. De With, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。

Comments Accepted at the DCA-MI Workshop (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06984 2026-08-10 cs.CR cs.AI 新提交 79%

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

HarnessSafe:评估智能体框架中持久载体的安全性

Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。

Comments 21 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 79%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新 79%

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05571 2026-08-07 cs.LG cs.IR 新提交 79%

Align-RAG: Alignment Is All You Need for TSFM In-Context Learning

Align-RAG:TSFM上下文学习的全部需求在于对齐

Mohammad Asadi, Soheil Hor, Bardiya Akhbari, Jack W. O'Sullivan, Tahoura Nedaee, Layne C. Price, Raviteja Anantha, Euan Ashley, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Amazon(亚马逊公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出无需训练的Align-RAG方法,通过闭式对齐检索窗口,在冻结TSFM上提升检索增强预测性能,证明冻结TSFM可动态整合检索结果,闭式对齐可作为默认基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05560 2026-08-07 cs.CV cs.CL 新提交 79%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05107 2026-08-06 cs.AI cs.MA cs.SE 新提交 79%

CoPlan: A Trustworthy Co-Intelligence Interface for Care Planning through Role-Based Contestable Argument Graphs

CoPlan:一种基于角色可争议论证图的可信协同智能照护规划界面

Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会) Thompson Rivers University(汤普森河大学) ISB Corporation(ISB公司) University of Northern British Columbia(北英属哥伦比亚大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本研究提出CoPlan界面,通过多智能体工作流结合协同智能与可争议性,实现人机协同照护规划,保留人类自主性与临床问责制,已在就地养老场景中验证其有效性。

Comments Accepted at the 2026 International Conference on Next Generation AI Systems (NGEN-AI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 79%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03866 2026-08-05 cs.AI cs.SY eess.SY 新提交 79%

ADMITBench: A Safety-Governed Reference Framework for Evaluating the Admissibility of Industrial LLM Advisories

ADMITBench:用于评估工业LLM咨询建议可采纳性的安全管控参考框架

Yash Misra, Javal Vyas, Siddharth Gutta, Mehmet Mercangöz

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究提出ADMITBench框架,用于评估工业LLM咨询建议的可采纳性,该框架采用带版本的安全管控评估契约,0.1.0版本为公开参考实现,面向技术与研究评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 79%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 79%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 79%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01767 2026-08-04 cs.AI 新提交 79%

Leveraging AI for fine-grained food safety risk forecasting in sparse data conditions

利用人工智能在稀疏数据条件下进行细粒度食品安全风险预测

Dongqi Wang, Weiwei Chen, Han Zhou, Weihua Zhou

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出基于Transformer的框架,整合多类数据与Wilson区间预训练,在稀疏数据下细粒度预测城市食品安全风险,实验及浙江实地测试显示其性能优于基线,可提升检测率与检查资源分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00679 2026-08-04 cs.AI cs.MA 新提交 79%

HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging

HetGPS:面向电动汽车充电的、带物理锚定自适应安全机制的可扩展图多智能体强化学习

Xiangwei Wang, Nanduni Nimalsiri, Yu Xia, Peng Wang, Saman Halgamuge

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出HetGPS混合图控制框架,结合学习图风险与物理锚定校正,实现可扩展的电动汽车充电多智能体协调,降低电压违规率并提升离网成功率,模型规模与车队无关且可跨系统零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28067 2026-08-04 cs.LG 版本更新 79%

From Vessel Trajectories to Safety-Critical Encounter Scenarios: A Generative AI Framework for Autonomous Ship Digital Testing

从船舶轨迹到安全关键性遭遇场景:一种生成式AI框架用于自主船舶数字测试

Sijin Sun, Liangbin Zhao, Xiuju Fu

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种数据驱动框架,将大规模AIS轨迹转化为结构化安全关键性遭遇场景,结合生成轨迹建模与自动化遭遇配对,提升场景生成的可扩展性与真实性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00500 2026-08-04 cs.AI cs.SE 版本更新 79%

ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction

ProbGuard:基于概率的运行时监控用于LLM代理安全

Haoyu Wang, Christopher M. Poskitt, Jiali Wei, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Xi'an Jiaotong University(西安交通大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ProbGuard通过概率风险预测主动监控LLM代理安全,利用离散时间马尔可夫链建模行为动态,提前预警潜在危险,提升安全性和任务完成率。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14191 2026-08-04 cs.CR cs.CL 79%

S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models

Xiaohan Yuan, Jinfeng Li, Dongxia Wang, Yuefeng Chen, Xiaofeng Mao, Longtao Huang, Jialuo Chen, Hui Xue, Xiaoxia Liu, Wenhai Wang, Kui Ren, Jingyi Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Accepted by ISSTA 2025

Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 79%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27849 2026-07-31 eess.SY cs.LG cs.SY 新提交 79%

Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings

耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现

Christian Rosenthal

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。

Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research

详情

展开后加载摘要…

URL PDF HTML 收藏