arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-09 至 2026-01-09 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2601.04736 2026-01-09 cs.CL 89%

AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs

AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法

Han Zhu, Jiale Chen, Chengkun Cai, Shengjie Sun, Haoran Li, Yujin Zhou, Chi-Min Chan, Pengcheng Wen, Lei Li, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) University of Edinburgh(爱丁堡大学) University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05075 2026-01-09 cs.CL 83%

SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment

SemPA:通过语义偏好对齐提升大语言模型的句子嵌入

Ziyang Chen, Zhenxuan Huang, Yile Wang, Weiqin Wang, Lu Yin, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 SemPA通过语义偏好对齐提升大语言模型的句子嵌入能力,同时保持其生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04616 2026-01-09 cs.LG cs.AI 62%

DeepHalo: A Neural Choice Model with Controllable Context Effects

DeepHalo:具有可控上下文效应的神经选择模型

Shuhan Zhang, Zhi Wang, Rui Gao, Shuang Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DeepHalo是一种能够控制上下文效应阶数的神经选择模型,通过显式控制交互阶数和原则性解释上下文效应,提升决策建模的可解释性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03263 2026-01-09 cs.CL cs.AI 62%

Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models

内部推理 vs. 外部控制:大型语言模型中谄媚现象的热力学分析

Edward Y. Chang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出受控因果锚定(RCA)方法,通过评估推理过程而非结果,有效检测大型语言模型中的谄媚现象,无需真实数据且打破自我强化偏见循环。

Comments 20 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06568 2026-01-09 cs.LG cs.AI stat.ML 62%

Meta-Learning Objectives for Preference Optimization

元学习目标用于偏好优化

Carlo Alfano, Silvia Sapora, Jakob Nicolaus Foerster, Patrick Rebeschini, Yee Whye Teh

机构 * Department of Statistics University of Oxford(统计系牛津大学) Department of Engineering University of Oxford(工程系牛津大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于镜像下降的新型偏好优化算法MPO,通过进化策略发现针对特定偏好数据集属性的算法,并在MuJoCo和大语言模型对齐任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17652 2026-01-09 cs.CL 57%

Qomhra: A Bilingual Irish and English Large Language Model

Qomhra: 一种双语爱尔兰语和英语大语言模型

Joseph McInerney, Khanh-Tung Tran, Liam Lonergan, Ailbhe Ní Chasaide, Neasa Ní Chiaráin, Barry Devereux

机构 * Trinity College Dublin(三一学院) University College Cork(科克大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Qomhra是一种双语爱尔兰语和英语大语言模型,通过低资源约束下的方法生成人类偏好数据,显著提升了爱尔兰语和英语的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04656 2026-01-09 cs.SD 50%

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

FlexiVoice: 通过自然语言指令实现零样本语音合成的灵活风格控制

Dekun Chen, Xueyao Zhang, Yuancheng Wang, Kenan Dai, Li Ma, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 偏好对齐 :DPO(abstract)

AI总结 FlexiVoice通过自然语言指令实现零样本语音合成的灵活风格控制,结合LLM核心和PPT方案,实现风格与音色的精准解耦与可控。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2512.24556 2026-01-09 cs.CL cs.AI cs.CY 75%

Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

Muhammad Abdullahi Said, Muhammad Sammani Sani

机构 * African Institute for Mathematical Science(非洲数学科学研究所) University of Vienna(维也纳大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05019 2026-01-09 cs.CL cs.AI q-bio.NC 62%

Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models

模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏

Yueqing Hu, Xinyang Peng, Shuting Peng, Hanqi Wang, Tianhong Wang

机构 * School of Philosophy, Anhui University(安徽大学哲学学院) Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) Faculty of Education, University of Cambridge(剑桥大学教育学院) School of Foreign Studies, South China Normal University(华南师范大学外语学院) Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09751 2026-01-09 cs.CY cs.AI cs.HC 62%

AI red-teaming is a sociotechnical problem: on values, labor, and harms

AI红队测试是社会技术问题:关于价值观、劳动与危害

Tarleton Gillespie, Ryland Shaw, Mary L. Gray, Jina Suh

机构 * Microsoft Research(微软研究院) University of Southern California(南加州大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI红队测试作为社会技术问题的重要性,强调需跨学科合作以理解其价值观、劳动及影响,避免重复历史错误。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10509 2026-01-09 cs.LG 57%

From Actions to Words: Towards Abstractive-Textual Policy Summarization in RL

从动作到词语:迈向强化学习中基于抽象文本的策略摘要

Sahar Admoni, Assaf Hallak, Yftah Ziser, Omer Ben-Porat, Ofra Amir

机构 * Nvidia Research(英伟达研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 SySLLM通过将策略解释转化为语言生成问题,利用大型语言模型生成连贯的摘要,以解释复杂强化学习行为。

Comments In Proceedings of AAMAS 2026 (The 25th International Conference on Autonomous Agents and Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04668 2026-01-09 cs.RO cs.AI 57%

Optimizing Path Planning using Deep Reinforcement Learning for UGVs in Precision Agriculture

利用深度强化学习优化无人机在精准农业中的路径规划

Laukik Patade, Rohan Rane, Sandeep Pillai

机构 * Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究利用深度强化学习优化无人机在精准农业中的路径规划,通过DDPG和TD3算法在动态环境中实现高成功率的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04603 2026-01-09 cs.CR cs.AI 57%

Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks

宪法分类器++:高效生产级防御对抗通用劫持攻击

Hoagy Cunningham, Jerry Wei, Zihan Wang, Andrew Persic, Alwin Peng, Jordan Abderrachid, Raj Agarwal, Bobby Chen, Austin Cohen, Andy Dau, Alek Dimitriev, Rob Gilson, Logan Howard, Yijin Hua, Jared Kaplan, Jan Leike, Mu Lin, Christopher Liu, Vladimir Mikulik, Rohit Mittapalli, Clare O'Hara, Jin Pan, Nikhil Saxena, Alex Silverstein, Yue Song, Xunjie Yu, Giulio Zhou, Ethan Perez, Mrinank Sharma

专题命中 安全训练 :jailbreak(abstract);分类 cs.AI

AI总结 宪法分类器++通过高效算法和两阶段分类器流水线,实现生产级防御,大幅降低计算成本并保持高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04334 2026-01-09 cs.RO math.OC 50%

Autonomous Reasoning for Spacecraft Control: A Large Language Model Framework with Group Relative Policy Optimization

自主推理的航天器控制:一种基于大语言模型的框架与群体相对策略优化

Amit Jain, Richard Linares

机构 * Department of Aeronautics \& Astronautics Massachusetts Institute of Technology Cambridge, MA 02139

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于大语言模型和群体相对策略优化的自主推理航天器控制框架,通过两阶段训练方法生成可解释的控制策略,适用于复杂动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2503.01839 2026-01-09 cs.CR cs.AI cs.CL cs.CV 73%

Jailbreaking Safeguarded Text-to-Image Models via Large Language Models

通过大型语言模型对受保护的文本到图像模型进行劫持

Zhengyuan Jiang, Yuepeng Hu, Yuchen Yang, Yinzhi Cao, Neil Zhenqiang Gong

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用微调大型语言模型来劫持受安全防护的文本到图像模型的方法,有效绕过安全防护并优于现有攻击技术。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 70%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2511.14195 2026-01-09 cs.LG cs.CR 83%

N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator

N-GLARE:一种非生成式、潜在表示高效的大语言模型安全评估器

Zheyu Lin, Jirui Yang, Yukui Qiu, Hengqi Guo, Yubing Bao, Yao Guan

机构 * University of California, Riverside(加州大学河滨分校) Fudan University(复旦大学) South China University of Technology(华南理工大学)

专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.LG

AI总结 N-GLARE通过分析潜在表示动态,提出一种高效无输出的大语言模型安全评估方法,显著降低评估成本并提升诊断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2601.04795 2026-01-09 cs.AI cs.CL cs.CR cs.MA 81%

Defense Against Indirect Prompt Injection via Tool Result Parsing

通过工具结果解析防御间接提示注入

Qiang Yu, Xinran Cheng, Chuanyi Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过工具结果解析来防御间接提示注入,有效过滤恶意代码并降低攻击成功率。

Comments 20 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05059 2026-01-09 cs.CV cs.LG 70%

From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)

从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段

Suyash Mishra, Qiang Li, Srikanth Patil, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.LG

AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。

Comments Contributed original research to top tier conference in VLM; currently undergoing peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 7 篇

2601.04277 2026-01-09 cs.LG 79%

Unlocking the Pre-Trained Model as a Dual-Alignment Calibrator for Post-Trained LLMs

解封预训练模型作为后训练LLMs的双对齐校准器

Beier Luo, Cheng Wang, Hongxin Wei, Sharon Li, Xuefeng Du

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Dual-Align方法,通过双对齐策略校正后训练LLMs的置信度漂移和过程漂移,提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04486 2026-01-09 cs.CR cs.AI cs.HC 74%

Decision-Aware Trust Signal Alignment for SOC Alert Triage

面向SOC警报分拣的决策感知信任信号对齐

Israt Jahan Chowdhury, Md Abu Yousuf Tanvir

机构 * Ontario Tech University(安大略技术大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文提出了一种决策感知的信任信号对齐方法,用于提升SOC警报分拣的决策支持效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04435 2026-01-09 cs.CL cs.AI cs.CY 67%

Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs

适应与认知警觉:一种实用视角下为何LLMs未能挑战有害信念

Myra Cheng, Robert D. Hawkins, Dan Jurafsky

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Linguistics, Stanford University(语言学系,斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过语用学视角揭示LLMs在挑战有害信念时的失败原因,并提出简单干预提升安全性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04728 2026-01-09 cs.LG cs.AI 62%

Excess Description Length of Learning Generalizable Predictors

学习可泛化的预测器的超额描述长度

Elizabeth Donoway, Hailey Joren, Fabien Roger, Jan Leike

机构 * ucb(加州大学伯克利分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDL框架,用于量化微调提取的预测结构并评估模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04742 2026-01-09 cs.CL 57%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11529 2026-01-09 cs.CL 57%

Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models

通过内部状态和结构化推理一致性检测大语言模型中的幻觉

Yusheng Song, Lirong Qiu, Xi Zhang, Zhihao Tang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 通过内部状态和结构化推理一致性检测大语言模型中的幻觉,提出统一框架解决检测困境,提升事实和逻辑任务的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24307 2026-01-09 cs.HC 50%

Exploring Similarity between Neural and LLM Trajectories in Language Processing

探索神经与大语言模型在语言处理中的相似性

Xin Xiao, Kaiwen Wei, Jiang Zhong, Xuekai Wei, Mingliang Zhou

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究通过比较LLMs与人类大脑在语言处理中的轨迹相似性,揭示了语义整合机制和实时处理动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 11 篇

2601.04199 2026-01-09 cs.LG cs.AI cs.CL 87%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04211 2026-01-09 cs.CL 79%

Qwerty AI: Explainable Automated Age Rating and Content Safety Assessment for Russian-Language Screenplays

Qwerty AI:可解释的自动年龄评级和俄语剧本内容安全评估系统

Nikita Zmanovskii

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 Qwerty AI通过可解释的自动化系统实现俄语剧本的年龄评级和内容安全评估,利用微调模型和量化技术,在严格限制下实现高准确率和高效处理。

Comments 15 pages, 7 tables, 1 figure, 4 appendices. System paper describing automated age-rating for Russian screenplays using fine-tuned Phi-3-mini. Includes baseline comparisons, human evaluation, and production deployment. Code and model weights available at https://github.com/nikita-zmanovskiy/qwertyAI. Developed during Wink Hackathon, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 73%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏