arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2602.18468 2026-02-24 cs.CY cs.CL 73%

The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models

算法无意识:大型语言模型中的结构机制与隐性偏见

Philippe Boisnard

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。

Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07117 2026-02-16 cs.AI cs.LG 73%

The Conditions of Physical Embodiment Enable Generalization and Care

物理具身的条件使泛化和关怀成为可能

Leonardo Christov-Moore, Arthur Juliani, Alex Kiefer, Joel Lehman, Nicco Reggente, B. Scot Rousse, Adam Safron, Nicolás Hinrichs, Daniel Polani, Antonio Damasio

机构 * Institute for Advanced Consciousness Studies(先进意识研究所) Monash Centre for Consciousness and Contemplative Studies(莫纳什意识与冥想研究中心) University of Oxford(牛津大学) Topos Institute(拓斯研究所) Allen Discovery Center(艾伦发现中心) Okinawa Institute of Science and Technology(冲绳科学技术研究所) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) University of Hertfordshire(赫特福德郡大学) Brain and Creativity Institute(大脑与创造力研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出物理具身的条件是泛化和关怀的基础,通过稳态驱动和因果建模实现智能体在开放环境中的鲁棒性和可信对齐。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11412 2026-02-13 cs.CY cs.AI cs.HC 73%

When Visibility Outpaces Verification: Delayed Verification and Narrative Lock-in in Agentic AI Discourse

当可见性超越验证:代理AI discourse中的延迟验证与叙述锁定

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱文大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了代理AI讨论中可见性与验证时间的关系,揭示了高可见度讨论因延迟验证导致的叙述锁定现象,并提出知识摩擦作为平衡平台的干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07963 2026-02-10 cs.CL cs.AI 73%

Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms

迷失在翻译中?复合危害的跨语言迁移比较研究

Vaibhav Shukla, Hardik Sharma, Adith N Reganti, Soham Wasmatkar, Bagesh Kumar, Vrijendra Singh

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复合危害基准测试,探讨了跨语言迁移中安全对齐的稳定性,发现攻击成功率在印度语言中显著上升,但上下文性危害迁移较温和,强调翻译基准在多语言安全测试中的必要性。

Comments Accepted at the AICS Workshop, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02862 2026-02-04 cs.AI cs.LG 73%

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

STEER: 通过受约束的质量多样性搜索实现推理时间的风险控制

Eric Yang, Jong Ha Lee, Jonathan Amar, Elissa Ye, Yugang Jia

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 STEER通过受约束的质量多样性搜索实现推理时间的风险控制,提供可调节的决策保守性调整,提升临床分诊等场景下的行为覆盖和准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 73%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21505 2026-01-30 cs.AI cs.CL cs.HC 73%

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

风格向量对大型语言模型的控制效果:一项人类评估

Diaoulé Diallo, Katharina Dworatzyk, Sophie Jentzsch, Peer Schütt, Sabine Theis, Tobias Hecking

机构 * German Aerospace Center (DLR), Institute of Software Technology(德国航空航天中心(DLR)软件技术研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过人类评估验证了激活引导在控制大型语言模型情绪输出中的有效性,发现中等强度引导能显著增强目标情绪并保持文本可理解性,且模型升级后效果更稳定。

Journal ref IEEE Access 13 (2025) 191443-191457

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 73%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17312 2026-01-27 cs.CL cs.AI 73%

Meta-Judging with Large Language Models: Concepts, Methods, and Challenges

元评判与大型语言模型:概念、方法与挑战

Hugo Silva, Mateus Mendes, Hugo Gonçalo Oliveira

机构 * University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering(科英布拉大学,CISUC/LASI——科英布拉大学信息与系统研究中心,信息工程系) Polytechnic University of Coimbra, Rua da Misericórdia, Lagar dos Cortiços, S. Martinho do Bispo, 3045-093 Coimbra, Portugal(科英布拉理工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM-as-a-Meta-Judge在提升自动化评估稳定性与可信度方面的潜力,同时指出需解决的成本、提示敏感性及共享偏差等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12409 2026-01-26 cs.LG cs.AI cs.NE 73%

Interpretable Fine-Gray Deep Survival Model for Competing Risks: Predicting Post-Discharge Foot Complications for Diabetic Patients in Ontario

可解释的细灰深度生存模型用于竞争风险:预测安大略省糖尿病患者出院后足部并发症

Dhanesh Ramachandram, Anne Loefler, Surain Roberts, Amol Verma, Maia Norman, Fahad Razak, Conrad Pow, Charles de Mestral

机构 * Vector Institute(向量研究所) GEMINI University of Toronto(多伦多大学) Diabetes Action Canada(加拿大糖尿病行动)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可解释的细灰深度生存模型,用于预测糖尿病患者出院后足部并发症,通过透明的预测方法提高医疗AI的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 73%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22145 2025-12-30 cs.DL cs.AI cs.CY 73%

Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models

预审至同行评审:使用大型语言模型自动化评审的陷阱

Akhil Pandey Akella, Harish Varma Siravuri, Shaurya Rohatgi

机构 * AllSci Corp(AllSci公司) Sunwater Capital(Sunwater资本) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19025 2025-12-24 cs.CR cs.AI cs.LG 73%

The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation

擦除幻觉:对LLM遗忘评估泛化能力的压测试

Hengrui Jia, Taoran Li, Jonas Guan, Varun Chandrasekaran

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSG框架,通过生成语义衍生但嵌入空间不同的替代数据集,揭示LLM无学习评估中普遍存在的度量不准确问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17920 2025-12-23 cs.CL cs.AI 73%

Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression

分离约束合规性与语义准确性:一种新的基准,用于在压缩下评估指令遵循

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CDCT基准,揭示LLMs在压缩下约束合规性与语义准确性之间的矛盾,发现中等压缩时约束违规主要由RLHF训练的有用性行为导致。

Comments 19 pages, 9 figures; currently under peer review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10501 2025-12-22 cs.AI cs.LG 73%

PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning

基于概率代理超网采样的可解释和自适应胸片推理系统

Yushi Feng, Junye Du, Yingying Hong, Qifan Wang, Lequan Yu

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22818 2025-12-22 cs.AI cs.CY 73%

Can Large Language Models Develop Gambling Addiction?

大语言模型能否产生赌博成瘾?

Seungpil Lee, Donghyeon Shin, Yunjeong Lee, Sundong Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology(人工智能融合系,全州科学技术院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨大语言模型在老虎机实验中表现出赌博成瘾行为,揭示其决策机制与风险认知特征,指出模型行为受抽象决策特征控制而非单纯依赖训练数据。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11827 2025-12-17 cs.CY cs.AI cs.CV 73%

Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?

利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?

Milad Malekzadeh, Magdalena Biernacka, Elias Willberg, Jussi Torkko, Edyta Łaszkiewicz, Tuuli Toivonen

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11009 2025-12-16 cs.CL cs.AI 73%

SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth

SproutBench: 为青少年设计的安全和伦理大型语言模型基准

Wenpeng Xing, Lanyi Wei, Haixiao Hu, Jingyi Yu, Rongchang Li, Mohan Li, Changting Lin, Meng Han

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 SproutBench通过1283个发展性对抗提示评估47种LLMs,揭示儿童安全漏洞,为青少年AI设计提供指导。

Comments Accepted in AAAI 2026 Workshop on AI for Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08936 2025-12-11 cs.HC cs.AI cs.CY 73%

A Principle-based Framework for the Development and Evaluation of Large Language Models for Health and Wellness

基于原则的大型语言模型在健康与健身领域开发与评估框架

Brent Winslow, Jacqueline Shreibati, Javier Perez, Hao-Wei Su, Nichole Young-Lin, Nova Hammerquist, Daniel McDuff, Jason Guss, Jenny Vafeiadou, Nick Cain, Alex Lin, Erik Schenck, Shiva Rajagopal, Jia-Ru Chung, Anusha Venkatakrishnan, Amy Armento Lee, Maryam Karimzadehgan, Qingyou Meng, Rythm Agarwal, Aravind Natarajan, Tracy Giest

机构 * Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于原则的框架,用于系统评估LLM在健康与健身领域的应用,通过迭代开发生命周期整合综合评估技术,提升系统安全性和用户反馈的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21933 2025-12-09 cs.CL cs.AI 73%

Why Chain of Thought Fails in Clinical Text Understanding

为什么链式思维在临床文本理解中失效

Jiageng Wu, Kevin Xie, Bowen Gu, Nils Krüger, Kueiyu Joshua Lin, Jie Yang

机构 * Harvard Medical School(哈佛医学院) MIT(麻省理工学院) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现链式思维在临床文本理解中导致性能下降,揭示了其在临床任务中可靠性与可解释性的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03026 2025-12-03 cs.CL cs.AI 73%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02057 2025-12-03 cs.LG cs.AI 73%

Opening the Black Box: An Explainable, Few-shot AI4E Framework Informed by Physics and Expert Knowledge for Materials Engineering

揭开黑箱:一个受物理和专家知识启发的可解释、少样本AI4E框架

Haoxiang Zhang, Ruihao Yuan, Lihui Zhang, Yushi Luo, Qiang Zhang, Pan Ding, Xiaodong Ren, Weijie Xing, Niu Gao, Jishan Chen, Chubo Zhang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个受物理和专家知识启发的可解释、少样本AI4E框架,通过生成合成数据和优化策略提升工程领域模型的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02821 2025-12-01 cs.CV cs.AI cs.LG 73%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 73%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16823 2025-11-24 cs.LG cs.AI cs.HC 73%

Monte Carlo Expected Threat (MOCET) Scoring

蒙特卡洛预期威胁(MOCET)评分

Joseph Kim, Saahith Potluri

机构 * Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 MOCET是一种可解释且双重可扩展的指标,用于量化大语言模型在现实世界中的安全风险。

Comments Accepted to NeurIPS 2025 BioSafe GenAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16743 2025-11-24 cs.CV cs.AI cs.LG 73%

SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge

SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容

Adeel Yousaf, Joseph Fioresi, James Beetham, Amrit Singh Bedi, Mubarak Shah

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11759 2025-11-18 cs.CR cs.AI cs.CY 73%

Can AI Models be Jailbroken to Phish Elderly Victims? An End-to-End Evaluation

Fred Heiding, Simon Lermen

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24796 2025-11-18 cs.CY cs.AI 73%

Mutual Wanting in Human--AI Interaction: Empirical Evidence from Large-Scale Analysis of GPT Model Transitions

HaoYang Shang, Xuan Liu

机构 * BreathingCORE

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04962 2025-11-13 cs.CL cs.AI 73%

Too Good to be Bad: On the Failure of LLMs to Role-Play Villains

Zihao Yi, Qingxuan Jiang, Ruotian Ma, Xingyu Chen, Qu Yang, Mengru Wang, Fanghua Ye, Ying Shen, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03265 2025-11-10 cs.LG cs.AI 73%

Cognitive Edge Computing: A Comprehensive Survey on Optimizing Large Models and AI Agents for Pervasive Deployment

Xubin Wang, Qing Li, Weijia Jia

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏