arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-05 至 2025-12-05 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 10 篇

2512.04118 2025-12-05 cs.CY cs.LG 81%

Patient Safety Risks from AI Scribes: Signals from End-User Feedback

人工智能记录员对患者安全的风险:来自终端用户反馈的信号

Jessica Dai, Anwen Huang, Catherine Nasrallah, Rhiannon Croci, Hossein Soleimani, Sarah J. Pollet, Julia Adler-Milstein, Sara G. Murray, Jinoos Yazdany, Irene Y. Chen

机构 * University of California Berkeley(加州大学伯克利分校) University of California San Francisco(加州大学旧金山分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CY、cs.LG

AI总结 本研究通过混合方法分析了AI记录员在医疗反馈中引发的患者安全风险,发现转录错误可能导致药物和治疗方面的风险,需进一步研究以明确风险程度。

Comments ML4H Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22345 2025-12-05 cs.CV 78%

Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment

反向流动:通过反向表征对齐改进规范化流

Yang Chen, Xiaowei Xu, Shuai Wang, Chenhui Zhu, Ruxue Wen, Xubin Li, Tiezheng Ge, Limin Wang

专题命中 安全评测 :alignment(title,abstract)

AI总结 通过反向表征对齐改进规范化流,提升生成质量和分类准确性,训练速度提升3.3倍,实现ImageNet新state-of-the-art结果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00591 2025-12-05 cs.CL 70%

Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness

探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程

Lang Xiong, Nishant Bhargava, Jianhang Hong, Jeremy Chang, Haihao Liu, Vasu Sharma, Kevin Zhu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05066 2025-12-05 cs.LG cs.AI cs.CL 67%

Multi-LLM Collaboration for Medication Recommendation

多LLM协作用于药物推荐

Huascar Sanchez, Briland Hitaj, Jules Bergmann, Linda Briesemeister

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室) University of Maryland St. Joseph Medical Center(马里兰大学圣约瑟夫医疗中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于LLM化学的多模型协作方法,通过增强互补性、稳定性和校准性,提高药物推荐的可靠性与可信度。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04871 2025-12-05 cs.AI cs.CL cs.LG 67%

STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions

STELLA: 通过语义抽象引导大型语言模型进行时间序列预测

Junjie Fan, Hongye Zhao, Linduo Wei, Jiayu Rao, Guijia Li, Jiaxin Yuan, Wenqi Xu, Yong Qi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STELLA通过动态语义抽象机制,提升大型语言模型在时间序列预测中的表现,实现更精准的长期和短期预测。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04107 2025-12-05 cs.CY cs.AI cs.HC cs.LG 67%

Rethinking AI Evaluation in Education: The TEACH-AI Framework and Benchmark for Generative AI Assistants

重新思考教育中的AI评估:TEACH-AI框架与生成AI助手的基准测试

Shi Ding, Brian Magerko

机构 * Expressive Machinery Lab(表达性机械实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出TEACH-AI框架,旨在通过多视角重新定义教育中AI的有效性评估,促进包容性和长期影响。

Comments 6 pages, NeurIPS 2025 Responsible Foundation Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04864 2025-12-05 cs.AI 57%

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04530 2025-12-05 cs.LG 57%

Explainable Graph Representation Learning via Graph Pattern Analysis

通过图模式分析实现可解释的图表示学习

Xudong Wang, Ziheng Sun, Chris Ding, Jicong Fan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出PXGL-GNN框架,通过图模式分析实现图表示的可解释性,解决了传统方法在节点特征忽略和高维问题上的局限。

Comments Full version with appendix of the paper published in the Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), Main Track

Journal ref Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), Main Track, pages 3426-3434, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04405 2025-12-05 eess.SP cs.AI 57%

Towards 6G Native-AI Edge Networks: A Semantic-Aware and Agentic Intelligence Paradigm

迈向6G原生AI边缘网络:一种语义感知和代理智能范式

Chenyuan Feng, Anbang Zhang, Geyong Min, Yongming Huang, Tony Q. S. Quek, Xiaohu You

机构 * College of Computer Science, University of Exeter, Exeter, U.K.(埃克塞特大学计算机科学学院) Sony China Research Laboratory, Beijing, China(索尼中国研究实验室) School of Information Science and Engineering, Southeast University, Nanjing, China(东南大学信息科学与工程学院) Purple Mountain Laboratories, Nanjing, China(紫金山实验室) Information System Technology and Design Pillar, Singapore University of Technology and Design, Singapore(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出语义感知和代理智能范式,旨在通过统一分类法和促进技术推动6G原生AI边缘网络的发展。

Comments submitted to Digital Communications and Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23749 2025-12-05 cs.SE 50%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 安全评测 :alignment(abstract)

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏