arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-06 至 2026-02-06 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2602.05633 2026-02-06 cs.CL 83%

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05480 2026-02-06 cs.CV 78%

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing

SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感

Peihao Wu, Yongxiang Yao, Yi Wan, Wenfei Zhang, Ruipeng Zhao, Jiayuan Li, Yongjun Zhang

机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) Hubei LuoJia Laboratory(湖北珞珈实验室) Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)

专题命中 安全评测 :alignment(title,abstract)

AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21051 2026-02-06 cs.CL cs.AI cs.CY 78%

Language Models and Logic Programs for Trustworthy Tax Reasoning

语言模型与逻辑程序用于可信的税务推理

William Jurayj, Nils Holzenberger, Benjamin Van Durme

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出结合语言模型与符号求解器的方法,用于提升税务推理的准确性与经济可行性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05381 2026-02-06 cs.AI 70%

Clinical Validation of Medical-based Large Language Model Chatbots on Ophthalmic Patient Queries with LLM-based Evaluation

医学基于大语言模型聊天机器人在眼科患者查询中的临床验证与基于LLM的评估

Ting Fang Tan, Kabilan Elangovan, Andreas Pollreisz, Kevin Bryan Dy, Wei Yan Ng, Joy Le Yi Wong, Jin Liyuan, Chrystie Quek Wan Ning, Ashley Shuen Ying Hong, Arun James Thirunavukarasu, Shelley Yin-His Chang, Jie Yao, Dylan Hong, Wang Zhaoran, Amrita Gupta, Daniel SW Ting

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究评估了四个医疗LLM在回答眼科患者问题中的表现,发现Meerkat-7B表现最佳,而MedLLaMA3-v20存在大量误导内容,GPT-4-Turbo评分与临床评分一致,表明基于LLM的评估在大规模基准测试中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01741 2026-02-06 cs.SE cs.AI cs.CL 62%

How Toxic Can You Get? Search-based Toxicity Testing for Large Language Models

你能有多有毒?基于搜索的大型语言模型毒性测试

Simone Corbo, Luca Bancale, Valeria De Gennaro, Livia Lestingi, Vincenzo Scotti, Matteo Camilli

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EvoTox通过迭代进化策略评估LLM的毒性倾向,有效检测毒性水平并控制成本开销。

Journal ref IEEE Transactions on Software Engineering, Nov. 2025, pp. 3056-3071, vol. 51

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05082 2026-02-06 cs.LG cs.AI stat.ML 62%

Reliable Explanations or Random Noise? A Reliability Metric for XAI

可靠的解释还是随机噪声?XAI的可靠性度量

Poushali Sengupta, Sabita Maharjan, Frank Eliassen, Shashi Raj Pandey, Yan Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解释可靠性指数(ERI),通过四个可靠性公理评估解释稳定性,揭示现有解释方法在现实部署中的可靠性问题,推动更可信的可解释人工智能系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03969 2026-02-06 cs.AI cs.CR cs.LG 62%

How Catastrophic is Your LLM? Certifying Risk in Conversation

你的LLM有多危险?对话中风险的认证

Chengxiao Wang, Isha Chaudhary, Qian Hu, Weitong Ruan, Rahul Gupta, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出C$^3$LLM框架,通过统计方法认证LLMs在多轮对话中的灾难性风险,揭示前沿模型中高达70%的潜在风险,强调改进安全训练的必要性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06013 2026-02-06 cs.CV cs.AI 57%

GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?

GenArena: 如何在视觉生成任务中实现人对齐的评估?

Ruihang Li, Leigang Qu, Jingxu Zhang, Dongnan Gui, Mengde Xu, Xiaosong Zhang, Han Hu, Wenjie Wang, Jiaqi Wang

机构 * University of Science(科学大学) Shanghai Innovation Institute(上海创新研究所) Tencent(腾讯) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GenArena通过成对比较范式实现视觉生成任务的人对齐评估,使开源模型超越专有模型,提升评估准确性达20%以上。

Comments Project Page: https://genarena.github.io/, Code: https://github.com/ruihanglix/genarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13515 2026-02-06 cs.SE cs.CL cs.LO 57%

Fine-tuned LLM-based Code Migration Framework

基于微调的LLM代码迁移框架

Oleg Grynets, Vasyl Lyashkevych, Dmytro Baran, Maksym Orliansky, Taras Zelenyy, Markiian Leshchyshyn

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究提出一种基于微调LLM的代码迁移框架,通过自动化SQL特征检测和半监督错误分析,提升数据库迁移的精度与效率。

Comments 16 pages, 27 figures, 7 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05110 2026-02-06 cs.AI 57%

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

理解大语言模型评估者行为:一种结构化多评估者框架用于商户风险评估

Liang Wang, Junpeng Wang, Chin-chia Michael Yeh, Yan Zheng, Jiarui Sun, Xiran Fan, Xin Dai, Yujie Fan, Yiwei Cai

机构 * Visa Research(Visa研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种结构化多评估者框架,用于评估LLM在商户风险评估中的推理质量,揭示了不同模型的自我评估偏见差异,并通过真实数据验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05854 2026-02-06 cs.HC 50%

DuoDrama: Supporting Screenplay Refinement Through LLM-Assisted Human Reflection

DuoDrama: 通过LLM辅助的人类反思支持剧本润色

Yuying Tang, Xinyi Chen, Haotian Li, Xing Xie, Xiaojuan Ma, Huamin Qu

专题命中 安全评测 :alignment(abstract)

AI总结 DuoDrama通过LLM辅助人类反思,提升剧本润色阶段的反馈质量和反思深度。

Comments Accepted by CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏