arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-05 至 2026-01-05 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9 篇

2601.00590 2026-01-05 cs.CV 85%

SafeMo: Linguistically Grounded Unlearning for Trustworthy Text-to-Motion Generation

SafeMo: 语言引导的去学习用于可信的文本到运动生成

Yiling Wang, Zeyu Zhang, Yiran Wang, Hao Tang

机构 * The Australian National University(澳大利亚国立大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 SafeMo通过整合MMU策略,实现安全的人类运动生成,提升安全性和实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG 79%

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21842 2026-01-05 cs.CL 79%

AlignAR: Generative Sentence Alignment for Arabic-English Parallel Corpora of Legal and Literary Texts

AlignAR: 生成式句子对齐用于法律和文学文本的阿拉伯-英语平行语料库

Baorong Huang, Ali Asiri

机构 * School of Foreign Languages, Huaihua University(怀化大学外国语言学院) Al-lith University College, Umm al-Qura University(乌姆·盖拉大学阿尔利思学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 AlignAR通过生成式句子对齐方法,提升阿拉伯-英语法律和文学文本的平行语料库质量,验证了大语言模型在对齐任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20144 2026-01-05 cs.CL 79%

Multi-hop Reasoning via Early Knowledge Alignment

通过早期知识对齐实现多跳推理

Yuxin Wang, Shicheng Fang, Bo Wang, Qi Luo, Xuanjing Huang, Yining Zheng, Xipeng Qiu

机构 * Computer Science, Fudan University(复旦大学计算机科学系) Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究所) Shanghai SII(上海SII)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 EKA通过早期知识对齐提升多跳推理效率,增强检索精度和系统性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00355 2026-01-05 eess.IV cs.CV 67%

The Impact of Lesion Focus on the Performance of AI-Based Melanoma Classification

病变聚焦对基于AI的黑色素瘤分类性能的影响

Tanay Donde

机构 * Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本研究探讨了病变聚焦对AI黑色素瘤分类性能的影响,通过分析模型对病变区域的关注程度,揭示了可解释AI在医疗诊断中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00559 2026-01-05 cs.CR cs.AI 57%

Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools?

破解物联网安全:大语言模型能否超越静态分析工具?

Jason Quantrill, Noura Khajehnouri, Zihan Guo, Manar H. Alalfi

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00506 2026-01-05 cs.CL 57%

Rule-Based Approaches to Atomic Sentence Extraction

基于规则的方法用于原子句子提取

Lineesha Kamana, Akshita Ananda Subramanian, Mehuli Ghosh, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00535 2026-01-05 cs.CV 50%

FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection

FreeText: 通过注意力定位和频谱字形注入实现免训练的文本渲染

Ruiqiang Zhang, Hengyi Wang, Chang Liu, Guanjie Wang, Zehua Ma, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学)

专题命中 安全评测 :alignment(abstract)

AI总结 FreeText通过注意力定位和频谱字形注入技术,无需训练即可提升文本渲染的准确性和美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24260 2026-01-05 cs.CV 50%

Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT

基于物理的流形投影模型用于通用金属伪影减少在牙科CBCT

Zhi Li, Yaqi Wang, Bingtao Ma, Yifan Zhang, Huiyu Zhou, Shuai Wang

机构 * School of Cyberspace, Hangzhou Dianzi University(电子科技大学信息学院) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(电子科技大学电子设计自动化创新中心) Hangzhou Geriatric Stomatology Hospital, Hangzhou Dental Hospital Group(杭州老年口腔医院,杭州口腔医院集团) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出基于物理的流形投影模型,通过合成数据和临床数据实验,实现了更高效且可靠的牙科CBCT中金属伪影减少。

Comments This manuscript has been submitted to Medical Image Analysis for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏