arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-03 至 2025-10-03 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2510.01266 2025-10-03 cs.CL cs.AI 88%

OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language

Isa Inuwa-Dutse

机构 * University of Huddersfield(赫德菲尔德大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19629 2025-10-03 cs.SE cs.RO 67%

Software Engineering for Self-Adaptive Robotics: A Research Agenda

Hassan Sartaj, Shaukat Ali, Ana Cavalcanti, Lukas Esterle, Cláudio Gomes, Peter Gorm Larsen, Anastasios Tefas, Jim Woodcock, Houxiang Zhang

机构 * Simula Research Laboratory(Simula研究实验室) University of York(约克大学) Aarhus University(奥胡斯大学) Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学) Southwest University(西南大学) Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01288 2025-10-03 cs.LG cs.AI 62%

Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours

Rui Melo, Rui Abreu, Corina S. Pasareanu

机构 * Carnegie Mellon University(卡内基梅隆大学) FEUP(费拉尔大学) INESC-ID(葡萄牙里斯本信息技术与创新研究中心)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments 9 main pages, 13 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01237 2025-10-03 cs.CL cs.AI 62%

Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation

Nandakishor M

机构 * AI Safety Research(人工智能安全研究) Convai Innovations(Convai创新)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00015 2025-10-03 cs.CL 57%

Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00320 2025-10-03 cs.CV 50%

TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models

Hao Zhang, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 幻觉与事实性 :alignment(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏