arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2601.01887 2026-01-07 cs.LG cs.AI 84%

Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance

单次实例实现安全:用一个实例修补微调的LLM

Jiawen Zhang, Lipeng He, Kejia Chen, Jian Lou, Jian Liu, Xiaohu Yang, Ruoxi Jia

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过单个安全示例高效修复微调后的LLM安全性,无需牺牲实用性且成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17254 2026-01-07 cs.CV cs.AI 79%

Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats

干预所有路径:统一缓解跨对齐格式的大型视觉-语言模型幻觉

Jiaye Qian, Ge Zheng, Yuchen Zhu, Sibei Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ShanghaiTech University(上海科技大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种统一干预框架,通过分析不同路径间的相互作用,有效缓解跨对齐格式的LVLM幻觉问题。

Comments Accepted to NeurIPS 2025, Project Page: https://github.com/SooLab/AllPath

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02562 2026-01-07 cs.LG eess.IV 57%

CutisAI: Deep Learning Framework for Automated Dermatology and Cancer Screening

CutisAI: 用于自动化皮肤科和癌症筛查的深度学习框架

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services USA(Hanson专业服务公司) University of Tennessee Knoxville(田纳西大学肯纳邦克分校) Oak Ridge National Laboratory USA(橡树岭国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 CBDC框架结合统计学习理论、拓扑数据分析和贝叶斯符合推断,实现了皮肤病和癌症筛查的高准确率和可信不确定性量化。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02766 2026-01-07 cs.RO cs.AR 50%

Advancing Assistive Robotics: Multi-Modal Navigation and Biophysical Monitoring for Next-Generation Wheelchairs

推动辅助机器人:多模态导航与生物物理监测用于下一代轮椅

Md. Anowar Hossain, Mohd. Ehsanul Hoque

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种多模态轮椅控制系统,结合多种输入接口与生物物理监测,提升患者独立性并实现护理人员实时监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 50%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏