arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2509.02499 2025-09-09 cs.CL cs.AI 62%

MoSEs: Uncertainty-Aware AI-Generated Text Detection via Mixture of Stylistics Experts with Conditional Thresholds

Junxi Wu, Jinpeng Wang, Zheng Liu, Bin Chen, Dongjian Hu, Hao Wu, Shu-Tao Xia

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Shenzhen ShenNong Information Technology Co., Ltd.(深圳深农信息技术有限公司)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00461 2025-09-08 cs.CL cs.AI 62%

TECP: Token-Entropy Conformal Prediction for LLMs

Beining Xu, Yongming Lu

机构 * Department of School of Engineering, Shenzhen MSU-BIT University, Shenzhen, China, 518000(深圳MSU-BIT大学工程学院部门) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU-BIT University, Shenzhen, China, 518000(应用数学联合研究中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13748 2025-09-04 cs.CL cs.LG 62%

Learn and Unlearn: Addressing Misinformation in Multilingual LLMs

Taiming Lu, Philipp Koehn

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00646 2025-09-03 cs.CY cs.AI 62%

RAG-PRISM: A Personalized, Rapid, and Immersive Skill Mastery Framework with Adaptive Retrieval-Augmented Tutoring

Gaurangi Raul, Yu-Zheng Lin, Karan Patel, Bono Po-Jen Shih, Matthew W. Redondo, Banafsheh Saber Latibari, Jesus Pacheco, Soheil Salehi, Pratik Satam

机构 * College of Information Science, University of Arizona, Tucson, AZ, USA(信息科学学院,亚利桑那大学) Department of Electrical and Computer Engineering, University of Arizona, Tucson, AZ, USA(电气与计算机工程系,亚利桑那大学) Department of Systems and Industrial Engineering, University of Arizona, Tucson, AZ, USA(系统与工业工程系,亚利桑那大学) Department of Industrial Engineering, University of Sonora, Hermosillo, Mexico(工业工程系,索诺拉大学) Leonhard Center for Enhancement of Engineering Education, The Pennsylvania State University, University Park, PA, USA(工程教育增强中心,宾夕法尼亚州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

Comments 9 pages, 5 figures, Accepted by IEEE FIE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21228 2025-09-01 cs.CL cs.AI 62%

Decoding Memories: An Efficient Pipeline for Self-Consistency Hallucination Detection

Weizhi Gao, Xiaorui Liu, Feiyi Wang, Dan Lu, Junqi Yin

机构 * ORNL(橡树岭国家实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17753 2025-08-26 cs.RO cs.AI cs.CL cs.HC 62%

Talking to Robots: A Practical Examination of Speech Foundation Models for HRI Applications

Theresa Pekarek Rosin, Julia Gachot, Henri-Leon Kordt, Matthias Kerzel, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(知识技术,信息学院,汉堡大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

Comments Accepted at the workshop on Foundation Models for Social Robotics (FoMoSR) at ICSR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10266 2025-08-26 cs.LG cs.AI cs.SY eess.SP eess.SY 62%

Intelligent Condition Monitoring of Industrial Plants: An Overview of Methodologies and Uncertainty Management Strategies

Maryam Ahang, Todd Charter, Mostafa Abbasi, Maziyar Khadivi, Oluwaseyi Ogunfowora, Homayoun Najjaran

机构 * Department of Electrical and Computer Engineering, University of Victoria(电气与计算机工程系,维多利亚大学) Department of Mechanical Engineering, University of Victoria(机械工程系,维多利亚大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13564 2025-08-20 cs.CV cs.AI cs.LG cs.RO 62%

The 9th AI City Challenge

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Norimasa Kobori, Munkhjargal Gochoo, Ganzorig Batnasan, Munkh-Erdene Otgonbold, Fady Alnajjar, Jun-Wei Hsieh, Tomasz Kornuta, Xiaolong Li, Yilin Zhao, Han Zhang, Subhashree Radhakrishnan, Arihant Jain, Ratnesh Kumar, Vidya N. Murali, Yuxing Wang, Sameer Satish Pusegaonkar, Yizhou Wang, Sujit Biswas, Xunlei Wu, Zhedong Zheng, Pranamesh Chakraborty, Rama Chellappa

机构 * NVIDIA Corporation(NVIDIA公司) Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学阿尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota, Japan(日本丰田公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang-Ming Chiao-Tung University(国家阳明交通大学) University of Macau(澳门大学) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments Summary of the 9th AI City Challenge Workshop in conjunction with ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09085 2025-08-13 cs.NI cs.AI cs.LG 62%

Dynamic Uncertainty-aware Multimodal Fusion for Outdoor Health Monitoring

Zihan Fang, Zheng Lin, Senkang Hu, Yihang Tao, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06017 2025-08-11 cs.SE cs.CL cs.LG 62%

Position: Intelligent Coding Systems Should Write Programs with Justifications

Xiangzhe Xu, Shiwei Feng, Zian Su, Chengpeng Wang, Xiangyu Zhang

机构 * Purdue University(普渡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06306 2025-08-11 cs.CL cs.AI cs.HC 62%

Humans overrely on overconfident language models, across languages

Neil Rathi, Dan Jurafsky, Kaitlyn Zhou

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

Comments camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10583 2025-08-08 cs.SE cs.AI cs.CY 62%

$\texttt{Droid}$: A Resource Suite for AI-Generated Code Detection

Daniil Orel, Indraneil Paul, Iryna Gurevych, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(普及知识处理实验室) Department of Computer Science(计算机科学系) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03092 2025-08-06 cs.AI cs.CL 62%

Toward Verifiable Misinformation Detection: A Multi-Tool LLM Agent Framework

Zikun Cui, Tianyi Huang, Chia-En Chiang, Cuiqianhe Du

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23628 2025-08-04 cs.CL cs.AI 62%

AutoSchemaKG: Autonomous Knowledge Graph Construction through Dynamic Schema Induction from Web-Scale Corpora

Jiaxin Bai, Wei Fan, Qi Hu, Qing Zong, Chunyang Li, Hong Ting Tsang, Hongyu Luo, Yauwai Yim, Haoyu Huang, Xiao Zhou, Feng Qin, Tianshi Zheng, Xi Peng, Xin Yao, Huiwen Yang, Leijie Wu, Yi Ji, Gong Zhang, Renhai Chen, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) CSE, CUHK(香港城市大学计算机科学与工程系) Theory Lab, Huawei(华为理论实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments 9 pages, preprint, code: https://github.com/HKUST-KnowComp/AutoSchemaKG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22915 2025-08-01 cs.CL cs.AI 62%

Theoretical Foundations and Mitigation of Hallucination in Large Language Models

Esmail Gumaan

机构 * Department of Computer Science, University of Sana'a(桑加大学计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14239 2025-07-22 cs.CL cs.AI 62%

CCL-XCoT: An Efficient Cross-Lingual Knowledge Transfer Method for Mitigating Hallucination Generation

Weihua Zheng, Roy Ka-Wei Lee, Zhengyuan Liu, Kui Wu, AiTi Aw, Bowei Zou

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究机构(I2R),A*STAR,新加坡)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16215 2025-07-22 cs.AI cs.LG eess.SP 62%

Smarter Together: Combining Large Language Models and Small Models for Physiological Signals Visual Inspection

Huayu Li, Zhengxiao He, Xiwen Chen, Ci Zhang, Stuart F. Quan, William D. S. Killgore, Shu-Fen Wung, Chen X. Chen, Geng Yuan, Jin Lu, Ao Li

机构 * Department of Electrical and Computer Engineering, University of Arizona(电气与计算机工程系,亚利桑那大学) School of Computing, Clemson University(计算学院,克莱姆斯大学) School of Computing, University of Georgia(计算学院,佐治亚大学) Department of Medicine, University of Arizona(医学系,亚利桑那大学) Harvard Medical School and Brigham and Women’s Hospital(哈佛医学院和布里洛妇女医院) Department of Psychiatry, University of Arizona(精神病学系,亚利桑那大学) BIO5 Institute, University of Arizona(BIO5研究所,亚利桑那大学) College of Nursing, University of Arizona(护理学院,亚利桑那大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13411 2025-07-21 cs.CL cs.AI 62%

Aligning Knowledge Graphs and Language Models for Factual Accuracy

Nur A Zarin Nishat, Andrea Coletta, Luigi Bellomarini, Kossi Amouzouvi, Jens Lehmann, Sahar Vahdati

机构 * TIB – Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) Amazon, Germany(亚马逊公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09477 2025-07-17 cs.CL cs.AI 62%

Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs

Yangning Li, Weizhi Zhang, Yuyao Yang, Wei-Chieh Huang, Yaozu Wu, Junyu Luo, Yuanchen Bei, Henry Peng Zou, Xiao Luo, Yusheng Zhao, Chunkit Chan, Yankai Chen, Zhongfen Deng, Yinghui Li, Hai-Tao Zheng, Dongyuan Li, Renhe Jiang, Ming Zhang, Yangqiu Song, Philip S. Yu

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments submitted to ARR May

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10586 2025-07-16 cs.CL cs.AI 62%

AutoRAG-LoRA: Hallucination-Triggered Knowledge Retuning via Lightweight Adapters

Kaushik Dwivedi, Padmanabh Patanjali Mishra

机构 * BITS Pilani(比斯·皮兰大学) University of Adelaide(阿德莱德大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06893 2025-07-10 cs.CL cs.AI 62%

Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights

Alexandra Abbas, Celia Waggoner, Justin Olive

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04893 2025-07-08 cs.AI cs.CL cs.MA 62%

MARBLE: A Multi-Agent Rule-Based LLM Reasoning Engine for Accident Severity Prediction

Kaleem Ullah Qasim, Jiashu Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02595 2025-07-04 cs.CL cs.AI 62%

MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion

Xin Guan, PeiHsin Lin, Zekun Wu, Ze Wang, Ruibo Zhang, Emre Kazim, Adriano Koshiyama

机构 * University College London(伦敦大学学院) Center for long-term AI(长期人工智能中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICML 2025 AIW Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00003 2025-07-02 cs.LG cs.AI cs.CR cs.NI 62%

Deciding When Not to Decide: Indeterminacy-Aware Intrusion Detection with NeutroSENSE

Eyhab Al-Masri

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17296 2025-06-24 cs.CL cs.AI 62%

Semantic uncertainty in advanced decoding methods for LLM generation

Darius Foodeei, Simin Fan, Martin Jaggi

机构 * EPFL, Lausanne Switzerland(日内瓦联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18242 2025-06-17 cs.CL cs.AI 62%

ShED-HD: A Shannon Entropy Distribution Framework for Lightweight Hallucination Detection on Edge Devices

Aneesh Vathul, Daniel Lee, Sheryl Chen, Arthi Tasmia

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11073 2025-06-16 cs.CL cs.AI cs.CV 62%

CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention Intervention

Zekai Ye, Qiming Li, Xiaocheng Feng, Libo Qin, Yichong Huang, Baohang Li, Kui Jiang, Yang Xiang, Zhirui Zhang, Yunfei Lu, Duyu Tang, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07184 2025-06-10 cs.AI cs.CL cs.CV 62%

Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images

Liangliang You, Junchi Yao, Shu Yang, Guimin Hu, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) University of Electronic Science and Technology of China(中国电子科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14309 2025-06-05 cs.CL cs.AI 62%

LoGU: Long-form Generation with Uncertainty Expressions

Ruihan Yang, Caiqi Zhang, Zhisong Zhang, Xinting Huang, Sen Yang, Nigel Collier, Dong Yu, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02863 2025-05-27 cs.CL cs.LG 62%

SteerConf: Steering LLMs for Confidence Elicitation

Ziang Zhou, Tianyuan Jin, Jieming Shi, Qing Li

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏