arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1753 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1753 篇

2607.02569 2026-07-07 cs.CV cs.LG 新提交 70%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05952 2026-07-03 cs.CY 版本更新 70%

Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback

LLM导师院长:AI生成反馈的自动质量审查框架

Keyang Qian, Yixin Cheng, Rui Guan, Wei Dai, Flora Jin, Kaixun Yang, Sadia Nawaz, Zachari Swiecki, Guanliang Chen, Lixiang Yan, Dragan Gašević

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交 70%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 70%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 70%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18259 2026-06-18 cs.HC cs.AI 新提交 70%

Caring Without Feeling: Affective Dynamics as the Control Layer of Human-AI Agent Collaboration

无感关怀:情感动态作为人-AI智能体协作的控制层

Junjie Xu, Xingjiao Wu, Zihao Zhang, Yujia Xu, Yuzhe Yang, Jin Zhu, Luwei Xiao, Wen Wu, Liang He

机构 * East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文综述情感动态在人-AI智能体协作中的作用,提出将情感视为协调层而非AI内部属性,用于校准信任、委托和治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03130 2026-06-03 cs.LG 70%

Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

合成幻觉,真实收益:来自前沿模型的硬负样本用于FIM幻觉缓解

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 幻觉与事实性 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 针对小型开源代码模型在IDE自动补全中产生的填充中间(FIM)幻觉问题,提出一种无需执行的替代方法:利用前沿代码模型合成看似合理但错误的补全作为硬负样本,通过对比合成幻觉与真实开发者编辑的差异作为监督微调信号,在Delulu基准上提升精确匹配18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28722 2026-05-28 cs.AI 70%

Multi-Adapter Representation Interventions via Energy Calibration

通过能量校准的多适配器表示干预

Manjiang Yu, Hongji Li, Junwei Chen, Xue Li, Priyanka Singh, Yang Cao, Lijie Hu

机构 * The University of Queensland, Brisbane, Australia(昆士兰大学) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫 bin Zayed 人工智能大学) Institute of Science Tokyo, Tokyo, Japan(东京科学研究所)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出MARI方法,通过竞争性多适配器机制和基于能量的门控模块,自适应地确定干预方向和强度,在保持通用能力的同时提升对齐性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25832 2026-04-29 cs.AI 70%

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

TrialCalibre:一种完全自动化的因果引擎用于RCT基准测试和观察性试验校准

Amir Habibdoust, Xing Song

专题命中 幻觉与事实性 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TrialCalibre,一种多智能体系统,用于自动化和扩展BenchExCal流程,通过专门的智能体协调整个过程,实现适应性、可审计和透明的因果效应估计。

Comments 5 pages , 2 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025. Copyright 2025 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 70%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16727 2026-04-20 cs.AI 70%

Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints

反思搜索器:通过带有约束的强化学习提高大语言模型的可靠性

Zhenyun Yin, Shujie Wang, Xuhong Wang, Xingjun Ma, Yinchun Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出反思搜索器框架,结合置信度校准与基于检索的搜索,通过强化学习优化准确性,提升模型输出的可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07513 2026-04-10 cs.LG cs.AI cs.CL cs.CY 70%

SYN-DIGITS: A Synthetic Control Framework for Calibrated Digital Twin Simulation

SYN-DIGITS: 一种合成控制框架用于校准数字孪生模拟

Grace Jiarui Fan, Chengpiao Huang, Tianyi Peng, Kaizheng Wang, Yuhang Wu

机构 * Finance Division, Columbia Business School(哥伦比亚商学院金融系) Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系) Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营系) Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系和数据科学研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出SYN-DIGITS框架,通过学习数字孪生响应的潜在结构,校准大语言模型预测与人类行为的一致性,提升市场研究和社交科学中的模拟可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09438 2026-04-08 cs.CL 70%

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models

GrACE:一种生成方法,用于改进置信度 elicitation 和大语言模型在测试时的高效扩展

Zhaohan Zhang, Ziquan Liu, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出GrACE,一种生成方法,用于改进大语言模型的置信度 elicitation 和测试时的高效扩展,通过实时计算隐藏状态与特殊标记嵌入的相似性,实现可靠且可扩展的置信度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04231 2026-04-07 cs.LG 70%

Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization

子空间控制:将受约束的模型操控转化为可控的谱优化

Yancheng Huang, Changsheng Wang, Chongyu Fan, Yicheng Lang, Bingqi Shang, Yang Zhang, Mingyi Hong, Qing Qu, Alvaro Velasquez, Sijia Liu

机构 * OPTML, Michigan State University(OPTML,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI Lab,IBM研究院) University of Minnesota(明尼苏达大学) University of Michigan(密歇根大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出子空间控制框架,通过分析谱交叉任务干扰并利用一阶解正交化合并子空间,引入SIFT方法,实现可控更新以缓解目标与约束冲突,在四个应用中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22413 2026-04-02 cs.AI 70%

Epistemic Filtering and Collective Hallucination: A Jury Theorem for Confidence-Calibrated Agents

知识过滤与集体幻觉:一个适用于置信度校准代理的陪审团定理

Jonas Karge

机构 * Technische Universität Dresden(德累斯顿工业大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究异质代理在时间中学习自我可靠性估计并选择性 abstain 的集体准确性,提出基于置信度校准的框架,推导非渐近下界并证明其在置信度门控设置下的泛化能力,通过蒙特卡洛模拟验证,探讨其在AI安全中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23743 2026-03-24 cs.SE cs.AI 70%

Hybrid-Code v2: Zero-Hallucination Clinical ICD-10 Coding via Neuro-Symbolic Verification and Automated Knowledge Base Expansion

Hybrid-Code v2:通过神经符号验证和自动知识库扩展实现零幻觉的临床ICD-10编码

Yunguo Yu

机构 * AI Innovation & Prototyping, Zyter(人工智能创新与原型开发,Zyter)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 Hybrid-Code v2结合神经网络与符号验证,实现零类型I幻觉,同时保持高覆盖率和精度,通过自动知识库扩展解决规则系统扩展性问题。

Comments Version 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18353 2026-03-20 cs.AI 70%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15645 2026-02-18 cs.AI cs.CV 70%

CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving

CARE Drive:一种用于评估视觉语言模型在自动驾驶中推理响应性的框架

Lucas Elbert Suryana, Farah Bierenga, Sanne van Buuren, Pepijn Kooij, Elsefien Tulleners, Federico Scari, Simeon Calvert, Bart van Arem, Arkady Zgonnikov

机构 * organization= Department of Transport \& Planning, Faculty of Civil Engineering Geosciences, Delft University of Technology organization= Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology organization= Centre for Meaningful Human Control, Delft University of Technology organization= Faculty of Mechanical Engineering, Delft University of Technology , city= Delft , country= The Netherlands

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CARE Drive提出了一种评估视觉语言模型在自动驾驶中推理响应性的框架,通过受控上下文变化比较基线和增强模型决策,验证人类原因对决策的影响。

Comments 21 pages, on submission to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22399 2026-02-11 astro-ph.IM cs.AI physics.space-ph 70%

Space AI: Leveraging Artificial Intelligence for Space to Improve Life on Earth

空间AI:利用人工智能推动空间探索,改善地球生活

Ziyang Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出空间AI作为跨学科领域,旨在通过人工智能技术提升太空探索能力,同时为地球带来广泛的社会效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23506 2026-02-09 cs.LG stat.ML 70%

Position: Epistemic uncertainty estimation methods are fundamentally incomplete

位置:epistemic不确定性估计方法本质上是不完整的

Sebastián Jiménez, Mira Jürgens, Willem Waegeman

机构 * Department of Data Analysis and Mathematical Modeling, Ghent University, Ghent, Belgium(数据分析与数学建模系,根特大学,根特,比利时)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文指出epistemic不确定性估计方法存在固有缺陷,导致不确定性量化不准确且难以解释,需在高风险决策中谨慎使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06103 2026-02-09 cs.LG 70%

Toward Faithful and Complete Answer Construction from a Single Document

从单个文档构建忠实且完整的答案

Zhaoyang Chen, Cody Fleming

机构 * Department of Mechanical Engineering(机械工程系) Iowa State University(爱荷华州立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 EVE通过结构化框架提升文档基础推理的完整性和准确性,同时解决单次生成中覆盖与准确性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02034 2026-02-03 cs.AI 70%

Constrained Process Maps for Multi-Agent Generative AI Workflows

多代理生成AI工作流的约束过程图

Ananya Joshi, Michael Rudow

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 70%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19017 2026-01-28 cs.SD cs.LG 70%

A Framework for Evaluating Faithfulness in Explainable AI for Machine Anomalous Sound Detection Using Frequency-Band Perturbation

一种用于可解释人工智能在机器异常声音检测中评估忠实度的框架 使用频率带扰动

Alexander Buck, Georgina Cosma, Iain Phillips, Paul Conway, Patrick Baker

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种评估XAI在机器异常声音检测中忠实度的框架,通过频率带扰动方法评估不同XAI技术的可靠性,发现遮挡方法在模型敏感性上表现最佳。

Comments 16 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08525 2026-01-08 cs.CL 70%

Investigating CoT Monitorability in Large Reasoning Models

探究大型推理模型中的CoT可监控性

Shu Yang, Junchao Wu, Xilin Gong, Xuansheng Wu, Derek Wong, Ninghao Liu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) King Abdullah University of Science and Technology(卡布斯大学) University of Georgia(佐治亚大学) University of Macau(澳门大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09881 2026-01-06 cs.AI physics.ao-ph physics.plasm-ph 70%

Uncertainty Quantification of Surrogate Models using Conformal Prediction

利用符合预测对代理模型的不确定性量化

Vignesh Gopakumar, Ander Gray, Joel Oskarsson, Lorenzo Zanisi, Daniel Giles, Matt J. Kusner, Stanislas Pamela, Marc Peter Deisenroth

机构 * Centre for Artificial Intelligence Department of Computer Science University College London(人工智能中心 计算机科学系 伦敦大学学院) Heudiasyc Laboratory Université de Technologie de Compiègne(Heudiasyc实验室 技术大学Compiègne) Department of Computer and Information Science Linköping University(计算机与信息科学系 链接普大学) Computing Division UK Atomic Energy Authority(计算部门 英国原子能局)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于符合预测的框架,用于对代理模型的不确定性进行统计保证的量化,适用于高维空间-时间问题,且计算成本低,能有效验证预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01008 2026-01-06 eess.IV cs.AI cs.CV 70%

An Explainable Agentic AI Framework for Uncertainty-Aware and Abstention-Enabled Acute Ischemic Stroke Imaging Decisions

可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策

Md Rashadul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Daffodil International University(达福尔国际大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。

Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20630 2025-12-25 cs.AI 70%

MicroProbe: Efficient Reliability Assessment for Foundation Models with Minimal Data

MicroProbe: 用极少数据高效评估基础模型的可靠性

Aayam Bansal, Ishaan Gangwani

机构 * Aayam Bansal(未知) Ishaan Gangwani(未知)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 MicroProbe通过仅使用100个精心选择的示例,高效评估基础模型可靠性,比随机采样方法提升23.5%的综合分数,显著降低评估成本并保持高覆盖率。

Comments ICML NewInML

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02217 2025-12-03 cs.LG physics.app-ph 70%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01568 2025-12-03 cs.LG cs.AI cs.CL cs.CY 70%

Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism

大型语言模型是否言出必行?隐含关联、自我报告与行为利他主义之间的差距测量

Sandro Andric

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现大型语言模型在隐含利他主义偏见和自我报告与实际行为之间存在显著差距,建议将校准差距作为衡量标准。

Comments 14 pages, 7 figures, 7 tables. Code and data available at https://github.com/sandroandric/LLMs_Altruism_Study_Code

详情

展开后加载摘要…

URL PDF HTML 收藏