arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-20 至 2026-02-20 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1 篇

2602.17633 2026-02-20 cs.LG cs.AI stat.ML 62%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏