arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-18 至 2026-08-18 共收录 5
2608.16353 2026-08-18 cs.CL cs.AI 新提交

HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

HalluTracer:基于深度平均真值信号的幻觉检测方法

Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

机构 * University of Technology Sydney(悉尼科技大学) City University of Macau(澳门城市大学) Meta actAVA AI(actAVA人工智能公司) Microsoft AI(微软人工智能) Squirrel Ai Learning(松鼠人工智能学习公司) East China Normal University(华东师范大学)

AI总结 HalluTracer是一种在模型生成答案前聚合各层真值证据的幻觉检测框架,在六个开源语言模型和五个基准上优于白盒基线,将幻觉检测转化为深度聚合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16210 2026-08-18 cs.LG stat.ML 新提交

Conditional Evaluation of Language Models with Cheap Auxiliary Signals

基于廉价辅助信号的语言模型条件评估

Zhi Zhang, Lingfeng Lyu, Yue Kang, Doudou Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Science and Technology of China(中国科学技术大学) Microsoft(微软公司) National University of Singapore(新加坡国立大学)

AI总结 针对现有语言模型条件评估中廉价辅助信号存在偏差的问题,提出半监督估计器LACE,结合局部中心化与岭控制变量,在多个基准数据集上完成实证评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16068 2026-08-18 cs.CL cs.AI 新提交

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

CAPO:面向大语言模型智能体的感知约束提示优化

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

机构 * Microsoft(微软)

AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14943 2026-08-18 cs.AI 新提交

Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-load, On-Demand Tool-Loading, Progressive Disclosure, and Hybrid

技能块:智能体应如何加载其技能?预加载、按需工具加载、渐进式披露与混合方式的缓存正确比较

Hironobu Nakasuji

机构 * Microsoft(微软)

AI总结 该研究比较四种智能体技能加载方法,发现Hybrid等方法可显著减少token使用,且无质量损失,条件加载在技能大部分无需每轮使用时最有益。

详情

展开后加载摘要…

URL PDF HTML 收藏