arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-08-14 至 2026-08-14 共收录 4
2608.13167 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

TRAPSBench:视觉-语言模型可编码认知约束却无法表达

Fnu Pramono, John Cai, Sourabh Kulkarni

机构 * Meta Superintelligence Labs(元超级智能实验室) Reflection AI(反射人工智能公司)

AI总结 研究针对视觉-语言模型的认知约束表达问题,构建TRAPSBench基准并提出PECS指标,发现模型可感知不确定性却难表达,瓶颈在表达,需输出阶段干预。

Comments 10 Pages excluding Reference and Appendix, Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12426 2026-08-14 cs.AI cs.CL 新提交

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变

Mariya I. Vasileva

机构 * Meta Superintelligence Labs(元超级智能实验室)

AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。

Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06239 2026-08-14 stat.ML cs.LG 版本更新

Functional Adjoint Sampler: Scalable Sampling on Infinite Dimensional Spaces

功能伴随采样器:无穷维空间上的可扩展采样方法

Byoungwoo Park, Juho Lee, Guan-Horng Liu

机构 * FAIR at Meta(Meta 的 FAIR)

AI总结 针对无穷维函数空间吉布斯分布采样的理论缺口,提出基于随机最优控制的功能伴随采样器FAS,在合成势与真实分子系统上实现了更优的转移路径采样性能。

详情

展开后加载摘要…

URL PDF HTML 收藏