CTSCAN: Evaluation Leakage in Chest CT Segmentation and a Reproducible Patient-Disjoint Benchmark
CTSCAN:评估泄漏在胸部CT分割中的影响及可重复的患者不重叠基准
机构 * Apple(苹果公司)
AI总结 本文提出CTSCAN基准,通过可重复的患者不重叠评估方法,揭示了训练与测试数据混合导致的性能虚高问题,并展示了去除患者重叠对分割指标的显著影响。
大厂专区
CTSCAN:评估泄漏在胸部CT分割中的影响及可重复的患者不重叠基准
机构 * Apple(苹果公司)
AI总结 本文提出CTSCAN基准,通过可重复的患者不重叠评估方法,揭示了训练与测试数据混合导致的性能虚高问题,并展示了去除患者重叠对分割指标的显著影响。
(1D) 有序标记实现高效的测试时搜索
机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) ; Apple(苹果公司)
AI总结 本文研究了有序标记对测试时搜索能力的影响,发现粗到细的1D结构比传统2D网格结构更易进行搜索,通过实验验证了有序结构在生成过程中能提升测试时扩展性。
Comments Project page: https://soto.epfl.ch/
通过后Transformer适配器纠正语言模型中的压制对数概率
机构 * Apple MLX(苹果MLX)
AI总结 研究通过后Transformer适配器纠正语言模型在敏感话题上的压制对数概率,展示适配器在不同规模模型上的泛化能力及生成一致性改进。
Comments 12 pages, 3 figures, code at https://github.com/SolomonB14D3/qwen-adapter-correction
COMPASS:评估LLM代理在约束优化中的表现
机构 * Harvard University(哈佛大学) ; Apple(苹果公司) ; Virginia Tech(弗吉尼亚理工学院) ; UIUC(伊利诺伊大学香槟分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。