arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-08-28 至 2026-08-28 共收录 4
2608.26716 2026-08-28 cs.CV 新提交

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26638 2026-08-28 cs.CL stat.ML 新提交

Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation

哪些指标能节省最多的人工标注?预测驱动的评估与元评估

Mingqi Gao, Anthony Sicilia, Weiyan Shi

机构 * Northeastern University(东北大学) West Virginia University(西弗吉尼亚大学)

AI总结 该研究基于预测驱动推理提出预测驱动评估框架,引入预测驱动节省率元指标,结合有限人工判断与大规模自动评分实现无偏高效的系统比较,可节省人工标注成本,适用于各类无法验证的任务。

Comments Accepted at EMNLP 2026 (Main). Code available: this https URL (https://github.com/CHATS-lab/ppi-eval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26180 2026-08-28 cs.CL cs.AI 新提交

PACEShop: Evaluating Personalized, Actionable, Compositional, and Evidence-grounded Shopping Assistants

PACEShop:评估个性化、可操作、可组合且基于证据的购物助手

Weimin Lyu, Chen Luo, Guangrui Li, Yaochen Xie, Dhineshkumar Ramasubbu, Arief Koesdwiady, Wanqiu Long, Hansu Gu, Yutong Chen, Zheshen Wang, Dakuo Wang, Yi Liu

机构 * Amazon(亚马逊) Northeastern University(东北大学) Expedia(亿客行)

AI总结 针对现有购物助手评估基准未覆盖结构化回复联合评估目标的问题,提出 PACE 评估框架,构建含 22625 条记录的 PACEShop 基准数据集和 PACEJudge 协议,验证任务匹配输出契约对评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26109 2026-08-28 cs.AI 新提交

Standalone LLM and a Pre-specified Agentic Pipeline for Explaining ICU Mortality Predictions: a Feasibility Study on the eICU Demo Dataset

独立大型语言模型(LLM)与预定义智能体管道用于解释ICU死亡率预测:基于eICU演示数据集的可行性研究

Di Zhu, Chen Xie, Haoyun Zhang, Zihan Wei, Ziwei Wang, Jiazhao Shi, Ziyu Wang, Qiyang Xie

机构 * Santa Clara University(圣克拉拉大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Wake Forest University(维克森林大学) Northeastern University(东北大学)

AI总结 本研究基于eICU演示数据集对比独立LLM与四步智能体管道解释ICU死亡率预测,发现智能体管道在指南依据性等方面更优,但需搭配归因核查。

详情

展开后加载摘要…

URL PDF HTML 收藏