arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-07-30 至 2026-07-30 共收录 3
2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08810 2026-07-30 cs.LG cs.AI 版本更新

Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation

压缩视频聚合器:用于高效微视频推荐的内容驱动模块

Yang Xiao, Huiyuan Chen, Kaiyuan Deng, Chao Jiang, Zinan Ling, Ruimeng Ye, Fei Wang, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(塔尔萨大学) Amazon(亚马逊) University of Arizona(亚利桑那大学) Visa

AI总结 本文提出压缩视频聚合器(CVA),通过解耦视频信息与偏好学习,利用冻结的VFM嵌入进行聚合,生成紧凑的视频嵌入以提升推荐效果。实验显示,通过CLIP重新选择关键帧可显著减少训练时间和GPU内存消耗,并提升所有方法的性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22888 2026-07-30 cs.CL cs.AI 版本更新

DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English

DialectLLM:一种超越标准美式英语的方言感知对话生成框架

Jio Oh, Paul Vicinanza, Thomas Butler, Steven Euijong Whang, Dezhi Hong, Amani Namboori

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

AI总结 DialectLLM通过生成多方言对话数据,解决LLM对非标准方言识别不足的问题,验证了方言特征对生成质量的影响,展示了其在对话生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏