WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习
Ke Xu, Zhongyuan Lian
机构
*
Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司)
;
Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)
机构
*
Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
;
CFAR, Agency for Science, Technology and Research(科技研究局CFAR)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV
机构
*
Yale University(耶鲁大学)
;
Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所)
;
Google DeepMind(谷歌DeepMind)
;
Stanford University(斯坦福大学)
;
Genentech(基因泰克)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Cornell University(康奈尔大学)
;
Harvard University(哈佛大学)
机构
*
College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
;
Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI))
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解
Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi
机构
*
DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门)
;
University of California, Santa Cruz, USA(加州大学圣克ruz分校)
;
Analogy AI
;
East China Normal University, China(华东师范大学)
;
Nanjing University, China(南京大学)
;
Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)
Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges
构建第一人称程序化AI助手:方法、基准和挑战
Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang
机构
*
Department of EEE(电子工程系)
;
The Hong Kong Polytechnic University(香港理工大学)
;
RayNeo
;
Tsinghua University(清华大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Nanyang Technological University(南洋理工大学)
SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning
SMMILE:一个多模态医学上下文学习的专家驱动基准
Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Stanford University(斯坦福大学)
;
Lund University(隆德大学)
;
Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院)
;
UCSF(加州大学旧金山分校)
;
University of Zurich(苏黎世大学)
;
University Hospital Zurich(苏黎世大学医院)
;
HOPPR
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.LG
GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing
GRASP: 基于区域感知的稀疏提示引导方法用于适应遥感图像的多模态大语言模型
Qigan Sun, Chaoning Zhang, Jianwei Zhang, Xudong Wang, Jiehui Xie, Pengcheng Zheng, Haoyu Wang, Sungyoung Lee, Chi-lok Andy Tai, Yang Yang, Heng Tao Shen
机构
*
School of Computing, Kyung Hee University(京畿大学计算机学院)
;
School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
;
College of Computer Science and Information Engineering, Harbin Normal University(哈尔滨师范大学计算机科学与信息工程学院)
;
College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及继续教育学院)
;
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi
机构
*
Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学)
;
School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)