CPJ: Explainable Agricultural Pest Diagnosis via Caption-Prompt-Judge with LLM-Judged Refinement
CPJ: 通过基于提示-判断的图像描述实现可解释的农业害虫诊断
Wentao Zhang, Tao Fang, Lina Lu, Lifei Wang, Weihe Zhong
机构
*
Business School, Shandong University of Technology, Shandong, China(山东科技大学商学院)
;
Institute of International Language Services Studies, Macau Millennium College, Macau SAR, China(国际语言服务研究所,澳门 Millennium 学院)
Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs
通过检索增强的大语言模型中的原子事实核查来提高医疗问答的可靠性与可解释性
Juraj Vladika, Annika Domres, Mai Nguyen, Rebecca Moser, Jana Nano, Felix Busch, Lisa C. Adams, Keno K. Bressem, Denise Bernhardt, Stephanie E. Combs, Kai J. Borm, Florian Matthes, Jan C. Peeken
机构
*
organization= College of Computer Science
;
Technology, Jilin University , city= Changchun , country= China
;
organization= Georgia Institute of Technology , city= Atlanta , country= USA
;
organization= Qingdao Institute of Software, College of Computer Science
;
Technology, China University of Petroleum (East China) , city= Qingdao , country= China
;
organization= Institute for Math \& AI, Wuhan University , city= Wuhan , country= China
;
organization= University of Michigan, Ann Arbor , country= USA
;
organization= Thrust of Artificial Intelligence, Hong Kong University of Science
;
organization= School of Artificial Intelligence
;
Computer Science, Nantong University , city= Nantong , country= China
Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance
Ego-EXTRA:视频语言眼动数据集用于专家-学员协助
Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella
机构
*
Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学)
;
Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构)
;
Meta Reality Labs Research(Meta现实实验室)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV
机构
*
State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
;
University of Science and Technology of China(中国科学技术大学)
;
Artificial Intelligence Research Institute(人工智能研究院)
;
iFLYTEK Co., Ltd(iFLYTEK公司)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.AI
机构
*
Department of Electrical Engineering
;
Computer Science University of Toledo Toledo, USA
;
Institute of Mathematical Sciences Claremont Graduate University Claremont, USA
;
Department of Bioengineering University of Toledo Toledo, USA
;
Department of Computer Science Bowling Green State University Bowling Green, USA
RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering
RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估
Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen
机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)
;
Xi’an Jiaotong University(西安交通大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.AI
TinyRS-R1: Compact Multimodal Language Model for Remote Sensing
TinyRS-R1:用于遥感的紧凑多模态语言模型
Aybora Koksal, A. Aydin Alatan
机构
*
Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)
CommentsAccepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS
SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System
SciEducator: 基于Deming循环多智能体系统的科学视频理解与教育
Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan
机构
*
Jinan University(济南大学)
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)
;
Peking University(北京大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
South China University of Technology(华南理工大学)
;
Guangming Laboratory(光明实验室)
;
Zhejiang University(浙江大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, Changsheng Xu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Kuaishou Technology(快手科技)
;
Zhengzhou University(郑州大学)
;
ShanghaiTech University(上海科技大学)
;
Peng Cheng Laboratory(鹏城实验室)