GeoAI Agency Primitives
地理人工智能代理原语
机构 * Microsoft AI for Good Lab(微软人工智能公益实验室) ; NASA Harvest
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出9个原语用于地理人工智能代理层,解决GIS实践中迭代协作的缺失问题,通过基准测试提升人类生产力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
地理人工智能代理原语
机构 * Microsoft AI for Good Lab(微软人工智能公益实验室) ; NASA Harvest
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出9个原语用于地理人工智能代理层,解决GIS实践中迭代协作的缺失问题,通过基准测试提升人类生产力。
BigEarthNet.txt: 一个大规模多传感器图像-文本数据集和地球观测基准
机构 * BIFOLD(柏林智能数据与机器学习研究所) ; Technische Universität Berlin(柏林工业大学) ; University of Trento(特伦托大学) ; National Technical University(雅典国家技术大学) ; National Observatory of Athens(雅典国家天文台)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出BigEarthNet.txt,一个大规模多传感器图像-文本数据集,用于提升地球观测中的指令驱动图像-文本学习,包含9.6M文本注释,涵盖土地利用/覆盖类、空间关系及环境背景描述,通过对比分析证明其在文本丰富性和注释类型多样性上的优势。
Comments For details, see https://txt.bigearth.net
SeGPruner: 用于3D问答的语义-几何视觉令牌修剪器
机构 * Shanghai University(上海大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出SeGPruner,通过语义和几何引导的令牌减少框架提升3D问答效率,显著降低视觉令牌预算和推理延迟,同时保持竞争性性能。
MovieRecapsQA: 一种多模态开放式视频问答基准
机构 * Cornell University(康奈尔大学)
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV
AI总结 本文提出MovieRecapsQA基准,通过电影回顾视频生成8200个开放式问题及事实,构建无参考评估指标,评估多模态能力,发现视觉感知是主要瓶颈。
Comments CVPR 2026
你看到我指向的是什么?基于手势的 egocentric 视频问答
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。
Comments Accepted to CVPR 2026
CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; Pengcheng Lab, Guangzhou(广州鹏城实验室)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。
Comments Accepted by CVPR2026
LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势
机构 * Purdue University(普渡大学) ; Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) ; Department of Computer Science, Purdue University(普渡大学计算机科学系) ; InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。
Comments The paper was accepted by the Proceedings of the IEEE
基于指南的检索增强生成用于眼科临床决策支持
机构 * University of International Business and Economics(国际商务经济大学) ; Tsinghua University(清华大学) ; Heidelberg Institute of Global Health(海德堡全球健康研究院)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出Oph-Guid-RAG系统,通过多模态视觉RAG方法提升眼科临床问答与决策支持,通过可控检索框架和多模态推理提升证据基础和鲁棒性。
OmniFM:迈向模态鲁棒且任务无关的联邦学习 for 异质医学影像
机构 * School of Software, Shenyang University of Technology(沈阳理工大学软件学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 OmniFM提出一种统一训练分类、分割、超分辨率、视觉问答和多模态融合的联邦学习框架,通过频域洞察提升跨模态一致性,实现任务无关和模态鲁棒的联邦学习。
Comments Accepted by CVPR 2026 (Main)
超越地球:理解微重力环境中的人类行为与场景
机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄大学,德国) ; Hunan University, China(湖南大学,中国) ; INSAIT, Sofia University, Bulgaria(INSAIT,索菲亚大学,保加利亚) ; Waseda University, Japan(早稻田大学,日本) ; KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院,瑞典) ; RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构,瑞典)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出MicroG-4M数据集,用于微重力环境下的人类行为和场景理解,包含50种动作、1238个丰富描述和7000多个问答对,支持动作识别、视频captioning和视觉问答任务。
Comments 16 pages, 4 figures, code are available at https://github.com/LEI-QI-233/HAR-in-Space
叙事对齐的长视频问答
机构 * Purdue University(普渡大学) ; Amazon(亚马逊)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。
CURE:临床理解和检索评估的多模态基准
机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; SenseTime Research, China(商汤研究院) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。
面向快门的视频帧采样
机构 * ByteDance(字节跳动) ; Rutgers University(罗格斯大学) ; Georgia Tech(佐治亚理工学院)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出InfoShot,一种任务无关的快门感知帧采样方法,用于长视频理解。通过分割视频为语义一致的快门,并选择两种互补的关键帧,以保留视频结构和短时变化信息,提升视频理解和异常检测性能。
解锁电子健康记录:一种混合图RAG方法用于安全临床AI的患者问答
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出MediGRAF,一种结合图检索与向量嵌入的混合RAG系统,通过整合结构化数据与非结构化文本,提升临床AI在患者问答中的安全性和准确性。
Comments 26 pages, 5 figures, 2 tables
Journal ref Frontiers in Digital Health, vol. 8, 2026
一种具备技能的代理框架和多视频理解基准
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。
Int3DNet:混合现实中的场景-运动交叉注意力网络用于3D意图预测
机构 * KAIST UVR Lab(韩国国立科学技术院(KAIST)虚拟现实实验室) ; KAIST KI-ITC PMRC(韩国国立科学技术院(KAIST)信息与通信技术中心PMRC) ; KAIST KI-ITC ARRC(韩国国立科学技术院(KAIST)信息与通信技术中心ARRC) ; KAIST UVR Lab and KAIST KI-ITC ARRC(韩国国立科学技术院(KAIST)虚拟现实实验室和信息与通信技术中心ARRC)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 Int3DNet通过结合稀疏运动提示和场景点云的交叉注意力融合,直接预测3D意图区域,无需显式物体级感知,在混合现实环境中实现鲁棒的人意图预测。
Comments Accepted as an IEEE TVCG paper at IEEE VR 2026 (journal track)
先关注再注意:通过自回归注视实现高效的可扩展视频理解
机构 * UC Berkeley(伯克利大学) ; MIT(麻省理工学院) ; Clarifai(Clarifai公司) ; NVIDIA(英伟达公司)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。
Comments CVPR 2026. Project page: https://autogaze.github.io/
SommBench:评估语言模型的品酒师专业能力
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 SommBench是一个多语言基准,用于评估语言模型的品酒师专业能力,包含三个任务:葡萄酒理论问答、葡萄酒特征补全和食物-葡萄酒配对,测试模型在感官判断上的能力。
迈向赛场:评估体育中的空间智能
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 CourtSI通过大规模体育场景数据集评估VLMs的空间智能,发现现有基准存在局限,并验证了模型在体育场景中的提升效果。
TemporalDoRA: 用于鲁棒手术视频问答的时序PEFT
机构 * Dipartimento di Elettronica, Informazione e Bioingegneria (DEIB), Politecnico di Milano(电子信息与生物工程系(DEIB),米兰理工学院) ; IRCCS Humanitas Research Hospital(人类学研究所医院) ; UCL Hawkes Institute and Department of Computer Science, University College London(伦敦大学学院 Hawkes 研究所和计算机科学系) ; Division of Informatics, Imaging and Data Science, University of Manchester(信息学、影像学与数据科学系,曼彻斯特大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 TemporalDoRA通过引入时序多头注意力和选择性权重分解,提升手术视频问答的鲁棒性和性能。
点云作为多模态大语言模型的外语
机构 * Concordia University(康科迪亚大学)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。
Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026
UniUGG: 通过几何-语义编码实现统一的3D理解与生成
机构 * Fudan University(复旦大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。
NarrLV: 向长视频生成的综合性叙事导向评估迈进
机构 * UCAS ; CASIA(中国科学院自动化研究所) ; AMAP, Alibaba Group(阿里云实验室) ; NTU(国立科技大学) ; PKU(北京大学)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。
Comments Project Page: https://amap-ml.github.io/NarrLV-Website/
HCT-QA:一种用于人类中心表格问答的基准测试
机构 * Meta
专题命中 视觉问答 :vision language model(abstract);分类 cs.AI
AI总结 HCT-QA提出了一种用于人类中心表格问答的基准测试,包含大量真实和合成表格数据及对应的问答对,旨在评估和比较基于LLM和VLM的查询性能。
FocusGraph: 用于具身长视频问答的图结构帧选择
机构 * AXXX ; MIRAI ; Yandex ; FusionBrain Lab(FusionBrain实验室)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
AI总结 FocusGraph通过图结构帧选择和轻量级模型实现高效长视频问答,提升性能并减少推理时间。
RIVER:面向视频大语言模型的实时交互基准
机构 * School of Information Science And Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) ; State Key Lab of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 RIVER基准通过引入实时交互任务框架,改进视频大语言模型的实时交互能力,提升长期记忆与未来感知表现。
ToolVQA: 一个用于多步推理VQA的外部工具数据集
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
AI总结 ToolVQA是一个用于多步推理VQA的外部工具数据集,通过真实场景和复杂推理任务提升模型在现实工具使用中的泛化能力。
Comments Project page: https://fugtemypt123.github.io/ToolVQA-website/
构建一个思维宫殿:为有效长视频分析构建基于环境的语义图谱
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Meta ; UIUC(伊利诺伊大学香槟分校)
专题命中 视觉问答 :vision language model(abstract);分类 cs.CV
AI总结 VideoMindPalace通过构建环境基础的语义图谱,提升长视频分析中空间-时间连贯性和类人推理能力。
RAG-X: 用于医疗问答的检索增强生成系统系统性诊断
机构 * Oakland University(奥克兰大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 RAG-X通过系统性诊断框架,评估检索和生成过程,揭示问答系统中的隐藏失败模式,提升医疗问答的准确性和可靠性。
Comments 7 pages, 1 figure
SPARTA:可扩展且原则性的树状多跳问答基准
机构 * POSTECH
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 SPARTA通过自动生成大规模表格-文本问答基准测试,揭示了跨模态推理的深层缺陷。
Comments 10 pages, 5 figures. Published as a conference paper at ICLR 2026. Project page: https://sparta-projectpage.github.io/
Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026