RemoteZero: Geospatial Reasoning with Zero Labels
RemoteZero:零样本地理空间推理
专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
RemoteZero:零样本地理空间推理
专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
专题命中 其他多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
MIRROR:多模态智能放射学推理与观察报告生成器
机构 * Texas A&M University(德克萨斯农工大学) ; Capital One(第一资本金融公司) ; IIT Hyderabad(印度理工学院海得拉巴分校)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 MIRROR是一款多模态智能放射学报告生成原型,通过分离分类、定位与文本生成环节实现可审计的放射学发现,在ChestMNIST数据集上达到0.729的宏平均AUROC,但受类别不平衡影响存在决策弃权问题。
Comments 8 pages, 5 figures, 5 tables, 24 references
超越统一恢复:利用像素级多模态引导赋能全场景恢复
机构 * Xiaomi Corporation(小米公司)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 针对全场景图像恢复现有方法采用统一策略忽略区域退化差异的问题,提出MGN-AIR框架,通过像素级多模态引导实现更精细恢复,在多任务基准上性能显著优于现有方法。
Comments Accepted by ACMMM2026 as Oral Paper
TRNet:用于多模态水稻分割的地形引导频率校正与结构感知解码
机构 * School of Computer Science, Sichuan University Jinjiang College(四川大学锦江学院计算机学院)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 TRNet模型针对山区丘陵水稻分割难题,采用双编码器与地形引导解码,在A、B区域水稻IoU较双编码器U-Net显著提升,验证了地形作为上下文先验的有效性。
Comments 16 pages, 9 figures, 6 tables
评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现
机构 * Saarland University(萨尔大学)
专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.MM
AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。
基于监督跨模态特征匹配的单帧点像素配准
机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)
专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。
面向通用多模态透视图估计
机构 * Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出了一种训练数据合成方法和改进网络,用于提升多模态透视图估计的泛化能力和精度。
ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Chinese Academy of Sciences(中国科学院) ; Tsinghua University(清华大学)
专题命中 其他多模态 :MLLM(title);分类 cs.CL、cs.AI
AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。
Comments 14 pages, 5 figures
赫мес:一种增强多模态跨语言字幕表达力的统一框架
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences Beijing China ; School of AI, University of\ Academy of Sciences Beijing China ; Beijing Jiaotong University Beijing China ; Geely AI lab Ningbo Zhejiang China ; MAIS, Institute of Automation, Chinese Academy of Sciences ; School of AI, University of\ Academy of Sciences ; Beijing Jiaotong University ; Geely AI lab
专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.AI
AI总结 赫мес通过整合说话人分离、术语识别和表达力增强模块,提升了多模态跨语言字幕的表达力和连贯性,实现了最先进的字幕生成性能。
Comments Accepted to The Web Conference (WWW) 2026
多模态遥感数据集如何通过SpatialNet-ViT实现分类转变?
机构 * Macquarie University(麦考瑞大学) ; TERI School Of Advanced Studies(TERI高级研究学院) ; Cornell University(康奈尔大学)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出SpatialNet-ViT模型,结合视觉转换器和多任务学习,以提升遥感数据分类的准确性和泛化能力。
Comments Accepted in the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025), scheduled for 3 - 8 August 2025 in Brisbane, Australia
无标签,无问题:利用多模态验证器训练视觉推理器
机构 * California Institute of Technology(加州理工学院)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。
Comments Project webpage: https://glab-caltech.github.io/valor/
专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.AI
机构 * Microsoft(微软)
专题命中 其他多模态 :multi-modal(title);分类 cs.CL、cs.AI
机构 * Department of Mechanical Engineering(机械工程系) ; Rajshahi University of Engineering and Technology(拉贾沙希工程与技术大学) ; Department of Industrial and Production Engineering(工业与生产工程系) ; Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) ; Department of Urban and Regional Planning(城市与区域规划系) ; Department of Computer Science Engineering(计算机科学与工程系) ; United International University(联合国际大学)
专题命中 其他多模态 :multi-modal(title);分类 cs.CV、cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 其他多模态 :multi-modal(title);分类 cs.CV、cs.CL
Comments under review
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 其他多模态 :multi-modal(title);分类 cs.CV、cs.AI
专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.AI
Comments Accepted to LREC-COLING 2024
专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI
Comments Presented at SIGSpatial GeoAI workshop '21
专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.AI
专题命中 其他多模态 :multi-modal(title);分类 cs.CL、cs.AI
Comments Accepted to AAAI 2022 DSTC10 Workshop
专题命中 其他多模态 :multimodal(title);分类 cs.AI、cs.MM
Comments 3 pages, 2 figures
专题命中 其他多模态 :multi-modal(title);分类 cs.AI、cs.MM
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.CL
Comments Accepted for presentation at IROS2021
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.CL
Comments 7 pages, accepted at SemEval-2021 co-located with ACL-IJCNLP 2021
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.CL
专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI
Comments 8 pages, 9 figures