arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2601.06937 2026-01-13 cs.AI cs.LG 62%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05269 2026-01-13 cs.IR cs.CV cs.LG 62%

Studying Illustrations in Manuscripts: An Efficient Deep-Learning Approach

研究手稿中的插图:一种高效的深度学习方法

Yoav Evron, Michal Bar-Asher Siegal, Michael Fire

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev, Be’er Sheva, Israel(计算机与信息科学学院,内盖夫本· Gurion大学,贝尔谢巴,以色列) The Goldstein-Goren Department of Jewish Thought, Ben-Gurion University of the Negev, Be’er Sheva, Israel(犹太思想Goldstein-Goren部门,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种高效的深度学习方法,用于大规模分析历史插图手稿,通过多模态描述和共享表示空间揭示视觉模式和跨手稿关系。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06781 2026-01-13 cs.HC cs.AI cs.CV 62%

AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs

AutoTour:基于智能手机和LLMs的自动照片导览系统

Huatao Xu, Zihe Liu, Zilin Zeng, Baichuan Li, Mo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 AutoTour利用智能手机和LLMs自动为用户照片生成细粒度地标注释和描述,实现可扩展且上下文感知的交互式探索体验。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05266 2026-01-12 cs.IR cs.AI cs.CL cs.LG 62%

Retrieval-Augmented Multi-LLM Ensemble for Industrial Part Specification Extraction

基于检索增强的多LLM集成工业零件规范提取系统

Muzakkiruddin Ahmed Mohammed, John R. Talburt, Leon Claasssens, Adriaan Marais

机构 * ERIQ Research Center University of Arkansas - Little Rock(ERIQ研究所以及阿肯色大学-利文斯顿分校) PiLog Group(PiLog集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于检索增强的多LLM集成框架,通过整合多种先进模型提升工业零件规范提取的准确性和完整性。

Comments The 17th International Conference on Knowledge and Systems Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01792 2026-01-06 cs.LG cs.AI cs.CL cs.SD 62%

HyperCLOVA X 8B Omni

HyperCLOVA X 8B Omni:首个支持文本、音频和视觉的任何到任何多模态模型

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 HyperCLOVA X 8B Omni是首个支持文本、音频和视觉的任何到任何多模态模型,通过统一的多模态处理实现高效且灵活的多模态交互。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22808 2026-01-06 cs.CV cs.AI 62%

EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation

EgoReAct:基于第一人称视频的3D人体反应生成

Libo Zhang, Zekun Li, Tianyu Li, Zeyu Cao, Rui Xu, Xiaoxiao Long, Wenjia Wang, Jingbo Wang, Yuan Liu, Wenping Wang, Daquan Zhou, Taku Komura, Zhiyang Dou

机构 * THU(清华大学) Brown(布朗大学) Georgia Tech(佐治亚理工学院) Cambridge(剑桥大学) HKU(香港大学) NJU(南京大学) CUHK(香港中文大学) HKUST(香港科技大学) TAMU(德克萨斯大学奥斯汀分校) PKU(北京大学) MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 EgoReAct通过构建HRD数据集,首次实现从第一人称视频实时生成3D对齐的人体反应运动,提升生成的现实感和空间一致性。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 62%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22220 2025-12-30 cs.CV cs.AI cs.RO 62%

On Extending Semantic Abstraction for Efficient Search of Hidden Objects

关于扩展语义抽象以实现隐藏物体的高效搜索

Tasha Pais, Nikhilesh Belulkar

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过扩展语义抽象,提出了一种高效搜索隐藏物体的方法,利用历史数据提升3D定位精度,帮助家庭机器人更快找到丢失物品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22129 2025-12-30 cs.MA cs.AI cs.LG 62%

ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling

ReCollab:基于检索增强的LLM用于协作即兴队友建模

Conor Wallace, Umer Siddique, Yongcan Cao

机构 * Department of Electrical and Computer Engineering, University of Texas at San Antonio(电子与计算机工程系,德克萨斯大学圣安东尼奥分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ReCollab通过检索增强生成技术提升即兴团队合作中队友行为建模的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21670 2025-12-29 cs.CV cs.LG 62%

The Deepfake Detective: Interpreting Neural Forensics Through Sparse Features and Manifolds

深度伪造侦探:通过稀疏特征和流形进行神经取证解释

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) University of California, Berkeley(伯克利人工智能安全倡议(BASIS)大学伯克利) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种通过稀疏特征和流形分析来解释深度伪造检测模型的框架,揭示了模型内部特征的使用规律和几何属性变化,以提升模型的可解释性和鲁棒性。

Comments 10 pages, 5 figures, Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21099 2025-12-25 cs.GR cs.AI cs.CV 62%

TexAvatars : Hybrid Texel-3D Representations for Stable Rigging of Photorealistic Gaussian Head Avatars

TexAvatars : 混合的texel-3D表示用于稳定驱动的逼真高斯头avatars

Jaeseong Lee, Junyeong Ahn, Taewoong Kang, Jaegul Choo

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TexAvatars通过混合texel-3D表示,结合分析rigging的几何基础与texel空间的连续性,实现逼真头avatars的稳定驱动和高保真表达。

Comments 3DV 2026, Project page with videos: https://summertight.github.io/TexAvatars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 62%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18986 2025-12-23 cs.LG cs.AI 62%

R-GenIMA: Integrating Neuroimaging and Genetics with Interpretable Multimodal AI for Alzheimer's Disease Progression

R-GenIMA:整合神经影像与基因组学的可解释多模态AI用于阿尔茨海默病进展

Kun Zhao, Siyuan Dai, Yingying Zhang, Guodong Liu, Pengfei Gu, Chenghua Lin, Paul M. Thompson, Alex Leow, Heng Huang, Lifang He, Liang Zhan, Haoteng Tang

机构 * Eli and Lilly company(艾利和利公司)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 R-GenIMA通过整合神经影像与基因组学,利用可解释的多模态AI方法,实现了对阿尔茨海默病进展的精准预测与机制揭示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18177 2025-12-23 cs.AI cs.CV 62%

NEURO-GUARD: Neuro-Symbolic Generalization and Unbiased Adaptive Routing for Diagnostics -- Explainable Medical AI

NEURO-GUARD:神经符号泛化与无偏自适应路由用于诊断——可解释的医疗AI

Midhat Urooj, Ayan Banerjee, Sandeep Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 NEURO-GUARD通过整合视觉变换器与语言驱动推理,提升医疗图像诊断的准确性、透明性和泛化能力。

Comments Accepted at Asilomar Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12146 2025-12-22 cs.CV cs.AI 62%

Multi Anatomy X-Ray Foundation Model

多解剖X光基础模型

Nishank Singla, Krisztian Koos, Farzin Haddadpour, Amin Honarmandi Shandiz, Lovish Chum, Xiaojian Xu, Qing Jin, Erhan Bas

机构 * GE HealthCare(通用电气医疗)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 XR-0通过自监督学习在多解剖X光数据上训练,实现了在多种临床任务中的高性能表现,展示了解剖多样性对构建通用医学视觉模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15115 2025-12-18 cs.LG cs.AI 62%

How Many Heads Make an SSM? A Unified Framework for Attention and State Space Models

多少个头才能构成一个SSM?一种统一的注意力和状态空间模型框架

Ali Ghodsi

机构 * Ali Ghodsi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一框架,通过输入依赖的有效交互操作符,分析了注意力和状态空间模型的表达性和可训练性权衡,并推导了三个理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14989 2025-12-18 cs.CL cs.AI cs.CV 62%

Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams

评估大型语言模型在多模态化学奥林匹克考试中的表现

Yiming Cui, Xin Yao, Yuxuan Qin, Xin Li, Shijin Wang, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。

Comments Published at Communications Chemistry

Journal ref Commun. Chem. 8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14938 2025-12-18 cs.CV cs.AI cs.MM cs.SD 62%

TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

TalkVerse:民主化分钟级音频驱动视频生成

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Snap Inc.(Snap公司)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。

Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10402 2025-12-18 cs.LG cs.AI 62%

The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks

阴影中的卓越:利用特征边界模糊性实现稳健的后门攻击

Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuwen Pu, Tianyu Du, Jinbao Li, Jianhai Chen, Shouling Ji

机构 * Zhejiang University(浙江大学) Chongqing University(重庆大学) Qilu University of Technology (Shandong Academy of Science)(青岛科技大学(山东科学院))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Eminence通过利用特征边界模糊性,实现稳健且隐蔽的后门攻击,以极低的毒化率有效提升攻击效果。

Comments Accepted by KDD2026 Cycle 1 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12929 2025-12-16 cs.CV cs.AI 62%

MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation

MADTempo: 多事件时间视频检索的交互系统与查询增强

Huu-An Vu, Van-Khanh Mai, Trong-Tam Nguyen, Quang-Duc Dam, Tien-Huy Nguyen, Thanh-Huong Le

机构 * Hanoi University of Science and Technology(河内科技大学) The University of Danang - University of Science and Technology(丹江-科技大学) Vietnam National University(越南国家大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 MADTempo通过结合时序搜索与网络视觉定位,提升多事件视频检索的时序推理和泛化能力,增强对罕见视觉概念的检索鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 62%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 62%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV 62%

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 62%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20993 2025-12-09 cs.LG cs.AI 62%

Subgoal Graph-Augmented Planning for LLM-Guided Open-World Reinforcement Learning

子目标图增强的规划用于LLM引导的开放世界强化学习

Shanwei Fan, Bin Zhang, Zhiwei Xu, Yingxuan Teng, Siqi Dai, Lin Cheng, Guoliang Fan

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SGA-ACR框架,通过整合环境特定的子目标图和多LLM规划流程,解决LLM在开放世界强化学习中的规划-执行对齐问题,提升子目标的可行性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 62%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15644 2025-12-04 cs.CV cs.AI cs.CR 62%

Can VLMs Detect and Localize Fine-Grained AI-Edited Images?

视觉语言模型能否检测并定位细粒度的人工智能编辑图像?

Zhen Sun, Ziyi Zhang, Zeren Luo, Zhiyuan Zhong, Zeyang Sha, Tianshuo Cong, Zheng Li, Shiwen Cui, Weiqiang Wang, Jiaheng Wei, Xinlei He, Qi Li, Qian Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Shandong University(山东大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。

Comments 14pages,19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02731 2025-12-03 cs.AI cs.LG 62%

Self-Improving AI Agents through Self-Play

通过自play实现自我改进的AI代理

Przemyslaw Chojecki

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26004 2025-12-03 cs.CV cs.AI 62%

Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations

通过人类叙述的弱监督学习进行视角注视手部物体分割

Nicola Messina, Rosario Leonardi, Luca Ciampi, Fabio Carrara, Giovanni Maria Farinella, Fabrizio Falchi, Antonino Furnari

机构 * Institute of Information Science and Technologies - National Research Council(信息科学与技术研究所-国家研究理事会) University of Catania(卡塔尼亚大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WISH模型,通过人类叙述的弱监督学习实现手部物体分割,无需精细像素标注即可超越基线方法。

Comments Under consideration at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02472 2025-12-03 cs.AI cs.CL cs.LG 62%

Guided Self-Evolving LLMs with Minimal Human Supervision

受最小人类监督引导的自演化大语言模型

Wenhao Yu, Zhenwen Liang, Chengsong Huang, Kishan Panaganti, Tianqing Fang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab in Seattle(西雅图腾讯AI实验室) Washington University in St. Louis(斯托克维尔华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 R-Few通过引入轻量级人类监督,实现稳定可控的自演化大语言模型,提升数学推理性能并减少对大量人类数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏