arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 387 篇

2606.06525 2026-06-12 cs.GR cs.AI 新提交 57%

Agentic Large Language Models for Automated Structural Analysis of 3D Frame Systems

用于三维框架系统自动化结构分析的主体化大型语言模型

Ziheng Geng, Ian Franklin, Santiago Martinez, Jiachen Liu, Yunhe Zhao, Minghui Cheng

机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) HBC Engineering Company(HBC工程公司) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种主体化LLM框架,通过投影表示和智能体流水线实现从自然语言输入到3D框架的自动化结构分析,平均准确率达90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10953 2026-06-10 cs.AI cs.CV 新提交 57%

Architect-Ant: Editable Automatic Furnishing of Architectural Floor Plans

Architect-Ant: 可编辑的建筑平面图自动家具布置

Fedor Rodionov, Aleksandar Cvejic, Michael Birsak, John Femiani, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Miami University(迈阿密大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出基于微调视觉语言模型的可编辑自动家具布置框架Architect-Ant,通过领域特定语言编码布局并优化,生成符合建筑约束的合理布局。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10819 2026-06-10 cs.CV cs.AI 新提交 57%

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) School of Electronics, Peking University(北京大学电子学院) School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10423 2026-06-10 cs.CL 新提交 57%

WebChallenger: A Reliable and Efficient Generalist Web Agent

WebChallenger: 一个可靠且高效的通用型Web智能体

Jayoo Hwang, Xiaowen Zhang, Vedant Padwal

机构 * ML Collective longsurf.ai Independent(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 提出WebChallenger框架,通过PageMem结构化页面表示、分治观察、轻量探索记忆和复合动作工作流,复现人类认知优势,使开源模型在多个Web导航基准上接近前沿专有系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 57%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08945 2026-06-09 cs.LG 新提交 57%

From Hazard Functions to Language Space: Cox-Supervised Distillation of Survival Risk into a Large Language Model

从风险函数到语言空间:Cox监督的生存风险蒸馏到大语言模型

Nicholas I-Hsien Kuo, Blanca Gallego, Louisa Jorm

机构 * Centre for Big Data Research in Health, the University of New South Wales(新南威尔士大学健康大数据研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出将Cox比例风险模型的时间事件风险信息迁移到大语言模型中的方法,通过文本提示微调Qwen模型,在三个数据集上取得有竞争力的区分度和校准性,并发现隐藏状态呈现连续风险梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08710 2026-06-09 cs.SE cs.AI 新提交 57%

Structuring agentic AI for HPC code modernization

构建用于HPC代码现代化的智能体AI

Anthony Marinov, Igor Sfiligoi

机构 * San Diego Supercomputer Center(圣地亚哥超级计算机中心) University of California, San Diego(加州大学圣地亚哥分校) La Jolla, California, United States(圣地亚哥, 加州, 美国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种结构化智能体AI方法,通过手动示例、持续可构建性和限制会话范围,成功将6万行Fortran MPI代码在数月内转换为C++ OpenMP并行代码。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 57%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08014 2026-06-09 cs.CV cs.AI 新提交 57%

GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence

GVC-Seg: 基于几何视觉对应的免训练3D实例分割

Liang Xu, Fangjing Wang, Jinyu Yang, Feng Zheng

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Southern University of Science and Technology(南方科技大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GVC-Seg,一种免训练的3D实例分割方法,通过几何与视觉特征对应消除多模型集成中的置信度偏差,在多个基准上达到最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 57%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06534 2026-06-08 eess.IV cs.AI 新提交 57%

Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

基于视觉基础模型的注意力一致纵向医学视觉问答

Jialin Wu, Qianru Zhang, Georges El Fakhri, Xiaofeng Liu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。

Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19298 2026-08-21 cs.CV 新提交 50%

SceneGTMM: A Conformal Mapping-based Scene-Aware Transferable GNN-Transformer Dual-Graph Interaction Framework for Map Matching

SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架

Yongliang Zhang, Feng Song, Ji Chen, Lishuai Guo, Yong Deng, Yue Zheng, Tianyi Liu, Zhixiong Chen, Qixin Zhang

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19059 2026-08-20 cs.RO cs.CV 新提交 50%

LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding

LT-Mem:面向终身场景理解的感知时间动态的时空记忆

Yumin Lee, Hyoseok Ju, Giseop Kim

机构 * DGIST(大邱庆北科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对机器人长期场景理解的时间遗忘问题,提出LT-Mem时空记忆框架,结合多会话SLAM与Tri-Memory结构,在LT-VQA数据集上性能优于基线且token消耗更少。

Comments 8 pages, 8 figures, 6 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18840 2026-08-20 cs.RO cs.CV 新提交 50%

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

超越布局与关节运动:面向具身交互的使用驱动型代码场景

Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

机构 * Meituan(美团)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对现有代码场景生成方法未建模场景功能使用的问题,提出RoomWright框架,通过使用驱动型物体推理与代码智能体实现可执行、可编辑的仿真就绪3D场景,为具身AI与策略学习提供交互式环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18498 2026-08-20 cs.CV 新提交 50%

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

DyG²T:基于3D高斯时空粒子图Transformer的对象动力学建模

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang

机构 * School of Computer Science and Technology, Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文针对现有动力学建模方法丢失细粒度细节、轨迹漂移等问题,提出DyG²T框架,通过空间补全关键点、TDN增强时间判别性、粒子图Transformer建模交互,在合成与真实数据集上实现精准动力学建模,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17975 2026-08-19 cs.GR cs.CV 新提交 50%

aDSL: Agentic 3D Creation via Joint Agent-Program Design

aDSL:通过智能体-程序联合设计实现智能体驱动的3D内容创建

Rui-Huan Wang, Si-Tong Wei, Jia-Qi He, Heng-Yi Wei, Baoquan Chen, Peng-Shuai Wang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究联合设计以智能体为中心的领域特定语言aDSL与角色专业化多智能体系统,通过“规划-执行-评审”循环提升3D内容创建的鲁棒性等,在文本到形状等任务上优于LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17535 2026-08-19 cs.CV 新提交 50%

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

GroupForward:通过实例分组前馈高斯溅射构建可参考的3D场景

Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GroupForward是一种实例分组前馈高斯溅射模型,可从稀疏多视图图像重建3D场景,结合RSRF实现复杂3D参考推理,提升了语义重建与参考推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16174 2026-08-18 eess.SY cs.SY 新提交 50%

L-COIN: LLM-Assisted Counterfactual Inference for Game-Theoretic Distributed Computation Offloading in Sub-THz LEO Satellite Networks

L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理

Jinhao Yi, Weijun Gao, Chong Han

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 50%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 50%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12737 2026-08-14 cs.CV 新提交 50%

Dual-Manifold Geometry Guided Representation Learning: Adaptive Coupling between Kernel and Data Spaces

双流形几何引导的表示学习:核空间与数据空间的自适应耦合

Wencong Zhang, Yue Zhang, Meiyan Huang, Wei Yang, Qianjin Feng

机构 * School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Southern Medical University(南方医科大学广东省医学图像重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出双流形视角,构建KGFT轻量级模块,结合利用与探索模式及深度感知策略,在ResNet等架构的图像分类等任务上取得一致性能提升,验证了方法的通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 50%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12059 2026-08-13 cs.CY 新提交 50%

Reconfiguring Geovisualization in the Age of Generative AI: Insights from Domain Experts

生成式AI时代的地理可视化重构:领域专家的见解

Mengyi Wei, Chenyu Zuo, Jiaying Xue, Nianhua Liu, Dongsheng Chen, Shengkai Wang, Yu Feng, Liqiu Meng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究通过访谈20位地理可视化专家,探究生成式AI对地理可视化实践的影响,发现其拓展了相关能力但转移了瓶颈,提出需领域特定方法实现负责任应用,为相关实践、教育等提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11458 2026-08-13 cs.CV 新提交 50%

Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026

多智能体目标存在性验证与学习型掩码几何优化:2026年第8届LSVOS挑战赛MeViS-Text赛道获胜报告

Jungyoon Lee, Gyuil Lim, Doeon Kim, Seong-heum Kim

机构 * Soongsil University(崇实大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出SSUPER方案,通过多智能体审计解耦存在性验证、StyleRefiner优化掩码几何,获2026年LSVOS挑战赛MeViS-Text赛道冠军,最终得分0.9081339614。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 50%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 50%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 50%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06729 2026-08-10 cs.RO cs.CV 新提交 50%

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06170 2026-08-07 cs.RO cs.CV 新提交 50%

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

Prior-SG:面向任意结构环境中场景图的任务与先验驱动区域分割

Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter

机构 * RAI Institute(RAI研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Prior-SG框架,将场景图生成视为概率对齐问题,通过融合异构专家与拓扑先验提升任意结构环境的语义区域分割精度,实现零样本本体灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 50%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 视觉空间推理 :planning(abstract)

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏