arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 387 篇

2606.12550 2026-06-12 cs.RO cs.AI 新提交 83%

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Foresight: 关于导航关键线索的迭代推理

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

机构 * UT Austin(德克萨斯大学奥斯汀分校) FieldAI

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交 82%

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 82%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 82%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 82%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19790 2026-07-23 cs.CV 新提交 82%

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

Trace:一种用于多领域视觉推理的分类法引导环境

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15278 2026-07-17 cs.CV 新提交 82%

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02448 2026-07-08 cs.MA 新提交 82%

AgentsCAD: Automated Design for Manufacturing of FDM Parts via Multi-Agent LLM Reasoning and Geometric Feature Recognition

AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计

Emmanuel George, Christopher Keefe, Peter Pak, Amir Barati Farimani

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25497 2026-06-25 cs.RO 新提交 82%

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24338 2026-06-24 cs.RO 新提交 82%

RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning

RoBoSR:面向具身机器人推理的结构化场景表示

Kewei Hu, Wanchan Yu, Fangwen Chen, Jing Jiajian, Zimeng Li, Ying Wei, Tianhao Liu, Michael Zhang, Hanwen Kang

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 提出RoBoSR,一种基于语义对象中心场景图的中间结构表示,将操作建模为逐步状态转换,实现因果推理和长期任务规划,并在零样本泛化中优于提示方法和经典TAMP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交 82%

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18846 2026-06-18 cs.CV 新提交 82%

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

从边界框到视觉推理:一种用于视觉语言模型的在线策略数据标注工具

Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Jilin University(吉林大学计算机科学与技术学院) OPPO

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 提出ScreenAnnotator,通过统一标注原子模式、在线策略循环与贝叶斯验证器,解决现有工具表达力不足、标注-训练脱节和数据复用性差的问题,实现高效多任务数据生成。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14795 2026-06-16 cs.CV 新提交 82%

Position: The Systemic Lack of Agency in Visual Reasoning

立场:视觉推理中系统性的能动性缺失

Yizhao Huang, Haoyang Chen, Shiqin Wang, Pohsun Huang, Jiayuan Li, Haoyuan Du, Yandong Shi, Zheng Wang, Zhixiang Wang

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(武汉大学计算机学院人工智能研究所多媒体软件工程研究中心) Hubei Key Laboratory of Multimedia(湖北省多媒体与网络通信工程重点实验室) Zhongguancun Academy, Beijing, China. 100094(中关村学院,北京,中国) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) Shanda AI Research Tokyo(上海大势人工智能研究东京)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文指出当前视觉语言模型因缺乏自主探索能力而无法进行隐式推理,并提出V-IRD基准来评估这一能力,实验表明强语义识别不等同于主动视觉探索。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07529 2026-06-09 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 82%

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

CAPruner: 概念相邻场景图剪枝器以增强大语言模型的3D空间推理

Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) SpatialTemporal AI(时空人工智能)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出概念相邻场景图剪枝器(CAPruner),通过融合模糊语义相关性和空间邻近性估计关系重要性,在任务特定上下文中选择关键关系,避免关系级标注,显著提升大语言模型在3D视觉语言任务上的空间推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03882 2026-08-05 cs.CL cs.AI cs.IR 新提交 81%

MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准

Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21552 2026-07-24 cs.AI cs.LG 新提交 81%

MIRROR: Learning from the Other View for Multi-Modal Reasoning

MIRROR:从其他视角学习以进行多模态推理

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02588 2026-07-07 cs.CV cs.AI cs.CL 新提交 81%

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

荷马:通过分层记忆和智能推理理解长视频

Yixin Ji, Fanghua Ye, Juntao Li, Bo Zhao, Zexuan Qiu, Zhaopeng Tu, Liefeng Bo, Min Zhang

机构 * Soochow University(苏州大学) Tencent Hunyuan Multimodal Department(腾讯混元多模态部)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02073 2026-07-03 cs.AI cs.LG 新提交 81%

Evidence-State Rewards for Long-Context Reasoning

证据状态奖励用于长上下文推理

Ya Gao, Pekka Marttinen

机构 * Aalto University(阿alto大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Maven框架,通过可编辑证据记忆和动作级状态转移奖励,优化长上下文推理中的证据导航,优于仅结果强化学习和证据识别基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00491 2026-07-02 cs.CV cs.AI cs.CL 新提交 81%

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

MindEdit-Bench:基于野外照片的VLM中对象级反事实空间推理基准

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

机构 * ZODA Zhejiang University(浙江大学) Tongji University(同济大学) The University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MindEdit-Bench基准,包含六项空间推理任务,其中两项新任务(L4和L5)测试对象级反事实推理,VLM平均准确率仅8%-31%,远低于人类的81%-97%。

Comments 18 pages, 7 figures. Dataset available at https://huggingface.co/datasets/ZODAOfficial/MindEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交 79%

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18111 2026-08-20 cs.AI 新提交 79%

Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

求解不等于绘图:奥林匹克几何图解推理基准

Hsien Xin Peng, Anthony Kim, Alvin Li, Calvin Supasanya, Shivank Garg, Kevin Zhu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对基础模型图解推理能力评估缺口,构建含954道奥林匹克几何题的基准,发现模型求解与绘图能力存在显著差距,绘图平均编译成功率仅36.14%。

Comments ICML 2026, AI4MATH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16480 2026-08-18 cs.CV cs.AI 新提交 79%

RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning

RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解

Yanbo Jiang, Haotian Zheng, Jiahao Wang, Hanxiao Ren, Yitao Xu, Yining Xing, Zehong Ke, Hao Cheng, Yiqian Tu, Jinhao Li, Zhiyuan Xuan, Fang Zhang, Jianqiang Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15736 2026-08-18 cs.AI 新提交 79%

Toward AI-Friendly Cartography: Understanding How Color Design Influences Foundation Model Spatial Reasoning on Sequential Choropleth Maps

面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理

Yonghe Sun, Zhenjia Liu, Hua Liao, Wenjia Xu, Nai Yang, Weihua Dong, Zhiwei Wei

机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。

Comments 42 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15006 2026-08-18 cs.CV cs.AI cs.MM 新提交 79%

MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems

MetaReason:通过编辑元信息实现精确的交错多模态推理以解决几何问题

Penghao Yin, Haomin Wang, Qihong Tang, Xiaoye Qu, Hongjie Zhang, Xiao-Ping Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出MetaReason框架,构建TutorGeo与ExamGeo数据集,结合监督微调与强化学习,实现几何问题的精确交错多模态推理,性能优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14741 2026-08-18 cs.CV cs.AI 新提交 79%

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

PolyComp:面向多模态模型组合式3D空间推理的基于多立方体(polycube)的基准测试集

Siddharth Patel

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究推出PolyComp基准测试集,考察多模态模型的组合式3D空间推理能力,测试了GPT-5.6 Sol等模型的准确率与成本,并发布了120个问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 79%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09818 2026-08-11 cs.CV cs.AI 新提交 79%

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

MedPixel:用于医学推理与分割的统一像素-语言模型

Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai Jiang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出统一医学像素-语言模型MedPixel,引入44万样本的MedPLG-440K数据集,通过联合多任务微调与像素级偏好优化训练,支持多类医学任务,性能优异且具备零样本迁移与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 79%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08477 2026-08-11 cs.CL 新提交 79%

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型

Juan S. Santillana

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07955 2026-08-11 cs.AI 新提交 79%

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

面向工具增强空间推理的自演化神经符号技能

Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu, Zhi Zhou, Xinwei Yang, Kun-Yang Yu, Ming Yang, Yang Chen, Yu-Feng Li

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。

Comments 25 pages, 9 figures, 10 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏