arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 61 篇

2608.30094 2026-09-01 cs.CV cs.LG 新提交 57%

A Hybrid State-Space Approach for Census-Tract Population Estimation

一种用于普查 tract 人口估算的混合状态空间方法

Jackson R. Ye, Alexandre V. Morozov

机构 * Rutgers University(罗格斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本研究提出 MambaPop 方法,将行政单元卫星图像作为序列建模输入,直接估算人口,消除分解步骤,在 8.4 万个美国本土普查 tract 上达到与 YOLOv11 相当的 MAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29363 2026-09-01 cs.AI 新提交 57%

TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning

TRACER:基于结果归因强化学习的LLM智能体单工具上下文保留机制

Ziqi Lin, Ye Wu, Mengying Yang, Xu Liu, Yizhou Liu, Qiang Ke, Qin Guo

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TRACER将压缩转化为单工具决策问题,通过感知后果的强化学习策略优化上下文保留,大幅降低长程语言智能体的标记消耗且维持任务成功率,具备跨架构迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28638 2026-09-01 cs.AI 新提交 57%

Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce

基于代理引导的求解与复现的自进化技能

Jiale Liu, Pinze Ren, Yuqi Xia, Huan Wang, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) The University of Edinburgh(爱丁堡大学) Tsinghua University(清华大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 该研究针对智能体自进化技能的缺陷,提出reSolve框架,通过求解与复现协议、代理验证器增强奖励及束搜索,使廉价模型技能性能超人工策划基线,且在自然科学任务上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28592 2026-09-01 cs.AI 新提交 57%

A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making

前沿大语言模型在符合指南且针对具体病例的肿瘤决策中的集体能力边界

Zhang Sheng, Jinming Li, Wangyang Chen, Zhiwei Bao, Yu YoSean Wang

机构 * City University of Hong Kong(香港城市大学) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院) Affiliated Hangzhou First People’s Hospital, Westlake University School of Medicine(西湖大学医学院附属杭州市第一人民医院) Zhejiang University(浙江大学) Shaoxing Vocational & Technical College(绍兴职业技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究构建肿瘤决策边界基准评估9个前沿LLMs,发现其存在临床元判断盲点,需架构干预,模型质量非临床部署主瓶颈,需可检测自身能力边界并路由决策至临床医生的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-09-01 cs.AI 版本更新 57%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24921 2026-09-01 cs.AI 版本更新 57%

post-graph-rag: A PostgreSQL-Native Bi-Temporal Graph RAG Engine with Temporal Grounding at Synthesis

post-graph-rag:一款原生PostgreSQL图检索增强生成引擎

Chandan Rajah

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 post-graph-rag是一款开源PostgreSQL原生图RAG引擎,解决现有图RAG的基础设施、图质量、时间累积问题,在三语料库对比中构建更优图且支持时间演化特性

Comments 31 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-09-01 cs.AI 版本更新 57%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Zehong Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-09-01 cs.RO cs.AI cs.CV 版本更新 57%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Shang Wu, Jiayi Wang, Jianshu Zhang, Jihai Zhao, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

Comments v2:Expanded the supplementary materials by adding three sections-Scene YAML, Robot Embodiment List, and Atomic Skill List-corrected typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13120 2026-09-01 cs.CL 版本更新 57%

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

EvoBrowseComp: 基于演化知识的搜索智能体基准测试

Yunhan Wang, Jiaan Wang, Lianzhe Huang, Xianfeng Zeng, Fandong Meng

机构 * Northeastern University, China(东北大学(中国)) Weixin AI, Tencent Inc, China(腾讯微信AI(中国))

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30947 2026-09-01 cs.CL 版本更新 57%

Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship

将人工智能研究扩展到人文学科:一个用于证据基础学术的多智能体框架

Yating Pan, Jiajun Zhang, Jun Wang, Qi Su

机构 * Department of Information Management(信息管理系) Research Center for Digital Humanities(数字人文研究中心) School of Foreign Languages(外国语言学院) Institute for Artificial Intelligence(人工智能研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出SPIRE多智能体框架,通过将人文学科操作建模为协作智能体角色,结合多尺度细读检索,实现基于证据的论证,在古典文献基准上优于现有方法。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08211 2026-09-01 eess.SP cs.IT cs.LG math.IT 版本更新 57%

Learning the Channel Gain from Anywhere to Anywhere via Cross-environment Transformer Estimators

通过跨环境变压器估计器学习任意地点到任意地点的信道增益

Prasenjit Dhara, Daniel Romero

机构 * Dept. of Information and Communication Technology, University of Agder(信息与通信技术系,阿格德大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的估计器,利用跨环境的空间模式学习信道增益地图,减少测量次数,提升学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-09-01 cs.CR cs.AI 版本更新 57%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01517 2026-09-01 cs.CY cs.AI cs.ET 57%

Agentic Workflow for Education: Concepts and Applications

Yuan-Hao Jiang, Yijie Lu, Ling Dai, Jiatong Wang, Ruijia Li, Bo Jiang

专题命中 规划推理 :planning(abstract);分类 cs.AI

Comments Proceedings of the 33rd International Conference on Computers in Education (ICCE 2025). Asia-Pacific Society for Computers in Education

Journal ref Jiang, Y.-H., Lu, Y., Dai, L., Wang, J., Li, R., & Jiang, B. (2025). Agentic workflow for education: Concepts and applications. Proceedings of the 33rd International Conference on Computers in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15741 2026-09-01 cs.NE cs.CL cs.MA 版本更新 57%

Large Language Models and Evolutionary Computation: A Critical Review of Bidirectional Interaction, Automated Algorithm Design, and Co-Adaptive Systems

基于景观与搜索行为分析的粒子群优化可解释信息处理

Dikshit Chauhan, Bapi Dutta, Indu Bala, Niki van Stein, Thomas Bäck, Anupam Yadav

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对粒子群优化(PSO),提出结合探索性景观分析与搜索轨迹网络的多维度可解释性框架,经24个基准函数实验确立拓扑与参数配置指南,提升了PSO的透明度与可解释性。

Comments 40 pages

Journal ref Computer Science Review, Volume 63, Part A, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13754 2026-09-01 cs.CV cs.AI 版本更新 57%

Towards Accurate and Lightweight Peripheral Neuroblastic Tumor Diagnosis via Contrastive Multi-scale Pathological Image Analysis

基于对比多尺度病理图像分析的精准轻量型外周神经母细胞性肿瘤诊断研究

Zhu Zhu, Shuo Jiang, Jingyuan Zheng, Yawen Li, Yifei Chen, Manli Zhao, Weizhong Gu, Feiwei Qin, Jinhu Wang, Gang Yu

机构 * Children’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出CoPath框架(含CoHisNet与PathVote),通过对比多尺度病理图像分析实现轻量型外周神经母细胞性肿瘤精准诊断,性能优于多数同类模型且计算复杂度更低。

Comments 14pages, 10 figures

Journal ref IEEE Journal of Biomedical and Health Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13415 2026-09-01 cs.MA cs.AI 版本更新 57%

A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives

多智能体协同决策综合综述:场景、方法、挑战与展望

Weiqiang Jin, Hongyang Du, Shixiang Tang, Biao Zhao, Guang Yang

机构 * The University of Hong Kong (HKU)(香港大学) Imperial College London(伦敦帝国学院) National Heart and Lung Institute, Imperial College London(伦敦帝国学院国家心肺研究所) Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该综述梳理多智能体协同决策的场景、方法等,重点分析深度多智能体强化学习与大语言模型驱动的多智能体方法,同时指出领域挑战与未来研究方向。

Comments 54 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2026-09-01 cs.CY cs.AI 版本更新 57%

Multimodal Large Language Models Predict Urban Safety Perception but Encode Non-Neutral Demographic Priors

多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28937 2026-09-01 eess.IV 新提交 50%

Multimodal Deep Learning for Uncertainty-Aware Radiation Pneumonitis Risk Prediction

用于不确定性感知放射性肺炎风险预测的多模态深度学习

Jin Yang, Tian Liu, Jing Wang, Robert Samstein, Kenneth Rosenzweig, Julie Bloom, Ming Chao

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出MM-DiT框架,通过多模态预训练整合CT图像与放射剂量分布,可联合估计RP风险并量化三类不确定性,在独立队列中验证了其预测准确性与不确定性量化能力。

Comments 30 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30701 2026-09-01 cs.SE 新提交 50%

A Phased Workflow for Operating LLM-Based Coding Agents

操作基于大语言模型(LLM)的编码智能体的分阶段工作流

Ante Kapetanovic, Tomislav Duricic, Andro Mercep, Emanuel Lacic

专题命中 规划推理 :planning(abstract)

AI总结 该研究提出Infobip团队开发的四阶段编码智能体操作工作流,通过前置人力审查、分阶段上下文管理应对故障,同时指出工作流有效性指标缺失等两个未解决问题。

Comments 2 pages, industry paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30696 2026-09-01 cs.CE cs.HC 新提交 50%

Domain-Grounded Tool Orchestration for LLM-Guided Scientific Analysis

面向LLM驱动的科学分析的领域基础工具编排

Jeff Lee, Sebastien Jourdain, Cory Quammen, Patrick O'Leary, Berk Geveci

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于领域本体和模型上下文协议(MCP)的架构,将LLM的意图解释、确定性领域工具执行与LLM解释分离,在ParaView服务器上实现了CFD后处理和拓扑数据分析,提升了结果解释准确率,减少了脚本生成类故障。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30572 2026-09-01 cs.SE 新提交 50%

Practical Implementation Report on Introducing Spec-Driven Development Using AI Agents in Software Development PBL

在软件开发PBL中引入基于AI智能体的规格驱动开发的实践实施报告

Hidetake Tanaka, Hiroshi Igaki, Kazumasa Shimari, Kiyoshi Honda, Naoki Fukuyasu

专题命中 规划推理 :planning(abstract)

AI总结 本研究在大三本科生SDPBL课程中实践引入基于AI智能体的SDD,定义四阶段工作流程,发现AI提升实施吞吐量但需教师验证代码理解以维持教育效果。

Comments Accepted for publication in the 38th International Conference on Software Engineering Education and Training (CSEE&T 2026) : 18 pages, 1 table, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29912 2026-09-01 cs.CY cs.SE 新提交 50%

Verification-Time Dependency on a Disappearing Evaluator

验证时间对消失的评估器的依赖性

Ho Wa Ku, Jameel Ahmed Siddiqui

专题命中 规划推理 :verifier(abstract)

AI总结 本文针对AI治理中评估器消失导致决策无法事后验证的问题,基于EG 3.0提出验证时间协议及VTPP,经实验验证了模型决策反转率等相关结论,明确了验证需绑定的证据与校准方法。

Comments 25 pages, 2 figures. Publication-ready preprint v8.3. Companion evidence and baseline records are cited in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29678 2026-09-01 cs.DB 新提交 50%

Diachronic Hypergraphs for Orchestrated Multi-Agent Multimodal Memory Curation

用于编排多智能体多模态记忆整理的历时超图

Yichao Feng, Ran Zhang, Haoran Luo, Zhenghong Lin, Carl Yang, Anh Tuan Luu

专题命中 规划推理 :reasoning(abstract)

AI总结 研究针对多智能体系统记忆结构模糊等问题,提出基于超图的多模态数据库MAGE,其可保存高阶协作事件,实验表明MAGE在多种记忆基准中性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28617 2026-09-01 cs.CY physics.soc-ph 新提交 50%

Can AI-Assisted Inquiry Enhance Students' Decision-Making Skills in Socio-Scientific Issues? A Three-Group Experimental Study on Climate Change

AI辅助探究能否提升学生在社会科学议题中的决策能力?一项关于气候变化的三组实验研究

Dimitrios Gousopoulos

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究通过三组实验发现,针对气候变化议题的AI辅助探究可显著提升中学生决策能力,AI以提问而非作答的设计能最大化其助益,且学生核对AI主张的次数与提升幅度正相关。

Journal ref International Journal of Advanced Multidisciplinary Research and Studies, Volume 6, Issue 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07146 2026-09-01 cs.CV 版本更新 50%

Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

学习搜索:一种基于决策的知识增强视觉问答代理

Zhuohong Chen, Zhenxian Wu, Yunyao Yu, Hangrui Xu, Zirui Liao, Zhifang Liu, Xiangwen Deng, Pen Jiao, Haoqian Wang

机构 * Tsinghua University(清华大学) University of Arizona(亚利桑那大学) Hefei University of Technology(合肥工业大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20553 2026-09-01 eess.SY cs.SY 版本更新 50%

Performance Guarantees for Data-Driven Sequential Decision-Making

数据驱动顺序决策中的性能保证

Bowen Li, Edwin K. P. Chong, Ali Pezeshki

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种通用框架,通过比率界为近似动态规划方案提供性能保证,应用于数据驱动机器人路径规划和多智能体传感器覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 25 篇

2608.29583 2026-09-01 cs.SE 新提交 89%

Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency

驱动思考:VLA推理-轨迹一致性的运行时监测

Tian Yu, Lu Feng, Sebastian Elbaum

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title);chain-of-thought(abstract);planning(abstract)

AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30650 2026-09-01 cs.AI cs.CL 新提交 81%

Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning

散度几何:追踪隐状态轨迹以实现自适应多轮推理

Jie Liang, Zhengxin Yu, Hamid Nasiri, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学) University of Huddersfield(哈德斯菲尔德大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究将多轮推理建模为LLM的隐状态轨迹,提出时间曲率与方差斜率两种几何信号,分解推理动作链,提升τ-Bench任务成功率并降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28701 2026-09-01 cs.CV 新提交 78%

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取

Bangwei Guo, Xujiang Zhao, Yanchi Liu, Wei Cheng, Shengyu Chen, Dongyue Li, Masaharu Morimoto, Takayuki Kuroda, Dimitris Metaxas, Haifeng Chen

机构 * Rutgers University(罗格斯大学) Meta NEC Labs America(美国NEC实验室) University of Electro-Communications(电气通信大学) NEC Corporation(日本电气公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-09-01 cs.CV 版本更新 78%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏