arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-05 至 2025-12-05 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2506.00331 2025-12-05 cs.CL 79%

TreeRare: Syntax Tree-Guided Retrieval and Reasoning for Knowledge-Intensive Question Answering

TreeRare: 语法树引导的检索与推理用于知识密集型问答

Boyi Zhang, Zhuo Liu, Hangfeng He

机构 * University of Rochester(罗切斯特大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 TreeRare通过语法树引导的检索与推理方法,提升知识密集型问答任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04680 2025-12-05 cs.SE cs.AI cs.HC 77%

Generative AI for Self-Adaptive Systems: State of the Art and Research Roadmap

生成式人工智能在自适应系统中的应用:现状与研究路线图

Jialong Li, Mingyue Zhang, Nianyu Li, Danny Weyns, Zhi Jin, Kenji Tei

机构 * Waseda University(早稻田大学) Southwest University(西南大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学) Tokyo Institute of Technology(东京技术大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。

Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04923 2025-12-05 cs.AI cs.CL 62%

Algorithmic Thinking Theory

算法思维理论

MohammadHossein Bateni, Vincent Cohen-Addad, Yuzhou Gu, Silvio Lattanzi, Simon Meierhans, Christopher Mohri

机构 * Google(谷歌) NYU(纽约大学) ETH Zurich(苏黎世联邦理工学院) Stanford(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种算法思维理论框架,用于分析和设计更强大的推理方法,通过概率 oracle 实现迭代改进和答案聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09058 2025-12-05 cs.SE cs.AI cs.SY eess.SY 57%

EmbedGenius: Towards Automated Software Development for Generic Embedded IoT Systems

EmbedGenius: 面向通用嵌入式物联网系统的自动化软件开发

Huanqi Yang, Mingzhe Li, Mingda Han, Zhenjiang Li, Weitao Xu

机构 * City University of Hong Kong(香港城市大学) Shandong University(山东大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 EmbedGenius通过结合大语言模型和嵌入式系统知识,实现了通用嵌入式物联网系统的自动化软件开发,显著提升了代码生成准确率和任务完成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04380 2025-12-05 cs.NI 50%

Vision and Causal Learning Based Channel Estimation for THz Communications

基于视觉与因果学习的太赫兹通信信道估计

Kitae Kim, Yan Kyaw Tun, Md. Shirajum Munir, Chirsto Kurisummoottil Thomas, Walid Saad, Choong Seon Hong

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一种结合视觉与因果学习的信道估计方法,通过分析城市环境实时图像,提升THz通信信道估计的准确性和鲁棒性。

Comments Submitted to IEEE Transactions on Mobile Computing on Mar. 20, 2025 (18 pages, 9 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04222 2025-12-05 cs.CV 50%

ReasonX: MLLM-Guided Intrinsic Image Decomposition

ReasonX: 基于多模态大语言模型的内在图像分解

Alara Dirik, Tuanfeng Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück

机构 * Imperial College London(伦敦帝国学院) Adobe Research(Adobe研究院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 17 篇

2512.04307 2025-12-05 cs.LG cs.AI 81%

Evaluating Long-Context Reasoning in LLM-Based WebAgents

评估基于大语言模型的WebAgent的长上下文推理能力

Andy Chung, Yichi Zhang, Kaixiang Lin, Aditya Rawal, Qiaozi Gao, Joyce Chai

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了基于大语言模型的WebAgent在长上下文场景中的推理能力,发现随着上下文长度增加,性能显著下降,提出隐式RAG方法以改进任务执行。

Comments Accepted NeurIPS 25 LAW Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04254 2025-12-05 cs.CR cs.AI 79%

Hey GPT-OSS, Looks Like You Got It -- Now Walk Me Through It! An Assessment of the Reasoning Language Models Chain of Thought Mechanism for Digital Forensics

嘿,GPT-OSS,看来你已经掌握了——现在让我带你走一遍!对数字取证中推理语言模型链式思维机制的评估

Gaëtan Michelet, Janine Schneider, Aruna Withanage, Frank Breitinger

机构 * Chair for Cybersecurity, University of Augsburg, Augsburg, Germany(网络安全系,乌尔姆大学,乌尔姆,德国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了推理语言模型在数字取证中的应用,发现中等推理水平有助于解释模型输出,但更高推理水平未显著提升响应质量。

Comments Accept at DFRWS EU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV 79%

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 78%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17773 2025-12-05 cs.CV cs.AI cs.CL cs.LG 75%

KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models

KiVA:儿童启发的视觉类比用于测试大多模态模型

Eunice Yiu, Maan Qraitem, Anisa Noor Majhi, Charlie Wong, Yutong Bai, Shiry Ginosar, Alison Gopnik, Kate Saenko

机构 * University of California, Berkeley(加州大学伯克利分校) Boston University(波士顿大学) Google DeepMind(谷歌DeepMind) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KiVA通过4300个日常物体视觉转换测试大模型的类比推理能力,发现儿童和成人表现优于现有模型,尤其在复杂任务上存在显著差距。

Comments 10 pages. Project website: https://ey242.github.io/kiva.github.io/. Benchmark and code: https://github.com/ey242/KiVA

Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04324 2025-12-05 cs.CL cs.AI 73%

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

DAComp: 在全数据智能生命周期中跨领域评估数据代理

Fangyu Lei, Jinxiang Meng, Yiming Huang, Junjie Zhao, Yitong Zhang, Jianwen Luo, Xin Zou, Ruiyi Yang, Wenbo Shi, Yan Gao, Shizhu He, Zuo Wang, Qian Liu, Yang Wang, Ke Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 DAComp通过210个任务评估数据代理在数据工程与分析中的能力,揭示现有代理在复杂流程编排和开放性推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04871 2025-12-05 cs.AI cs.CL cs.LG 67%

STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions

STELLA: 通过语义抽象引导大型语言模型进行时间序列预测

Junjie Fan, Hongye Zhao, Linduo Wei, Jiayu Rao, Guijia Li, Jiaxin Yuan, Wenqi Xu, Yong Qi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STELLA通过动态语义抽象机制,提升大型语言模型在时间序列预测中的表现,实现更精准的长期和短期预测。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04308 2025-12-05 cs.RO 67%

ResponsibleRobotBench: Benchmarking Responsible Robot Manipulation using Multi-modal Large Language Models

ResponsibleRobotBench: 使用多模态大语言模型评估负责任的机器人操控

Lei Zhang, Ju Dong, Kaixin Bai, Minheng Ni, Zoltan-Csaba Marton, Zhaopeng Chen, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 ResponsibleRobotBench通过多模态大语言模型评估机器人操控的责任性,涵盖23个多阶段任务,强调安全性、泛化能力和物理可靠性。

Comments https://sites.google.com/view/responsible-robotbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04597 2025-12-05 cs.CV cs.AI cs.LG cs.RO 62%

When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering

机器人何时应说'我不知道':身体化问答中退避的基准测试

Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04125 2025-12-05 cs.LG 61%

ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

ASCIIBench: 评估基于语言模型的视觉文本理解

Kerry Luo, Michael Fu, Joshua Peguero, Husnain Malik, Anvay Patil, Joyce Lin, Megan Van Overborg, Ryan Sarmiento, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.LG

AI总结 ASCIIBench通过评估LLM生成ASCII艺术的性能,揭示了多模态表示的局限性,并推动了针对符号视觉模态的新方法发展。

Comments Accepted to The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025): LLM Evaluation Workshop & Multimodal Algorithmic Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04759 2025-12-05 cs.CL 57%

Challenging the Abilities of Large Language Models in Italian: a Community Initiative

挑战大型语言模型在意大利语中的能力:一项社区倡议

Malvina Nissim, Danilo Croce, Viviana Patti, Pierpaolo Basile, Giuseppe Attanasio, Elio Musacchio, Matteo Rinaldi, Federico Borazio, Maria Francis, Jacopo Gili, Daniel Scalena, Begoña Altuna, Ekhi Azurmendi, Valerio Basile, Luisa Bentivogli, Arianna Bisazza, Marianna Bolognesi, Dominique Brunato, Tommaso Caselli, Silvia Casola, Maria Cassese, Mauro Cettolo, Claudia Collacciani, Leonardo De Cosmo, Maria Pia Di Buono, Andrea Esuli, Julen Etxaniz, Chiara Ferrando, Alessia Fidelangeli, Simona Frenda, Achille Fusco, Marco Gaido, Andrea Galassi, Federico Galli, Luca Giordano, Mattia Goffetti, Itziar Gonzalez-Dios, Lorenzo Gregori, Giulia Grundler, Sandro Iannaccone, Chunyang Jiang, Moreno La Quatra, Francesca Lagioia, Soda Marem Lo, Marco Madeddu, Bernardo Magnini, Raffaele Manna, Fabio Mercorio, Paola Merlo, Arianna Muti, Vivi Nastase, Matteo Negri, Dario Onorati, Elena Palmieri, Sara Papi, Lucia Passaro, Giulia Pensa, Andrea Piergentili, Daniele Potertì, Giovanni Puccetti, Federico Ranaldi, Leonardo Ranaldi, Andrea Amelio Ravelli, Martina Rosola, Elena Sofia Ruzzetti, Giuseppe Samo, Andrea Santilli, Piera Santin, Gabriele Sarti, Giovanni Sartor, Beatrice Savoldi, Antonio Serino, Andrea Seveso, Lucia Siciliani, Paolo Torroni, Rossella Varvara, Andrea Zaninello, Asya Zanollo, Fabio Massimo Zanzotto, Kamyar Zeinalipour, Andrea Zugarini

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04728 2025-12-05 cs.CV cs.AI 57%

Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild

测量未言之: 一种解耦模型和基准用于野外心理分析

Yigui Feng, Qinglin Wang, Haotian Mo, Yang Liu, Ke Liu, Gencheng Liu, Xinhai Chen, Siqi Shen, Songzhu Mei, Jie Liu

机构 * College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MIND模型和PRISM基准,通过解耦算法和专家标注数据提升野外对话心理分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16139 2025-12-05 cs.AI 57%

Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints

通过几何投影参考约束的多维评分导向奖励模型学习

Yongnan Jin, Xurui Li, Feng Cao, Liucun Gao, Juanjuan Yao

机构 * Shanghai Mingpin Medical Data Technology Co., Ltd.(上海明品医疗数据技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过几何投影参考约束的多维评分导向奖励模型学习,提升医疗领域大型语言模型的性能和对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04545 2025-12-05 cs.CL 57%

EvoEdit: Lifelong Free-Text Knowledge Editing through Latent Perturbation Augmentation and Knowledge-driven Parameter Fusion

EvoEdit: 通过潜在扰动增强和知识驱动参数融合实现终身自由文本知识编辑

Pengfei Cao, Zeao Ji, Daojian Zeng, Jun Zhao, Kang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EvoEdit通过潜在扰动增强和知识驱动参数融合,实现终身自由文本知识编辑,有效解决知识更新与遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04350 2025-12-05 cs.CL 57%

ClusterFusion: Hybrid Clustering with Embedding Guidance and LLM Adaptation

ClusterFusion: 嵌入引导的混合聚类与LLM适应

Yiming Xu, Yuan Yuan, Vijay Viswanathan, Graham Neubig

机构 * Adobe(Adobe公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ClusterFusion通过将LLM作为聚类核心,结合嵌入引导方法,实现领域知识与用户偏好的整合,提升文本聚类在标准任务和特定领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04673 2025-12-05 cs.SE 50%

Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models

跨任务基准测试与通用型和代码特定大型语言模型的评估

Gunjan Das, Paheli Bhattacharya, Rishabh Gupta

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了通用和代码特定大型语言模型在跨任务基准测试中的表现,发现代码优化模型在推理和语法精确度上优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 8 篇

2511.23002 2025-12-05 cs.CV 75%

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo: 向自进化式照片编辑代理迈进:协同编辑器-评估器优化

Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文元)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 JarvisEvo通过协同编辑器-评估器优化,实现自进化式照片编辑代理,提升编辑质量和内容保真度。

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08003 2025-12-05 cs.CV cs.AI 74%

Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning

锐眼与记忆:视频大语言模型的信息感知视觉标记修剪方法

Jialong Qin, Xin Zou, Di Lu, Yibo Yan, Xuming Hu

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 SharpV通过自适应视觉标记修剪和键值缓存修剪,提升视频大语言模型的效率与可靠性,是首个无需暴露注意力分数的两阶段修剪框架。

Comments The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26) Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04518 2025-12-05 cs.CL cs.AI 62%

UW-BioNLP at ChemoTimelines 2025: Thinking, Fine-Tuning, and Dictionary-Enhanced LLM Systems for Chemotherapy Timeline Extraction

UW-BioNLP在ChemoTimelines 2025中的表现:基于思考、微调和词典增强的LLM系统用于化疗时间线提取

Tianmai M. Zhang, Zhaoyi Sun, Sihang Zeng, Chenxi Li, Neil F. Abernethy, Barbara D. Lam, Fei Xia, Meliha Yetisgen

机构 * University of Washington(华盛顿大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 UW-BioNLP通过思考、微调和词典增强LLM方法,在ChemoTimelines 2025中实现了最佳性能,提升了化疗时间线提取的准确性。

Comments To be published in Proceedings of the 7th Clinical Natural Language Processing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17127 2025-12-05 cs.CL cs.AI cs.DC 62%

Training Foundation Models on a Full-Stack AMD Platform: Compute, Networking, and System Design

在全栈AMD平台上训练基础模型:计算、网络和系统设计

Quentin Anthony, Yury Tokpanov, Skyler Szot, Srivatsan Rajagopal, Praneeth Medepalli, Anna Golubeva, Vasu Shyam, Robert Washbourne, Rishi Iyer, Ansh Chaurasia, Tomas Figliolia, Xiao Yang, Abhinav Sarje, Drew Thorstensen, Amartey Pearson, Zack Grossbart, Jason van Patten, Emad Barsoum, Zhenyu Gu, Yao Fu, Beren Millidge

机构 * IBM

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了在AMD全栈平台上训练大规模混合专家模型的方法,展示了ZAYA1模型在预训练中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04822 2025-12-05 cs.AI 57%

Enabling Ethical AI: A case study in using Ontological Context for Justified Agentic AI Decisions

实现道德AI:利用本体上下文进行合理化智能体决策的案例研究

Liam McGee, James Harvey, Lucy Cull, Andreas Vermeulen, Bart-Floris Visscher, Malvika Sharan

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种协作人机AI方法,通过本体上下文构建可检查语义层,提升智能体决策的合理性和透明度。

Comments 24 pages including references, with 6 images and 2 tables. Appendices, supporting data and additional reference provided from page 25 to 117

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI 57%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04513 2025-12-05 cs.AI 57%

BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models

BiTAgent: 一种面向任务的模块化框架,用于多模态大语言模型与世界模型之间的双向耦合

Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 BiTAgent通过双向耦合多模态大语言模型与世界模型,实现任务感知的动态联合学习,提升多任务和跨环境的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏