arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-24 至 2025-11-24 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 1 篇

2509.24068 2025-11-24 cs.LG cs.AI 62%

A Small Math Model: Recasting Strategy Choice Theory in an LLM-Inspired Architecture

一个小数学模型:在LLM启发式架构中重构策略选择理论

Roussel Rahman, Jeff Shrager

机构 * Stanford University(斯坦福大学) Bennu Climate, Inc.(Bennu气候公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM架构的小数学模型,重构策略选择理论,扩展其功能并研究数学推理中的数字特征与关系。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2511.17473 2025-11-24 cs.CL cs.AI cs.LG 67%

Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards

基于掩码与重排的自监督学习用于可验证奖励的强化学习

Zhen Wang, Zhifeng Gao, Guolin Ke

机构 * DP Technology(DP技术)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13290 2025-11-24 cs.PL cs.AI 57%

Towards Formal Verification of LLM-Generated Code from Natural Language Prompts

向自然语言提示生成的LLM代码形式验证

Aaron Councilman, David Jiahao Fu, Aryan Gupta, Chengxiao Wang, David Grove, Yu-Xiong Wang, Vikram Adve

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 Astrogator通过形式查询语言和知识库实现对LLM生成代码的正确性验证,验证准确率达83%。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 1 篇

2509.21651 2025-11-24 cs.AI 57%

Can AI Perceive Physical Danger and Intervene?

AI能否感知物理危险并干预?

Abhishek Jindal, Dmitry Kalashnikov, R. Alex Hofer, Oscar Chang, Divya Garikapati, Anirudha Majumdar, Pierre Sermanet, Vikas Sindhwani

机构 * Google DeepMind Robotics(谷歌深Mind机器人技术)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于评估具身体验AI系统物理安全性的基准测试方法,通过生成逼真图像和视频来测试模型对安全风险的理解和干预能力,并开发了训练后范式以提升模型的安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 15 篇

2511.17335 2025-11-24 cs.RO cs.CL cs.CV cs.SD eess.AS 79%

Robot Confirmation Generation and Action Planning Using Long-context Q-Former Integrated with Multimodal LLM

基于长上下文Q-Former与多模态大语言模型的机器人确认生成与动作规划

Chiori Hori, Yoshiki Masuyama, Siddarth Jain, Radu Corcodel, Devesh Jha, Diego Romeres, Jonathan Le Roux

机构 * Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL),马萨诸塞州剑桥市)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 本文提出基于长上下文Q-former与多模态大语言模型的机器人确认生成与动作规划方法,通过整合视频上下文信息提升动作规划性能。

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10568 2025-11-24 cs.AI 79%

Observer-Aware Probabilistic Planning Under Partial Observability

感知-aware 的概率规划在部分可观测性下

Salomé Lepers, Vincent Thomas, Olivier Buffet

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于观察-aware 马尔可夫决策过程的框架,用于处理部分可观测性下的规划问题,通过优化信息传输来提升可解释性和可预测性。

Comments 23 pages, 13 figures. Complete version of AAMAS 2025 extended abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17150 2025-11-24 cs.CV 78%

DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving

DiffRefiner: 通过扩散细化与语义交互实现从粗到细的轨迹规划用于端到端自动驾驶

Liuhan Yin, Runkun Ju, Guodong Guo, Erkang Cheng

机构 * Nullmax

专题命中 规划推理 :planning(title,abstract)

AI总结 DiffRefiner通过两阶段框架结合扩散细化与语义交互,实现更精确的端到端自动驾驶轨迹规划,取得新纪录。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17094 2025-11-24 cs.CV 78%

Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models

稀疏推理已足够:基于生物启发的视频异常检测大预训练模型框架

He Huang, Zixuan Hu, Dongxiao Li, Yao Xiao, Ling-Yu Duan

机构 * School of Computer Science Peking University(北京大学计算机科学学院)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 ReCoVAD通过生物启发的双通路框架实现视频异常检测,利用稀疏推理降低计算成本,取得最佳无训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16972 2025-11-24 cs.LG 77%

ToC: Tree-of-Claims Search with Multi-Agent Language Models

基于多智能体语言模型的树状主张搜索

Shuyang Yu, Jianan Liang, Hui Hu

机构 * AIGROW

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG

AI总结 ToC通过结合多智能体系统和MCTS,提升专利主张优化的准确性和法律稳健性。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17161 2025-11-24 cs.CL cs.AI 62%

The PLLuM Instruction Corpus

PLLuM指令语料库

Piotr Pęzik, Filip Żarnecki, Konrad Kaczyński, Anna Cichosz, Zuzanna Deckert, Monika Garnys, Izabela Grabarczyk, Wojciech Janowski, Sylwia Karasińska, Aleksandra Kujawiak, Piotr Misztela, Maria Szymańska, Karolina Walkusz, Igor Siek, Maciej Chrabąszcz, Anna Kołos, Agnieszka Karlińska, Karolina Seweryn, Aleksandra Krasnodębska, Paula Betscher, Zofia Cieślińska, Katarzyna Kowol, Artur Wilczek, Maciej Trzciński, Katarzyna Dziewulska, Roman Roszko, Tomasz Bernaś, Jurgita Vaičenonienė, Danuta Roszko, Paweł Levchuk, Paweł Kowalski, Irena Prawdzic-Jankowska, Marek Kozłowski, Sławomir Dadas, Rafał Poświata, Alina Wróblewska, Katarzyna Krasnowska-Kieraś, Maciej Ogrodniczuk, Michał Rudolf, Piotr Rybak, Karolina Saputa, Joanna Wołoszyn, Marcin Oleksy, Bartłomiej Koptyra, Teddy Ferdinan, Stanisław Woźniak, Maciej Piasecki, Paweł Walkowiak, Konrad Wojtasik, Arkadiusz Janz, Przemysław Kazienko, Julia Moska, Jan Kocoń

机构 * University of Lodz(卢兹大学) NASK National Research Institute(国家研究 institute) Institute of Slavic Studies PAS(波兰科学院斯拉夫研究所) National Information Processing Institute(国家信息处理研究所) Institute of Computer Science PAS(波兰科学院计算机科学研究所) Wroclaw Tech(沃拉日县技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 PLLuM项目构建了首个指令语料库,用于微调大语言模型,分析人工与合成指令数据对语言适应的影响,并发布首个代表性子集供其他模型开发参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17256 2025-11-24 cs.CY cs.CL 57%

Cross-cultural value alignment frameworks for responsible AI governance: Evidence from China-West comparative analysis

跨文化价值观对齐框架用于负责任的AI治理:来自中西方比较分析的证据

Haijiang Liu, Jinguang Gu, Xun Wu, Daniel Hershcovich, Qiaoling Xiao

机构 * Wuhan University of Science and Technology(武汉理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Copenhagen(哥本哈根大学) WUST-Madrid Complutense Institute(武汉理工大学-马德里康普顿斯研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出多层审计平台,评估中西方LLM跨文化价值观对齐,发现中国模型在多语言优化上更优,而西方模型存在美国偏见,Mistral系列在跨文化对齐上表现突出。

Comments Presented on Academic Conference "Technology for Good: Driving Social Impact" (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17225 2025-11-24 cs.RO cs.AI cs.CV 57%

TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making

TP-MDDN:任务优先的多需求驱动导航与自主决策

Shanshan Li, Da Huang, Yu He, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新机构)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 TP-MDDN通过引入任务优先的多需求驱动导航与自主决策系统,提升复杂任务下的导航性能与环境理解能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16997 2025-11-24 cs.AI 57%

MirrorMind: Empowering OmniScientist with the Expert Perspectives and Collective Knowledge of Human Scientists

MirrorMind: 通过人类科学家的专家视角和集体知识赋能多学科科学家

Qingbin Zeng, Bingbing Fan, Zhiyu Chen, Sijian Ren, Zhilun Zhou, Xuhua Zhang, Yuanyi Zhen, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学) Zhongguancun Academy(中关村学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MirrorMind通过整合个体认知与集体知识,实现多学科科学家的智能推理与协作。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16916 2025-11-24 cs.AI 57%

Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving

混合差分奖励:结合时序差分和动作梯度用于高效合作驾驶多智能体强化学习

Ye Han, Lijun Zhang, Dejian Meng, Zhuang Zhang

机构 * School of Automotive Studies, Tongji University(交通学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出混合差分奖励机制,结合时序差分和动作梯度,提升多智能体协同驾驶的收敛速度和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07693 2025-11-24 cs.CY cs.AI 57%

AI-driven Personalized Privacy Assistants: a Systematic Literature Review

基于人工智能的个性化隐私助手:系统文献综述

Victor Morel, Leonardo Iwaya, Simone Fischer-Hübner

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Department of Mathematics(数学系) Computer Science, Faculty of Health, Science(计算机科学,健康、科学学院) Technology, Karlstad University(技术,卡尔斯塔德大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过系统文献综述,对基于人工智能的个性化隐私助手进行了全面分类和分析,揭示了现有研究的空白和未来发展方向。

Comments Submitted to IEEE Access

Journal ref IEEE Access, vol. 13, pp. 160982-161002, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11393 2025-11-24 cs.SE cs.AI cs.CR cs.MA 57%

LLM-Agent-UMF: LLM-based Agent Unified Modeling Framework for Seamless Design of Multi Active/Passive Core-Agent Architectures

LLM-Agent-UMF: 基于大语言模型的代理统一建模框架,用于无缝设计多主动/被动核心代理架构

Amine Ben Hassouna, Hana Chaari, Ines Belhaj

机构 * Mediterranean Institute of Technology(地中海技术研究所) South Mediterranean University(南地中海大学) National School of Computer Science(国家计算机科学学校) University of Manouba(曼努巴大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LLM-Agent-UMF提出了一种基于大语言模型的代理统一建模框架,用于设计多主动/被动核心代理架构,解决了现有架构的模块化和术语不一致问题。

Comments 39 pages, 19 figures, 3 tables. Published in Information Fusion, Volume 127, March 2026, 103865. Part of the special issue "Data Fusion Approaches in Data-Centric AI for Developing Trustworthy AI Systems"

Journal ref Information Fusion 127 (2026) 103865

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17496 2025-11-24 cs.RO cs.MA 50%

MDG: Masked Denoising Generation for Multi-Agent Behavior Modeling in Traffic Environments

MDG:面向交通环境多智能体行为建模的遮蔽去噪生成

Zhiyu Huang, Zewei Zhou, Tianhui Cai, Yun Zhang, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 规划推理 :planning(abstract)

AI总结 MDG通过遮蔽去噪生成方法,实现高效可控的多智能体轨迹生成,适用于自动驾驶和交通模拟中的行为建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16900 2025-11-24 eess.SY cs.SY 50%

When Motion Learns to Listen: Diffusion-Prior Lyapunov Actor-Critic Framework with LLM Guidance for Stable and Robust AUV Control in Underwater Tasks

当运动学会倾听:带有LLM引导的扩散先验Lyapunov动作-批评者框架用于水下任务中稳定和鲁棒的AUV控制

Jingzehua Xu, Weiyi Liu, Weihang Zhang, Zhuofan Xi, Guanwen Xie, Shuai Zhang, Yi Li

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种结合扩散模型、Lyapunov批评者和LLM的框架,用于提升水下机器人控制的稳定性与鲁棒性,通过生成-过滤-优化机制实现高效探索和多目标优化。

Comments This paper is currently under review and does not represent the final version. Jingzehua Xu, Weiyi Liu and Weihang Zhang are co-first authors of this paper, with Zhuofan Xi as the second author

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14004 2025-11-24 cs.RO 50%

Searching in Space and Time: Unified Memory-Action Loops for Open-World Object Retrieval

在空间和时间中搜索:统一的记忆-动作循环用于开放世界物体检索

Taijing Chen, Sateesh Kumar, Junhong Xu, Georgios Pavlakos, Joydeep Biswas, Roberto Martín-Martín

机构 * Department of Computer Science, The University of Texas at Austin(计算机科学系,德克萨斯大学奥斯汀分校)

专题命中 规划推理 :reasoning(abstract)

AI总结 STAR框架通过统一记忆查询和具身动作,提升开放世界中时空物体检索的效率与准确性。

Comments https://amrl.cs.utexas.edu/STAR/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2506.08708 2025-11-24 cs.RO cs.AI cs.CV 85%

PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly

PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准

Liang Ma, Jiajun Wen, Min Lin, Rongtao Xu, Xiwen Liang, Bingqian Lin, Jun Ma, Yongxin Wang, Ziming Wei, Haokun Lin, Mingfei Han, Meng Cao, Bokui Chen, Ivan Laptev, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Spatialtemporal AI(时空人工智能) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17308 2025-11-24 cs.CV 78%

SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion

SpatialGeo:通过几何-语义融合提升多模态大语言模型的空间推理能力

Jiajie Guo, Qingpeng Zhu, Jin Zeng, Xiaolong Wu, Changyong He, Weida Wang

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SpatialGeo通过几何-语义融合提升多模态大语言模型的空间推理能力,实验表明在空间推理任务中准确率提升8.0%且内存消耗减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16825 2025-11-24 cs.CV cs.AI 57%

WorldGen: From Text to Traversable and Interactive 3D Worlds

WorldGen: 从文本到可遍历和交互的3D世界

Dilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn, Chuhang Zou, Xiaoyu Xiang, Yu-Ying Yeh, Di Liu, Zixuan Huang, Thu Nguyen-Phuoc, Yuchen Fan, Sergiu Oprea, Ziyan Wang, Roman Shapovalov, Nikolaos Sarafianos, Thibault Groueix, Antoine Toisoul, Prithviraj Dhar, Xiao Chu, Minghao Chen, Geon Yeong Park, Mahima Gupta, Yassir Azziz, Rakesh Ranjan, Andrea Vedaldi

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 WorldGen通过结合LLM、程序生成和扩散模型,实现从文本到可交互3D世界的自动创建,提升虚拟空间的生成效率与表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09878 2025-11-24 cs.CV cs.AI cs.RO 57%

CleverDistiller: Simple and Spatially Consistent Cross-modal Distillation

CleverDistiller: 简单且空间一致的跨模态知识蒸馏

Hariprasath Govindarajan, Maciej K. Wozniak, Marvin Klingner, Camille Maurice, B Ravi Kiran, Senthil Yogamani

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CleverDistiller通过简单有效的跨模态知识蒸馏方法,在自动驾驶任务中实现语义分割和3D目标检测的高性能表现。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2505.12396 2025-11-24 cs.IR 85%

LLM-CoT Enhanced Graph Neural Recommendation with Harmonized Group Policy Optimization

基于协同群体策略优化的LLM-CoT增强图神经推荐

Hailong Luo, Bin Wu, Hongyong Jia, Qingqing Zhu, Lianlei Shan

专题命中 测试时计算 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 LGHRec通过结合LLM的CoT推理能力与协同群体策略优化,提升图神经推荐系统的信息密度和对比学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 83%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16951 2025-11-24 cs.CV 50%

FingerCap: Fine-grained Finger-level Hand Motion Captioning

FingerCap:细粒度指尖级手部动作描述

Xin Shen, Rui Zhu, Lei Shen, Xinyu Wang, Kaihao Zhang, Tianqing Zhu, Shuchen Wu, Chenxi Miao, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang, Xin Yu

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Nanjing University(南京大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Australian National University(澳大利亚国立大学) City University of Macau(澳门城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 FingerCap通过FiGOP技术提升细粒度手部动作描述的准确性,解决视频大语言模型在指尖运动识别中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 6 篇

2511.17027 2025-11-24 cs.SE 89%

ReVul-CoT: Towards Effective Software Vulnerability Assessment with Retrieval-Augmented Generation and Chain-of-Thought Prompting

ReVul-CoT:通过检索增强生成与链式推理提示实现有效的软件漏洞评估

Zhijie Chen, Xiang Chen, Ziming Li, Jiacheng Xue, Chaoyang Gao

专题命中 复杂问题求解 :chain-of-thought(title,abstract);CoT(title,abstract);reasoning(abstract)

AI总结 ReVul-CoT通过整合检索增强生成与链式推理提示,提升软件漏洞评估的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV 82%

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16837 2025-11-24 cs.AI cs.CL 81%

Cognitive BASIC: An In-Model Interpreted Reasoning Language for LLMs

认知BASIC:一种用于大语言模型的内部解释推理语言

Oliver Kramer

机构 * Computational Intelligence Group University of Oldenburg(奥尔登堡大学计算智能组)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Cognitive BASIC通过简单命令实现LLM内部透明推理,展示了多步骤推理和矛盾解决能力。

Comments 6 pages, Submitted to ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17198 2025-11-24 cs.AI cs.CV 57%

Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism

通过层次化任务抽象机制设计领域专用代理

Kaiyu Li, Jiayu Wang, Zhi Wang, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分公司)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文提出层次化任务抽象机制,设计领域专用代理EarthAgent,通过任务结构对齐提升复杂地理空间分析的规划能力。

Comments Page: https://earth-insights.github.io/EarthAgent

详情

展开后加载摘要…

URL PDF HTML 收藏