arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 224 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2601.05839 2026-01-21 cs.CV 50%

GeoSurDepth: Harnessing Foundation Model for Spatial Geometry Consistency-Oriented Self-Supervised Surround-View Depth Estimation

GeoSurDepth:利用基础模型实现以空间几何一致性为导向的自监督周围视图深度估计

Weimin Liu, Wenjun Wang, Joshua H. Meng

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(1 智能绿色车辆与移动国家重点实验室,车辆与移动学院,清华大学,北京100084,中国) California PATH, University of California, Berkeley, CA, United States(2 加州PATH,加州大学伯克利分校,加州,美国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GeoSurDepth通过利用基础模型和几何一致性,实现了更鲁棒的自监督周围视图深度估计,验证了其在自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12766 2026-01-21 cs.CV cs.SY eess.SY 50%

Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration

空间视觉导航:具有显式空间感知和探索的零样本视觉-语言导航

Lu Yue, Yue Fan, Shiwei Lian, Yu Zhao, Jiaxin Yu, Liang Xie, Feitian Zhang

机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院,以及湍流与复杂系统国家重点实验室,北京大学) Defense Innovation Institute, Academy of Military Sciences, Beijing(国防科技创新研究院,军事科学院,北京) Tianjin Artificial Intelligence Innovation Center, Tianjin(天津人工智能创新中心,天津) Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能学院,哈尔滨工业大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Spatial-VLN通过增强空间感知和探索机制,提升零样本视觉-语言导航在复杂环境中的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13947 2026-01-21 eess.IV cs.CV 50%

Real-Time Reconstruction of 3D Bone Models via Very-Low-Dose Protocols

通过极低剂量协议实时重建3D骨模型

Yiqun Lin, Haoran Sun, Yongqing Li, Rabia Aslam, Lung Fung Tse, Tiange Cheng, Chun Sing Chui, Wing Fung Yau, Victorine R. Le Meur, Meruyert Amangeldy, Kiho Cho, Yinyu Ye, James Zou, Wei Zhao, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学电子与计算机工程系) Koln 3D Technology (Medical) Limited, Hong Kong SAR(香港特别行政区科隆3D技术(医疗)有限公司) Department of Physics, Beihang University, Beijing, China(北京航空航天大学物理系) Union Hospital, Hong Kong SAR(香港特别行政区联合医院) Dental Materials Science, Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong, Hong Kong SAR(香港大学牙科学院牙体材料科学系) Department of Orthopaedics and Traumatology, The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学骨科及创伤外科学系) Department of Management Science and Engineering, Stanford University, Stanford, CA, USA(斯坦福大学管理科学与工程系) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(斯坦福大学生物医学数据科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本研究提出SSR-KD框架,通过双平面X光在30秒内快速重建高精度3D骨模型,降低辐射暴露并提升术中应用的实用性。

Comments Accepted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16475 2026-01-21 cs.HC cs.RO 50%

LLM-Glasses: GenAI-driven Glasses with Haptic Feedback for Navigation of Visually Impaired People

LLM-Glasses: 基于生成式AI的具有触觉反馈的眼镜用于盲人导航

Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Yara Mahmoud, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LLM-Glasses通过生成式AI和触觉反馈为视障人士提供导航支持,实验显示其在不同障碍物环境下具有较高的导航准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 8 篇

2512.24574 2026-01-21 cs.CL cs.AI cs.LG 87%

Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time

在测试时理解并引导推理模型的认知行为

Zhenyu Zhang, Xiaoxia Wu, Zhongzhu Zhou, Qingyang Wu, Yineng Zhang, Pragaash Ponnusamy, Harikaran Subbaraj, Jue Wang, Shuaiwen Leon Song, Ben Athiwaratkun

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Together AI University of Sydney(悉尼大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01562 2026-01-21 cs.AI 83%

Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement

Logics-STEM: 通过故障驱动的微调和文档知识增强赋能大语言模型推理

Mingyu Xu, Cheng Fang, Keyue Jiang, Yuqian Zheng, Yanghua Xiao, Baojian Zhou, Qifang Zhao, Suhang Zheng, Xiuwen Zhu, Jiyang Tang, Yongchi Zhao, Yijia Luo, Zhiqi Bai, Yuchi Xu, Wenbo Su, Wei Wang, Bing Zhao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Shanghai Key Laboratory of Data Science, Fudan University(上海数据科学国家重点实验室,复旦大学) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Logics-STEM通过故障驱动微调和文档知识增强,提升大语言模型在STEM领域的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 70%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 测试时计算 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07478 2026-01-21 cs.CL 57%

Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization

通过渐进奖励塑造与基于价值的采样策略优化增强代理强化学习

Jianghao Su, Xia Zeng, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Xi’an Jiaotong University(西安交通大学) Fliggy Alibaba(阿里飞猪)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PRS和VSPO技术,通过渐进奖励塑造和基于价值的采样策略优化,提升代理强化学习在复杂推理任务中的性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12812 2026-01-21 cs.CL 57%

Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?

临床问答系统真的需要专门的医学微调吗?

Sushant Kumar Ray, Gautam Siddharth Kashyap, Sahil Tripathi, Nipun Joshi, Vijay Govindarajan, Rafiq Ali, Jiechao Gao, Usman Naseem

机构 * University of Delhi(德里大学) Jamia Hamdard(贾迈亚哈马尔德大学) Cornell University(康奈尔大学) Expedia Group(Expedia集团) DSEU-Okhla Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 MEDASSESS-X通过推理时对齐技术,无需领域微调即可提升临床问答系统性能,解决专门化谬误问题。

Comments Accepted at EACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 57%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13015 2026-01-21 cs.SE 50%

MeltRTL: Multi-Expert LLMs with Inference-time Intervention for RTL Code Generation

MeltRTL: 多专家LLMs结合推理时干预用于RTL代码生成

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 测试时计算 :reasoning(abstract)

AI总结 MeltRTL通过多专家注意力和推理时干预提升LLM生成RTL代码的准确性和效率,实现96%的可综合性和60%的功能正确性,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04726 2026-01-21 cs.IR 50%

Hard Negative Sampling via Large Language Models for Recommendation

通过大型语言模型进行推荐系统中的困难负样本采样

Chu Zhao, Enneng Yang, Yuting Liu, Jianzhe Zhao, Guibing Guo

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出HNLMRec,利用大型语言模型生成语义相关的困难负样本,以提升推荐系统的性能和泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 31 篇

2508.03140 2026-01-21 cs.CL cs.AI 90%

RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior

RCP-Merging: 通过将推理能力作为先验来融合长链式思维模型与领域特定模型

Junyao Yang, Jianwei Wang, Huiping Zhuang, Cen Chen, Ziqian Zeng

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 RCP-Merging通过将推理能力作为先验,融合长链式思维模型与领域特定模型,提升领域任务性能9.5%-9.2%的同时保持原始推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05134 2026-01-21 cs.AI 85%

Structuring Reasoning for Complex Rules Beyond Flat Representations

为复杂规则构建推理结构超越平面表示

Zhihao Yang, Ancheng Xu, Jingpeng Li, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Longze Chen, Ahmadreza Argha, Hamid Alinejad-Rokny, Minghuan Tan, Yujun Cai, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院) University of Queensland(昆士兰大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出DAT框架,通过分阶段处理复杂规则,提升LLM在复杂规则任务中的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12720 2026-01-21 cs.AI 83%

Teaching Large Reasoning Models Effective Reflection

教导大型推理模型有效的反思

Hanbin Wang, Jingwei Song, Jinpeng Li, Qi Zhu, Fei Mi, Ganqu Cui, Yasheng Wang, Lifeng Shang

机构 * Peking University(北京大学) The University of Hong Kong(香港大学) Huawei Technologies(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出SCFT和RLERR方法,通过自我批评和强化学习提升大型推理模型的反思能力,实验表明在AIME2024和AIME2025基准上效果优于现有方法。

Comments 14 pages (including appendix), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09269 2026-01-21 cs.AI 83%

RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering

RISER: 通过潜意识推理技能协调实现自适应激活引导

Wencheng Ye, Xiaoyang Yuan, Yi Bin, Pengpeng Zeng, Hengyu Jin, Liang Peng, Heng Tao Shen

机构 * Tongji University(同济大学) Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 RISER通过构建可重用的推理向量库和轻量级路由器,实现自适应激活引导,提升LLM推理的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18260 2026-01-21 cs.CL 83%

MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains

MIRAGE: 通过并行图检索增强推理链实现测试时扩展

Kaiwen Wei, Rui Shan, Dongsheng Zou, Jianzhong Yang, Bi Zhao, Junnan Zhu, Jiang Zhong

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 MIRAGE通过并行图检索增强推理链实现测试时扩展,提升医疗问答任务的准确性和可追溯性。

Comments 10 pages, 8 figures (including tables), plus appendix. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 81%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13752 2026-01-21 cs.AI cs.CL 81%

Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering

寻找RELIFF:通过信念工程塑造推理行为而无需推理监督

Chak Tou Leong, Dingwei Chen, Heming Xia, Qingyu Yin, Sunbowen Lee, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) WUST(华中科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RELIFF,通过信念工程无需推理监督塑造大型推理模型的行为,实验表明其在效率和忠实度任务上表现优异。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14127 2026-01-21 cs.CV cs.CL 79%

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09014 2026-01-21 cs.CL 79%

LitE-SQL: A Lightweight and Efficient Text-to-SQL Framework with Vector-based Schema Linking and Execution-Guided Self-Correction

LitE-SQL: 一种轻量高效的文本到SQL框架,具备基于向量的模式链接和执行引导的自我纠正

Shengmin Piao, Jieun Lee, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL

AI总结 LitE-SQL通过轻量高效的框架和基于向量的模式链接技术,实现高准确率的文本到SQL生成,无需多候选采样即可执行引导自我纠正,适用于隐私敏感和资源受限场景。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18329 2026-01-21 cs.CL 79%

LIR$^3$AG: A Lightweight Rerank Reasoning Strategy Framework for Retrieval-Augmented Generation

LIR$^3$AG:一种轻量级重排序推理策略框架用于检索增强生成

Guo Chen, Junjie Huang, Huaijin Xie, Fei Sun, Tao Jia

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 LIR$^3$AG通过重构检索证据为连贯推理链,使非推理模型在RAG中实现性能超越,减少计算开销并提升F1分数。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13607 2026-01-21 cs.CR 78%

When Reasoning Leaks Membership: Membership Inference Attack on Black-box Large Reasoning Models

当推理泄露成员身份:对黑盒大推理模型的成员推断攻击

Ruihan Hu, Yu-Ming Shang, Wei Luo, Ye Tao, Xi Zhang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对黑盒大推理模型的成员推断攻击,通过分析推理轨迹的语义潜在空间构建攻击框架,揭示其隐私风险及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14041 2026-01-21 cs.CL cs.AI 73%

Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants

推动扩散语言模型及其变体未来发展的十大开放挑战

Yunhe Wang, Kai Han, Huiling Zhen, Yuchuan Tian, Hanting Chen, Yongbing Huang, Yufei Cui, Yingte Shu, Shan Gao, Ismail Elezi, Roy Vaughan Miles, Songcen Xu, Feng Wen, Chao Xu, Sinan Zeng, Dacheng Tao

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出推动扩散语言模型及其变体发展的十大挑战,并提出以多尺度标记化、主动遮罩和潜在思考为核心的四支柱战略路线图,旨在突破因果瓶颈,实现复杂结构推理和多模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13228 2026-01-21 cs.CL cs.AI 73%

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

自回归模型在任意阶生成中与扩散模型相媲美

Tianqi Du, Lizhe Fang, Weijie Yang, Chenheng Zhang, Zeming Wei, Yifei Wang, Yisen Wang

机构 * National Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(国家关键人工智能实验室,智能科学与技术学院,北京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学) Amazon AGI SF Lab(亚马逊人工智能SF实验室) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出A3框架,通过自回归建模实现任意阶生成,超越传统扩散模型,提升语言建模的灵活性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05014 2026-01-21 cs.AI cs.LG 73%

Think Then Embed: Generative Context Improves Multimodal Embedding

思考后再嵌入:生成性上下文提升多模态嵌入

Xuanming Cui, Jianpeng Cheng, Hong-you Chen, Satya Narayan Shukla, Abhijeet Awasthi, Xichen Pan, Chaitanya Ahuja, Shlok Kumar Mishra, Yonghuan Yang, Jun Xiao, Qi Guo, Ser-Nam Lim, Aashu Singh, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Think-Then-Embed框架,通过生成性推理提升多模态嵌入性能,实现更高效的复杂指令处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13383 2026-01-21 cs.AI 70%

A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge

基于大语言模型的轻量模块化框架:用于AgentForge中的设计、实现与应用

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AgentForge是一种基于大语言模型的轻量模块化框架,通过可组合的技能抽象、统一的LLM后端接口和声明性配置系统,提升自主代理的开发效率和灵活性。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12762 2026-01-21 cs.SE cs.AI 70%

Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction

通过环境交互教授LLMs学习工具尝试与执行

Xingjie Gao, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Shuo Wang, Zulong Chen, Chen Qian, Ge Yu, Yu Gu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Alibaba Group(阿里巴巴集团) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 ToolMaster通过环境交互主动学习工具使用,提升LLMs在新工具上的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01724 2026-01-21 cs.AI 70%

ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection

ReflecSched: 通过LLM赋能的分层反思解决动态灵活作业车间调度问题

Shijie Cao, Yuan Yuan

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) Qingdao Research Institute(青岛研究院) Hangzhou Innovation Institute(杭州创新研究院) Zhongguancun Laboratory(中关村实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ReflecSched通过LLM赋能的分层反思机制,有效解决动态灵活作业车间调度问题,实现优于传统和学习方法的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 67%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏