arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2508.01724 2026-01-21 cs.AI 85%

ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection

ReflecSched: 通过LLM赋能的分层反思解决动态灵活作业车间调度问题

Shijie Cao, Yuan Yuan

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) Qingdao Research Institute(青岛研究院) Hangzhou Innovation Institute(杭州创新研究院) Zhongguancun Laboratory(中关村实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReflecSched通过LLM赋能的分层反思机制,有效解决动态灵活作业车间调度问题,实现优于传统和学习方法的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11528 2026-01-21 cs.DB cs.AI 85%

Knowledge Graph Construction for Stock Markets with LLM-Based Explainable Reasoning

基于大语言模型的可解释推理的股票市场知识图谱构建

Cheonsol Lee, Youngsang Jeong, Jeongyeol Shin, Huiju Kim, Jidong Kim

机构 * Hana Institute of Technology, Hana TI(hana技术研究所) TelePIX Co., Ltd.(telepix公司) Qraft Technologies(qraft技术公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的可解释推理方法,构建股票市场知识图谱以捕捉复杂关系,提升投资分析与决策支持能力。

Comments 6 pages, 3 figures, CIKM 2025 Workshop - Advances in Financial AI: Innovations, Risk, and Responsibility in the Era of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13096 2026-01-21 cs.RO cs.CV 85%

LLM-VLM Fusion Framework for Autonomous Maritime Port Inspection using a Heterogeneous UAV-USV System

基于异构无人机-水下机器人系统的LLM-VLM融合框架用于自主港口检测

Muhayy Ud Din, Waseem Akram, Ahsan B. Bakht, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心(KUCARS)) Khalifa University(卡利法大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于LLM和VLM的融合框架,利用异构无人机-水下机器人系统实现自主港口检测,通过符号规划与语义检测提升检测效率和安全性。

Comments submitted in AEJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14041 2026-01-21 cs.CL cs.AI 84%

Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants

推动扩散语言模型及其变体未来发展的十大开放挑战

Yunhe Wang, Kai Han, Huiling Zhen, Yuchuan Tian, Hanting Chen, Yongbing Huang, Yufei Cui, Yingte Shu, Shan Gao, Ismail Elezi, Roy Vaughan Miles, Songcen Xu, Feng Wen, Chao Xu, Sinan Zeng, Dacheng Tao

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出推动扩散语言模型及其变体发展的十大挑战,并提出以多尺度标记化、主动遮罩和潜在思考为核心的四支柱战略路线图,旨在突破因果瓶颈,实现复杂结构推理和多模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13717 2026-01-21 cs.CL cs.AI 84%

Simulated Ignorance Fails: A Systematic Study of LLM Behaviors on Forecasting Problems Before Model Knowledge Cutoff

模拟无知失败:在模型知识截止前的预测问题上的系统研究

Zehan Li, Yuxuan Wang, Ali El Lahib, Ying-Jieh Xia, Xinyu Pi

机构 * University of Chicago(芝加哥大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在模型知识截止前的预测问题中,模拟无知方法的局限性,发现其无法有效近似真实无知,且推理链推理和优化模型在抑制先前知识方面存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12269 2026-01-21 cs.CL cs.AI 84%

Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models

退火模拟增强语言模型的理论思维推理

Xucong Hu, Jian-Qiao Zhu

机构 * Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) Department of Psychology, The University of Hong Kong(香港大学心理学系)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 通过退火模拟提升自回归语言模型的理论思维推理能力,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13308 2026-01-21 cs.LG cs.AI cs.CL 83%

Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space

在黑暗中寻求:通过测试时实例级策略梯度进行潜在空间推理

Hengli Li, Chenxi Li, Tong Wu, Xuekai Zhu, Yuxuan Wang, Zhaoxin Yu, Eric Hanchen Jiang, Song-Chun Zhu, Zixia Jia, Ying Nian Wu, Zilong Zheng

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) NLCo Lab, Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院NLCo实验室) Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 LatentSeek通过测试时实例级策略梯度在潜在空间中提升LLM推理能力,展现高效且可扩展的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13243 2026-01-21 cs.LG 83%

A Comprehensive Evaluation of LLM Reasoning: From Single-Model to Multi-Agent Paradigms

大语言模型推理的全面评估:从单模型到多智能体范式

Yapeng Li, Jiakuo Yu, Zhixin Liu, Xinnan Liu, Jing Yu, Songze Li, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究全面评估了LLM推理范式,包括单模型和多智能体系统,通过新基准测试揭示了不同范式在成本与准确率之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12040 2026-01-21 cs.AI 83%

Partial Reasoning in Language Models: Search and Refinement Guided by Uncertainty

语言模型中的部分推理:由不确定性引导的搜索与细化

Murilo da Luz, Bruno Brandão, Luana Martins, Gustavo Oliveira, Bryan de Oliveira, Luckeciano Melo, Telma Soares

机构 * Advanced Knowledge Center for Immersive Technologies (AKCIT)(沉浸式技术高级知识中心) Federal University of Goiás, Brazil(巴西戈亚斯联邦大学) OATML, University of Oxford(牛津大学OATML)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 PREGU通过监控输出熵并在不确定时触发局部搜索,提升语言模型在多步骤推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06474 2026-01-21 cs.CV cs.AI 83%

SparseOccVLA: Bridging Occupancy and Vision-Language Models via Sparse Queries for Unified 4D Scene Understanding and Planning

SparseOccVLA: 通过稀疏查询弥合占用与视觉语言模型之间的鸿沟,实现统一的4D场景理解和规划

Chenxu Dang, Jie Wang, Guang Li, Zhiwen Hou, Zihan You, Hangjun Ye, Jie Ma, Long Chen, Yan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SparseOccVLA通过稀疏查询整合视觉语言模型与语义占用,实现统一的4D场景理解和规划,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10101 2026-01-21 cs.AI cs.CL 82%

Matrix as Plan: Structured Logical Reasoning with Feedback-Driven Replanning

矩阵作为计划:基于反馈驱动的重计划的结构化逻辑推理

Ke Chen, Jiandian Zeng, Zihao Peng, Guo Li, Guangxue Zhang, Tian Wang

机构 * Faculty of Arts and Sciences(艺术与科学学院) Beijing Normal University(北京师范大学) Institute of Artificial Intelligence and Future Networks(人工智能与未来网络研究所) Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education(教育部云-边智能协同大数据工程研究中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MatrixCoT通过引入矩阵基础计划和反馈驱动重计划机制,提升LLM在复杂符号推理任务中的鲁棒性和可解释性。

Comments 12 pages, 5 figures, 2 tables. Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12019 2026-01-21 cs.CL cs.AI 82%

Acting Flatterers via LLMs Sycophancy: Combating Clickbait with LLMs Opposing-Stance Reasoning

通过LLMs的趋炎附势行为进行煽动性行为:用LLMs的对立立场推理对抗软文

Chaowei Zhang, Xiansheng Luo, Zewei Zhang, Yi Zhu, Jipeng Qiang, Longwei Wang

机构 * Yangzhou University(扬州大学) Auburn University(亚伯拉罕大学) University of South Dakota(南达科他大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用LLMs的趋炎附势行为生成对立立场推理,以提升软文检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11658 2026-01-21 cs.CL cs.AI 82%

Towards AGI A Pragmatic Approach Towards Self Evolving Agent

迈向AGI:一种务实的自我进化代理方法

Indrajit Kar, Sammy Zonunpuia, Zonunfeli Ralte

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SLM(abstract)

AI总结 本文提出一种分层自我进化多代理框架,通过整合基础LLM、操作SLM代理、代码生成LLM和教师LLM,实现代理的持续适应与自我进化,展示了在不同任务难度下的进化优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02076 2026-01-21 cs.CL cs.AI 81%

Deferred Commitment Decoding for Diffusion Language Models

延迟承诺解码用于扩散语言模型

Yingte Shu, Yuchuan Tian, Chao Xu, Yunhe Wang, Hanting Chen

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出延迟承诺解码方法,通过基于不确定性的策略提升扩散语言模型解码质量和效率,实验显示在多个模型和基准测试中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20543 2026-01-21 cs.CL cs.AI 81%

The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts

狗追猫的猫让模型困惑:衡量语言模型何时放弃结构分析而采用捷径

Sangmitra Madhusudan, Kaige Chen, Ali Emami

机构 * Emory University(埃默里大学) Brock University(布罗克大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CenterBench数据集,用于衡量语言模型在处理中心嵌套句子时何时从结构分析转向语义捷径,揭示模型在复杂性增加时性能差距扩大及人类与模型的差异。

Comments 9 pages (excluding references), accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24574 2026-01-21 cs.CL cs.AI cs.LG 80%

Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time

在测试时理解并引导推理模型的认知行为

Zhenyu Zhang, Xiaoxia Wu, Zhongzhu Zhou, Qingyang Wu, Yineng Zhang, Pragaash Ponnusamy, Harikaran Subbaraj, Jue Wang, Shuaiwen Leon Song, Ben Athiwaratkun

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Together AI University of Sydney(悉尼大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12766 2026-01-21 cs.CV cs.SY eess.SY 80%

Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration

空间视觉导航:具有显式空间感知和探索的零样本视觉-语言导航

Lu Yue, Yue Fan, Shiwei Lian, Yu Zhao, Jiaxin Yu, Liang Xie, Feitian Zhang

机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院,以及湍流与复杂系统国家重点实验室,北京大学) Defense Innovation Institute, Academy of Military Sciences, Beijing(国防科技创新研究院,军事科学院,北京) Tianjin Artificial Intelligence Innovation Center, Tianjin(天津人工智能创新中心,天津) Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能学院,哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Spatial-VLN通过增强空间感知和探索机制,提升零样本视觉-语言导航在复杂环境中的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13114 2026-01-21 cs.NI cs.AI cs.SY eess.SY 79%

IntAgent: NWDAF-Based Intent LLM Agent Towards Advanced Next Generation Networks

IntAgent:基于网络切片分析功能的意图LLM代理面向下一代高级网络

Abdelrahman Soliman, Ahmed Refaey, Aiman Erbad, Amr Mohamed

机构 * University of Guelph(圭尔夫大学) Qatar University(卡塔尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 IntAgent通过整合NWDAF分析与工具,实现基于意图的网络自动化管理,提升网络操作的智能化和动态响应能力。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11801 2026-01-21 cs.RO cs.AI 79%

RobotDesignGPT: Automated Robot Design Synthesis using Vision Language Models

RobotDesignGPT: 基于视觉语言模型的自动化机器人设计合成

Nitish Sontakke, K. Niranjan Kumar, Sehoon Ha

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 RobotDesignGPT利用视觉语言模型实现自动化机器人设计,通过用户提示和参考图像生成美观且运动学有效的机器人设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11644 2026-01-21 cs.CV cs.AI 79%

Predicting When to Trust Vision-Language Models for Spatial Reasoning

预测何时信任视觉-语言模型进行空间推理

Muhammad Imran, Yugyung Lee

机构 * University of Missouri Kansas City(密苏里大学堪萨斯城分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出一种基于视觉的置信度估计框架,通过几何验证提升VLM空间推理的可靠性,实验显示其在BLIP-2和CLIP上的AUROC显著优于文本方法基线。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12842 2026-01-21 cs.AI cs.LG 79%

SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning

SCULPT:基于约束的剪枝MCTS,为数学推理 carve 高效路径

Qitong Fang, Haotian Li, Xu Wang

机构 * Jilin Jianzhu University(吉林建筑大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SCULPT通过引入约束引导的剪枝MCTS方法,提升数学推理的效率和准确性,同时保持稳定性。

Comments 11 pages, 3 figures. Equal contribution: Qitong Fang and Haotian Li. Corresponding authors: Qitong Fang (fangqitong@student.jlju.edu.cn), Haotian Li (lihaotian@student.jlju.edu.cn), Xu Wang (wangxu@jlju.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11979 2026-01-21 cs.AI cs.LG 79%

Process In-Context Learning: Enhancing Mathematical Reasoning via Dynamic Demonstration Insertion

过程在上下文学习:通过动态演示插入增强数学推理

Ang Gao, Changshuo Zhang, Xiao Zhang, Deyang Li, Minjun Zhao, Fangchao Liu, Xinyu Zhang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Huawei Poisson Lab, China(华为Poisson实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PICL通过动态插入相关演示来提升数学推理能力,有效缓解推理过程中的困惑问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13933 2026-01-21 cs.SE 78%

VulnResolver: A Hybrid Agent Framework for LLM-Based Automated Vulnerability Issue Resolution

VulnResolver: 一种基于大语言模型的混合代理框架用于LLM驱动的自动漏洞问题解决

Mingming Zhang, Xu Wang, Jian Zhang, Xiangxin Meng, Jiayi Zhang, Chunming Hu

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 VulnResolver是一种基于大语言模型的混合代理框架,通过上下文预收集和安全属性分析代理,实现自动化漏洞问题的高效解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13705 2026-01-21 cs.CV 78%

Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles

推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型

Maria Lymperaiou, Vasileios Karampinis, Giorgos Filandrianos, Angelos Vlachos, Chrysoula Zerva, Athanasios Voulodimos

机构 * National Technical University of Athens(国家技术大学雅典) Instituto de Telecomunicações(电信研究所)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05839 2026-01-21 cs.CV 78%

GeoSurDepth: Harnessing Foundation Model for Spatial Geometry Consistency-Oriented Self-Supervised Surround-View Depth Estimation

GeoSurDepth:利用基础模型实现以空间几何一致性为导向的自监督周围视图深度估计

Weimin Liu, Wenjun Wang, Joshua H. Meng

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(1 智能绿色车辆与移动国家重点实验室,车辆与移动学院,清华大学,北京100084,中国) California PATH, University of California, Berkeley, CA, United States(2 加州PATH,加州大学伯克利分校,加州,美国)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 GeoSurDepth通过利用基础模型和几何一致性,实现了更鲁棒的自监督周围视图深度估计,验证了其在自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12626 2026-01-21 cs.CV 78%

Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models

线性机制用于视觉语言模型中的时空推理

Raphi Kang, Hongqiao Chen, Georgia Gkioxari, Pietro Perona

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出了一种线性机制用于视觉语言模型中的时空推理,通过分析空间ID和时间ID的结合,揭示了模型内部的因果推理过程,以提升模型的可解释性和设计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16475 2026-01-21 cs.HC cs.RO 78%

LLM-Glasses: GenAI-driven Glasses with Haptic Feedback for Navigation of Visually Impaired People

LLM-Glasses: 基于生成式AI的具有触觉反馈的眼镜用于盲人导航

Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Yara Mahmoud, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 LLM-Glasses通过生成式AI和触觉反馈为视障人士提供导航支持,实验显示其在不同障碍物环境下具有较高的导航准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14091 2026-01-21 cs.RO cs.AI 77%

Zero-shot adaptable task planning for autonomous construction robots: a comparative study of lightweight single and multi-AI agent systems

零样本适应性任务规划用于自主建造机器人:轻量级单 agent 和多 agent 系统的比较研究

Hossein Naderi, Alireza Shojaei, Lifu Huang, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究通过比较轻量级单 agent 和多 agent 系统,探索了零样本适应性任务规划在自主建造机器人中的应用,展示了四 agent 团队在效率和成本上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13653 2026-01-21 cs.LG 77%

TimeART: Towards Agentic Time Series Reasoning via Tool-Augmentation

TimeART: 通过工具增强实现代理时间序列推理

Xingjian Wu, Junkai Lu, Zhengyu Li, Xiangfei Qiu, Jilin Hu, Chenjuan Guo, Christian S. Jensen, Bin Yang

机构 * East China Normal University, Shanghai, China(华东师范大学) Aalborg University, Aalborg, Denmark(奥胡斯大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TimeART通过融合强大工具的分析能力与LLM的推理能力,实现时间序列问题回答的自主代理方法,通过四阶段训练策略提升模型泛化能力,并在多个任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13244 2026-01-21 cs.LG 77%

Do Instruction-Tuned Models Always Perform Better Than Base Models? Evidence from Math and Domain-Shifted Benchmarks

指令微调模型是否总是比基模型表现更好?数学和领域转移基准的证据

Prateek Munjal, Clement Christophe, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi, UAE(阿布扎希德)

专题命中 推理与问题求解 :LLM(abstract);instruction tuning(abstract);prompting(abstract);分类 cs.LG

AI总结 研究通过数学和领域转移基准验证指令微调模型在不同设置下的表现差异,发现其性能依赖于提示模式而非内在推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏