arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 103 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 103 篇

2508.17527 2026-08-25 cs.AI cs.CY cs.LG 版本更新 92%

Benchmarking Retrieval-Augmented Generation Strategies for Large Language Model-Based Travel Mode Choice Prediction

面向基于大语言模型的出行方式选择预测的检索增强生成策略基准测试

Yiming Xu, Junfeng Jiao

机构 * School of Architecture, The University of Texas at Austin(德克萨斯大学建筑学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究开发将RAG集成到LLM出行方式选择预测的模块化框架,测试四种检索策略在三款LLM上的表现,发现结合均衡检索与交叉编码器重排序的GPT-4o准确率达80.8%,优于传统基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06769 2026-08-25 cs.CL 版本更新 92%

Training Large Language Models to Reason in a Continuous Latent Space

训练大型语言模型在连续潜在空间中进行推理

Shibo Hao, Sainbayar Sukhbaatar, DiJia Su, Xian Li, Zhiting Hu, Jason Weston, Yuandong Tian

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出名为Coconut的连续思维链新范式,将LLM推理状态表示为连续潜在空间中的隐藏状态,支持广度优先搜索,在需大量搜索的逻辑推理任务上优于CoT,实现更优的准确率效率权衡。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22152 2026-08-25 cs.CL 新提交 92%

The Collaboration Tax: How Much LLM Multi-Agent Systems Pay to Coordinate

协作损耗:LLM多智能体系统协调时的性能损失有多大

Weixiang Sun, Zehong Wang, Hong Huang, Colby Nelson, Yanfang Ye

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究定义了LLM多智能体系统的协作损耗,揭示其随模型能力提升单调下降,可通过对话特征预测,提示干预可缩小差距,为优化多智能体协作提供了量化依据。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-25 eess.IV cs.CV 版本更新 91%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18537 2026-08-25 cs.SE 版本更新 91%

CRANE-LLM: Runtime-Augmented LLMs for Crash Prediction and Diagnosis in ML Notebooks

运行时增强的LLM用于ML笔记本的崩溃检测与诊断

Yiran Wang, José Antonio Hernández López, Ulf Nilsson, Dániel Varró

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 CRANE-LLM通过整合运行时信息提升ML笔记本崩溃检测与诊断的准确性与F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23256 2026-08-25 cs.AI 新提交 91%

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

下一块推理强化学习(RL)真的比监督微调(SFT)更好?——在无思维链(CoT)数据下重新审视训练策略

Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :SFT(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 本研究对比下一块推理RL与混合SFT,发现混合SFT在更少计算量下性能上限更高,且需在完整后训练 pipeline 中评估无CoT训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-25 cs.AI cs.RO 版本更新 90%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17448 2026-08-25 cs.CE cs.AI physics.chem-ph 版本更新 90%

RetroDFM-R: Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning

RetroDFM-R:基于强化学习的大语言模型驱动的推理型逆合成预测

Situo Zhang, Hanqi Li, Lu Chen, Zihan Zhao, Xuanze Lin, Zichen Zhu, Danyu Luo, Bo Chen, Xin Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science MoE Key Lab of Artificial Intelligence SJTU AI Institute(X-LANCE实验室,计算机科学学院,人工智能关键实验室,SJTU人工智能研究所) Suzhou Laboratory(苏州实验室) Jiangsu Key Lab of Language Computing(江苏语言计算重点实验室) School of Chemistry and Chemical Engineering(化学与化工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出RetroDFM-R模型,结合强化学习与大语言模型实现推理型逆合成预测,在USPTO-50K基准上准确率优于现有方法,可重构复杂合成路线,提升了预测的可解释性与实用性。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23047 2026-08-25 cs.CL cs.AI 新提交 90%

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析

Abdul Ghafoor, Muhammad Arslan Manzoor, Yufang Hou

机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22839 2026-08-25 cs.LG cs.AI 新提交 90%

Hierarchy-Aware Supervised Uncertainty Estimation for Black-box LLM Taxonomic Reasoning

面向黑盒大语言模型分类推理的层级感知监督式不确定性估计

Shuting Xie, Nathaniel Lesperance, Graham W. Taylor

机构 * Vector Institute for AI(向量人工智能研究所) University of Guelph(圭尔夫大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对黑盒LLM在生物多样性监测分类推理中置信度估计难的问题,提出层级感知监督估计器,提升了微AUROC,验证了层级结构对弃权规则的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21871 2026-08-25 cs.CL cs.LG 新提交 90%

The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning

追逐即课程,捕获锚定信用:用于零数据大语言模型推理的追逃自博弈

Jing Yu, Shengchao Chen, Yiyun Tan

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出LURE框架,将零数据自博弈转化为追逃博弈,通过捕获锚定信用机制,在三类推理环境和主干模型上,实现优于先进基线的零数据LLM推理性能。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01993 2026-08-25 cs.CL cs.AI 版本更新 90%

SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning

SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。

Comments Accepted to EMNLP 2026 (Main Conference). Project Page: this https URL (https://github.com/DaeyongKwon98/SAFE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22194 2026-08-25 physics.soc-ph 新提交 90%

From Authorial Mathematics to Studio Mathematics:Ecobiontic Forms of Proof after Large Language Models

从作者式数学到工作室式数学:大型语言模型之后的证明的生态生物形式

Oliver López Corona

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文探讨大型语言模型等技术催生的人机集合体(工作室生态生物)的认识合法性,提出需满足可追溯来源等治理条件,通过案例分析明确协作等维度的独立性,未声称其优于传统作者式数学实践。

Comments 43 pages, 6 figures; includes supplementary methodological and validation material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23061 2026-08-25 cs.AI 新提交 90%

Improving O-RADS Risk Stratification from Ultrasound Reports: A Comparative Evaluation of Hybrid versus End-to-End LLM Reasoning Strategies

改进超声报告的O-RADS风险分层:混合式与端到端大语言模型推理策略的对比评估

Xiaotong Tan, Chunli Qiu, Xin Liu, Qing Huang, Guangli Zhou, Bo Gao, Xiaoyan Song, Shuyan Wang, Xiuqin Wang, Wufeng Xue, Ruobing Huang, Dong Ni, Guowei Tao, Jun Cheng

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究对比不同LLM推理策略,发现将特征提取与规则分类解耦的混合架构,使用Gemini 3.6 Flash时O-RADS分类准确率达99.2%,优于端到端策略及原始临床报告,可实现准确可靠的自动化临床决策。

Comments Main manuscript: 20 pages, 5 figures, and 2 tables; supplemental material: 11 pages, 1 figure, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22993 2026-08-25 cs.CL cs.HC 新提交 90%

LLM Pedagogical Behavior in AI Tutoring Interactions

AI辅导交互中的LLM教学行为

Suhyeon Lee, Juneha Baek, Jaehyeong Park, Donghyuk Shin

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究开发五级支架水平量表,分析大学AI课程中203名学生的14637个LLM辅导响应,发现超95%为高水平帮助,支架水平与学生对话行为相关但对考试表现预测性有限,为LLM辅导提供实证基线与测量框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22566 2026-08-25 cs.CL 新提交 90%

From Diagnosis to Redesign: Using Quantitative Ethnography to Improve Multi-Agent LLM Reasoning

从诊断到重新设计:使用定量人种志改进多智能体大语言模型推理

Vedant Khatri, Anthony Cusimano, Zachari Swiecki, Zhen Xu, Xiner Liu, Renzhe Yu

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Monash University(莫纳什大学) Columbia University(哥伦比亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出定量人种志方法,以自动作文评分为例,通过分析五智能体辩论系统的交互模式诊断问题并修改提示词,使多智能体LLM的评分准确率从27.78%提升至40.28%。

Comments Accepted at ICQE 2026 (to appear in Springer CCIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22128 2026-08-25 cs.AI 新提交 90%

Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning

基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助

Zhaoda Du, Qiaojie Zheng, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-25 cs.AI 版本更新 90%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Yiyun Su, Zujun Peng, Yu Tian, Yuting Liu, Changruo Zhao, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23115 2026-08-25 cs.SE 新提交 89%

A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis

基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架

Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi, Qing Shan, Geerten M. Hengeveld, Ioannis N. Athanasiadis, Zhiming Zhao

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。

Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22140 2026-08-25 cs.CL cs.AI cs.LG 新提交 89%

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

词汇扰动破坏大语言模型推理:注意力转移的实证研究

Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

机构 * Missouri University of Science and Technology(密苏里科技大学) University of North Texas(北得克萨斯大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究通过实证分析发现词汇扰动会破坏LLM的推理能力,揭示了注意力转移机制及词元内容与注意力分配的耦合关系,解释了现有推理策略难以修复性能的原因。

Comments Accepted to EMNLP 2026 (Main Conference). 9 pages main text, 12 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09421 2026-08-25 cs.CL cs.AI 版本更新 88%

ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model

ClinicalGPT-R1:利用大语言模型提升全科疾病诊断的推理能力

Wuyang Lan, Wenzheng Wang, Changwei Ji, Guoxing Yang, Yongbo Zhang, Xiaohong Liu, Luonan Chen, Shengge Li, Song Wu, Guangyu Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClinicalGPT-R1,经20000条临床记录训练,在MedBench-Hard基准测试中,其中文诊断性能优于GPT-4o、英文性能与GPT-4相当,提升了疾病诊断的推理能力。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22785 2026-08-25 cs.CV 新提交 88%

OmicSync: Reliability-Aware Spatial Multi-Omics Clustering with Evidence-Constrained LLM Reasoning

OmicSync:结合证据约束大语言模型推理的可靠性感知空间多组学聚类

Rabeya Tus Sadia, Qiang Ye, Qiang Cheng

机构 * University of Kentucky(肯塔基大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);language model(abstract)

AI总结 OmicSync是结合证据约束LLM推理的可靠性感知空间多组学聚类框架,集成KAN-GCN骨干等功能,在多组学基准测试中表现优异,OmicSync-R进一步提升了人乳腺癌的聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22753 2026-08-25 cs.CL 新提交 88%

Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models

超越事实知识:大型语言模型中步骤级过程规则推理的基准测试与学习

Bohan Yu, Pengfei Cao, Chen Han, Chenxi Zhou, Zhiheng Zhang, Zhiyang Xie, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的过程规则推理不足,构建RuleWorld基准,提出DynaRule框架,在10K规则下将平均QA准确率提19个点,Recall@1超85%,大幅优于基线。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22376 2026-08-25 cs.CL 新提交 88%

Can Large Language Models "Hyper-Thread"?

大语言模型能否实现“超线程”?

Fei Ding

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出模型超线程假说,设计三种条件评估并行功能加载等,在 AIME 2025 开发集上获最高准确率,为超线程假说提供初步证据,推动推理扩展视角转变。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04617 2026-08-25 cs.AI 版本更新 88%

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

AdaR:为大语言模型(LLM)配备自适应推理能力的框架

Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

机构 * Nanjing University(南京大学) Meituan Inc.(美团公司)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有LLM数学推理的鲁棒性与泛化性缺陷,本文提出AdaR框架,通过RLVR训练及数据质量保障方法,有效提升了LLM数学推理能力并缓解了相关缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13610 2026-08-25 cs.CL cs.AI 版本更新 88%

One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders

一个被污染的页面就够了:评估生成式推荐系统中的网页内容污染

Minghao Luo, Liang Chen

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究提出FORGE基准,评估搜索增强LLM在检索结果被污染时推荐虚假产品的脆弱性,发现单个污染页面即可导致高达27%的推荐错误率,且推理能力无法缓解此问题。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22217 2026-08-25 cs.CV 新提交 88%

UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation

UR²-MLLM:面向放射科报告生成的多模态大语言模型中基于不确定性感知的重访推理

Yucheng Chen, Yang Yu, Jiazhou Zhou, Yufei Shi, Yongying Lan, Yichi Zhang, Liyi Li, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡医学人工智能中心) AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)AI方向) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对放射科报告生成任务,提出UR²-MLLM框架,通过动态重访不确定区域的机制实现最优性能,提升报告的可靠性与临床适配性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20073 2026-08-25 cs.CL cs.AI cs.LG 版本更新 88%

A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs

整合时空模型与大语言模型(LLMs)的模块化多任务推理框架

Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院) School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出整合时空模型与LLMs的STReason框架,通过上下文学习分解查询生成解释,在时空推理任务中显著优于LLM基线,可抑制幻觉并减少专家工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-08-25 cs.CL cs.AI 版本更新 87%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);pretraining(abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-08-25 cs.RO cs.AI cs.LG 版本更新 87%

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏