LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning
LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。
ChartAgent: 一种集成工具推理的图表理解框架
机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) ; Zhongguancun Academy(中关村学院) ; State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。
K-12教育工作者如何使用AI:大规模LLM辅助定性分析
机构 * University of Washington(华盛顿大学) ; Hensun Innovation(翰森创新)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本研究通过大规模LLM辅助分析,探讨K-12教育工作者在教学中使用AI工具的模式与方法,揭示其教学推理过程并为教育工具设计提供依据。
重新思考多智能体系统可靠性:从拜占庭容错的角度出发
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。
RecGPT-V2 技术报告
机构 * RecGPT Team(RecGPT 团队)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 RecGPT-V2通过多代理系统、元提示框架、受约束强化学习和代理作为裁判框架,提升推荐系统意图推理的效率和准确性,实现60%的GPU消耗降低和11.46%的NER提升。
PortAgent: 基于大语言模型的港口终端车辆调度代理
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI
AI总结 PortAgent利用大语言模型实现港口终端车辆调度系统的自动化迁移,无需专家参与,降低数据需求并加快部署速度。
利用大语言模型进行帕金森病监测与预警的协同本体工程
机构 * Intelligent Systems Laboratory, Department of Cultural Technology and Communication, University of the Aegean(爱琴海大学智能系统实验室) ; Artificial Intelligence Laboratory, Department of Digital Systems, University of Piraeus(比雷埃克斯大学人工智能实验室)
专题命中 复杂问题求解 :CoT(abstract);分类 cs.AI
AI总结 本文研究了利用大语言模型进行帕金森病监测与预警本体工程,通过人机协作提升本体的全面性和准确性。
面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型
机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) ; TNO(荷兰国防研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。
STAR:用于统一多模态学习的堆叠自回归方案
机构 * Meituan Inc(美团公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。
Comments 18 pages, 7 figures
VesSAM: 高效多提示分割复杂血管
机构 * FNii-Shenzhen, CUHK-Shenzhen(FNii-Shenzhen,CUHK-Shenzhen) ; School of Science and Engineering, CUHK-Shenzhen(CUHK-Shenzhen科学与工程学院) ; Zhejiang University(浙江大学) ; Boston University(波士顿大学) ; Vanderbilt University(范德比大学) ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :planning(abstract)
AI总结 VesSAM通过多提示编码器和轻量级解码器提升血管分割性能,实现比现有方法更高的Dice和IoU指标,同时参数更少且泛化能力更强。
混合RAG:利用大语言模型整合文本和表格
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。
Comments Accepted to SIGKDD 2026
TIBSTC-CoT:一种用于语言模型链式推理的多领域指令数据集
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI
AI总结 TIBSTC-CoT通过链式推理提示法构建多领域藏语数据集,开发出具备推理能力的藏语LLM,提升低资源语言处理性能。
Comments We will merge this paper with arXiv:2503.18288
MMhops-R1: 多模态多跳推理
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 MMhops-R1通过动态规划和多模态知识整合,提升多跳推理能力,提出新型mRAG框架并提供挑战性基准。
Comments Acceped by AAAI 2026
GALAX:图增强语言模型用于可解释的强化引导子图推理在精准医学中
机构 * I2DB, Washington University School of Medicine(I2DB,华盛顿大学医学学院) ; Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校) ; Department of Genetics, Washington University School of Medicine(遗传学系,华盛顿大学医学学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 GALAX通过整合图神经网络与大语言模型,利用强化学习实现子图推理,提升精准医学中目标发现的可解释性和可靠性。
COMMA:一种基于通信的多模态多智能体基准
机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) ; Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) ; Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) ; Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。
Journal ref Transactions on Machine Learning Research, 2025
层流假说:通过大语言模型中的语义湍流检测对抗性突破
机构 * Brac University(布拉克大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。
LoopBench: 通过LLM群体发现涌现的对称性打破策略
机构 * University of Alberta(阿尔伯塔大学) ; Network for Applied Technology(应用技术网络)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 LoopBench通过LLM群体研究分布式对称性打破策略,揭示先进模型在解决死锁问题上的能力。
Comments 11 pages, 3 figures, submitted to ANTS 2026
单智能体扩展无法实现多智能体智能:迈向具有原生多智能体智能的基础模型
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 本文指出单智能体扩展无法实现多智能体智能,提出构建具有原生多智能体智能的基础模型的关键方向。
VIBE:视觉语言模型能否读懂房间?
机构 * Purdue University(普渡大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。
Comments Findings of EMNLP, 2025
从YOLO到VLMs:利用卫星图像在中东和北非地区推进零样本和少样本废水处理厂检测
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究利用VLMs替代YOLOv8,通过零样本和少样本方法高效识别中东和北非地区废水处理厂,提升遥感应用的可扩展性。
Comments 9 pages, 9 figures
PentestEval: 一种基于模块化和阶段级设计的LLM渗透测试基准测试
机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理大学) ; School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) ; School of Cyber Security, Tianjin University(网络安全学院,天津大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 PentestEval通过模块化和阶段级设计,评估LLM在渗透测试各阶段的性能,揭示其在自动化测试中的局限性。
Comments 13 pages, 6 figures
TorchTraceAP: 一种新的基准数据集,用于检测计算机视觉模型中的性能反模式
机构 * University of California, Irvine(加州大学尔湾分校) ; Meta ; University of California, Riverside(加州大学河滨分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 TorchTraceAP提出了一种新的基准数据集和迭代方法,用于提升ML模型检测计算机视觉模型轨迹中反模式的能力。
MobileWorldBench: 向移动智能体的语义世界建模迈进
机构 * UCLA(加州大学洛杉矶分校) ; Panasonic AI Research(松下人工智能研究) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率
Comments 21 pages, 13 figures
QCircuitBench:用于量子算法设计的大型数据集
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Anderson School of Management, University of California, Los Angeles(美国加州大学洛杉矶分校安德森管理学院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 QCircuitBench是一个用于评估AI在量子算法设计中能力的大型数据集,包含多种任务和算法,揭示了大语言模型在此领域的局限性。
Comments 45 pages, 17 figures, 15 tables, GitHub repository: https://github.com/EstelYang/QCircuitBench
文档打包对大型语言模型潜在多跳推理能力的影响
机构 * Chandar Research Lab(Chandar研究实验室) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Microsoft Research(微软研究院) ; Polytechnique Montréal(蒙特利尔理工学院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了文档打包对大型语言模型多跳推理能力的影响,发现打包可提升性能但增加计算成本,并通过消融研究揭示了其关键因素。
CogMem:一种用于大型语言模型中持续多轮推理的认知记忆架构
机构 * Macquarie University(麦考瑞大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 CogMem通过引入认知启发的记忆增强架构,解决大型语言模型在多轮交互中的推理偏差、任务漂移和记忆衰减问题,提升推理的连贯性和可靠性。
Comments underreview
影响大语言模型有效深度的因素是什么?
机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) ; Department of Computer Science, Massachusetts Institute of Technology(计算机科学系,麻省理工学院)
专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL
AI总结 研究发现大语言模型的有效深度受模型规模、训练类型和任务难度影响,且有效深度比例稳定,提示需提升层利用率、模型剪枝和提前退出技术。
通过上下文神经错误本增强的检索反馈
机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。
Comments Accepted at EMNLP 2025 main
HyperVL: 一种高效的多模态大语言模型用于边缘设备
机构 * HyperAI Team(HyperAI团队) ; Xiaomi Corporation(小米公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 HyperVL是一种为边缘设备优化的高效多模态大语言模型,通过图像分块、视觉分辨率压缩和双一致性学习技术,实现低延迟、低功耗的多模态推理。
Comments Technical report of Xiaomi HyperAI Team
基于AI的标注流程用于稳定大语言模型:一种人机协同方法
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。
Comments 16 Pages