arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2603.07642 2026-03-10 cs.LG 57%

Helix: Evolutionary Reinforcement Learning for Open-Ended Scientific Problem Solving

Helix:基于进化强化学习的开放性科学问题求解

Chang Su, Zhongkai Hao, Zhizhou Zhang, Zeyu Xia, Youjia Wu, Hang Su, Jun Zhu

机构 * Bosch (China) Investment Co., Ltd.(博世(中国)投资有限公司) Tsinghua-Bosch Joint Center for ML, Tsinghua University(清华大学-博世联合人工智能中心,清华大学) Dept. of EE, Tsinghua University(清华大学电子工程系) Dept. of Comp. Sci. & Techn., Tsinghua University(清华大学计算机科学与技术系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 HELIX通过分层进化强化学习框架,在开放性科学问题求解中实现了先进解决方案的发现,其在圆圈装箱任务中取得state-of-the-art结果,并在机器学习基准测试中超越GPT-4o。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07019 2026-03-10 cs.CL 57%

AutoChecklist: Composable Pipelines for Checklist Generation and Scoring with LLM-as-a-Judge

AutoChecklist: 用于检查表生成和评分的可组合流水线

Karen Zhou, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 AutoChecklist通过可组合的流水线实现检查表生成与评分,支持多种LLM提供者,并展示了在领域适应中的灵活性。

Comments Website: https://autochecklist.github.io/, Code: https://github.com/ChicagoHAI/AutoChecklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09486 2026-03-10 cs.CV cs.AI cs.MM 57%

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

视频-EM:面向长视频理解的事件中心型片段记忆

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu Chen, Xuelong Li

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Tianjin University(天津大学) Nanjing University(南京大学) Zhejiang University(浙江大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18570 2026-03-10 cs.LG 57%

VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis

VISTA:面向无训练股票时间序列分析的视觉-语言推理

Tina Khezresmaeilzadeh, Parsa Razmara, Seyedarmin Azizi, Mohammad Erfan Sadeghi, Erfan Baghaei Potraghloo

机构 * University of Southern California(南加州大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.LG

AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。

Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02263 2026-03-09 q-bio.GN cs.AI 57%

LA-MARRVEL: A Knowledge-Grounded, Language-Aware LLM Framework for Clinically Robust Rare Disease Gene Prioritization

LA-MARRVEL:一种基于知识、语言感知的LLM框架,用于临床稳健的罕见病基因优先级排序

Jaeyeon Lee, Lin Yao, Hyun-Hwan Jeong, Zhandong Liu

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(Jan和Dan Duncan神经研究 institutes) Texas Children’s Hospital(德克萨斯儿童医院) Quantitative and Computational Biosciences program(定量与计算生物科学项目)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 LA-MARRVEL通过基于知识和语言感知的LLM框架,提升罕见病基因优先级排序的准确性和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00152 2026-03-06 cs.CV cs.AI 57%

Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design

Dr. Seg: 通过感知导向设计重新审视GRPO训练用于视觉大语言模型

Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Dr.Seg通过感知导向设计重新审视GRPO训练,提出简单框架提升视觉任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05232 2026-03-06 cs.LG 57%

SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity

SlideSparse: 快速且灵活的(2N-2):2N结构稀疏

Hanyong Shao, Yingbo Hao, Ting Song, Yan Xia, Di Zhang, Shaohan Huang, Xun Wu, Songchen Xu, Le Xu, Li Dong, Zewen Chi, Yi Zou, Furu Wei

机构 * Peking University(北京大学) South China University of Technology(南方科技大学) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SlideSparse通过滑动窗口分解和激活提升技术,在通用GPU上实现(2N-2):2N结构稀疏的高效加速,提升LLM推理效率的同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03505 2026-03-05 cs.CV cs.AI 57%

PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation

PhyPrompt:基于强化学习的物理合理文本到视频生成的提示优化

Shang Wu, Chenwei Xu, Zhuofan Xia, Weijian Li, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI

AI总结 PhyPrompt通过强化学习优化提示,提升文本到视频生成的物理合理性,优于GPT-4o和DeepSeek-V3,实现更高效的物理常识和语义忠实度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03352 2026-03-05 physics.ed-ph cs.AI 57%

Perfect score on IPhO 2025 theory by Gemini agent

2025年国际物理奥林匹克竞赛理论部分完美得分的Gemini代理

Yichen Huang

机构 * Santa Clarita, California 91350, USA(美国加利福尼亚州圣克拉拉)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用Gemini 3.1 Pro Preview代理在2025年IPhO理论部分取得完美分数,展示了AI在复杂物理问题上的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03078 2026-03-04 cs.AI 57%

RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization

RAPO:通过检索增强策略优化扩展LLM代理的探索

Siwei Zhang, Yun Xiong, Xi Chen, Zi'an Jia, Renhong Huang, Jiarong Xu, Jiawei Zhang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) UC Davis(加州大学戴维斯分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RAPO通过引入检索增强策略优化,扩展LLM代理的探索能力,提升训练效率和探索效果。

Comments Submit to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03024 2026-03-04 cs.RO cs.AI 57%

MA-CoNav: A Master-Slave Multi-Agent Framework with Hierarchical Collaboration and Dual-Level Reflection for Long-Horizon Embodied VLN

MA-CoNav:一种具有分层协作和双阶段反思的主从多智能体框架用于长周期具身视觉语言导航

Ling Luo, Qianqian Bai

机构 * Southwestern University of Finance(西南财经大学) Department of Informatics,Universitat Hamburg, Hamburg, Germany(汉堡大学信息学院) University of Electronic Science(电子科学大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 MA-CoNav 通过主从分层架构和双阶段反思机制,提升长周期具身视觉语言导航任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16894 2026-03-04 cs.CL 57%

Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization Alignment

让LoRA更出色:通过自适应奇异值和专家混合优化对齐提升LoRA

Chenghao Fan, Zhenyi Lu, Sichen Liu, Chengfeng Gu, Xiaoye Qu, Wei Wei, Yu Cheng

机构 * School of Computer Science \& Technology, Huazhong University of Science The Chinese University of Hong Kong Zhejiang University

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GOAT通过自适应奇异值和专家混合优化对齐提升LoRA性能,实现在多个任务上的最优表现。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02615 2026-03-04 cs.CL 57%

Think, But Don't Overthink: Reproducing Recursive Language Models

思考,但不要过度思考:重现递归语言模型

Daren Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过评估不同递归深度对RLM性能的影响,发现更深层次递归会导致模型过度思考,从而降低性能并增加计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10246 2026-03-04 cs.HC cs.CL 57%

Automated Coding of Communications in Collaborative Problem-solving Tasks Using ChatGPT

利用ChatGPT进行协作问题解决任务中通信的自动化编码

Jiangang Hao, Wenju Cui, Patrick Kyllonen, Emily Kerzabi, Lei Liu, Michael Flor

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文利用ChatGPT对协作问题解决任务中的通信数据进行自动化编码,探讨不同模型和框架对编码效果的影响,并提出通过优化提示提高编码准确性的方法。

Comments 21 pages, 3 figures, 5 tables. Initially report in the edArXiv:xw6kz

Journal ref Journal of Educational Measurement, (2025). Volume 62, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06502 2026-03-03 cs.AI 57%

DRAGON: LLM-Driven Decomposition and Reconstruction Agents for Large-Scale Combinatorial Optimization

DRAGON:基于大语言模型的分解与重建代理用于大规模组合优化

Shengkai Chen, Zhiguang Cao, Jianan Zhou, Yaoxin Wu, Senthilnath Jayavelu, Zhuoyi Lin, Xiaoli Li, Shili Xiang

机构 * Institute for Infocomm Research A STAR Singapore Singapore Management University Singapore Nanyang Technological University Singapore Eindhoven University of Technology Eindhoven Netherlands National University of Singapore \& Institute for Infocomm Research A STAR Singapore Singapore University of Technology Institute for Infocomm Research Singapore Management University Nanyang Technological University Eindhoven University of Technology National University of Singapore \& Institute for Infocomm Research

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DRAGON是一种结合元启发式设计和LLM推理的新型框架,通过分解与重建代理实现大规模组合优化问题的高效求解。

Comments This paper has been accepted for presentation and publication at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), source code: https://github.com/skychan/DARGON

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06005 2026-03-03 cs.CL 57%

MASA: Rethinking the Representational Bottleneck in LoRA with Multi-A Shared Adaptation

MASA:重新思考LoRA中的表示瓶颈问题:多A共享适应

Qin Dong, Yuntian Tang, Heming Jia, Yunhang Shen, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Shaohui Lin, Rongrong Ji

机构 * East China Normal University(华东师范大学) Sanming University(三明大学) Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing of Ministry of Education of China, Xiamen University, China(中国教育部高效计算实验室,厦门大学,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MASA通过多A共享适应架构提升LoRA在多领域泛化和多任务推理中的表现,实现更高准确率

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23166 2026-03-03 cs.CL 57%

Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs

测试时策略适应用于增强基于LLM的多轮交互

Chenxing Wei, Hong Wang, Ying He, Fei Yu, Yao Shu

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) University of Science(科学技术大学) Carleton University(卡尔顿大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 本研究提出测试时策略适应方法,通过用户反馈优化多轮交互策略,提升LLM在长时间对话中的表现。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22050 2026-03-03 cs.CL 57%

DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router

DeepSieve: 通过LLM作为知识路由器实现信息筛分

Minghao Guo, Qingcheng Zeng, Xujiang Zhao, Yanchi Liu, Wenchao Yu, Mengnan Du, Haifeng Chen, Wei Cheng

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) NEC Laboratories America(NEC美国实验室) NJIT(新泽西理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DeepSieve通过LLM作为知识路由器实现信息筛分,提升多跳问答任务的推理深度、检索精度和可解释性。

Comments Accepted by EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00923 2026-03-03 cs.CL 57%

Hybrid Neural-LLM Pipeline for Morphological Glossing in Endangered Language Documentation: A Case Study of Jungar Tuvan

混合神经-大语言模型管道在濒危语言文档中的形态学 glossing:朱加尔图瓦语案例研究

Siyu Liang, Talant Mawkanuli, Gina-Anne Levow

机构 * Department of Linguistics, University of Washington(语言学系,华盛顿大学) Department of Middle Eastern Languages and Cultures, University of Washington(中东语言与文化系,华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种混合神经-大语言模型管道,用于朱加尔图瓦语的形态学 glossing,通过结合神经序列标注和 LLM 后修正,显著减少标注工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00842 2026-03-03 cs.CL 57%

MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型

Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu

机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Research Computing, University of Florida(佛罗里达大学研究计算中心) AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15852 2026-03-03 cs.CV cs.AI 57%

Advancing Complex Video Object Segmentation via Progressive Concept Construction

通过渐进式概念构建推进复杂视频对象分割

Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) CPII under InnoHK(InnoHK下的CPII)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SeC通过渐进式概念构建方法,在复杂视频对象分割任务中实现了显著性能提升,特别是在语义复杂场景下的表现优于现有方法。

Comments project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00126 2026-03-03 cs.CV cs.AI cs.IR cs.MM cs.PF cs.SY eess.SY 57%

QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference

QuickGrasp: 通过加速分词和边缘增强推理实现响应式视频-语言查询服务

Miao Zhang, Ruixiao Zhang, Jianxin Shi, Hengzhi Wang, Hao Fang, Jiangchuan Liu

机构 * School of Computing Science, Simon Fraser University(计算科学学院,西蒙弗雷泽大学) Computer Science Department, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校) College of Cryptology and Cyber Science, Nankai University(密码学与网络科学学院,南开大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 QuickGrasp通过加速分词和边缘增强推理,实现响应式视频-语言查询服务,兼顾准确性和响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00120 2026-03-03 cs.MA cs.AI 57%

SIGMAS: Second-Order Interaction-based Grouping for Overlapping Multi-Agent Swarms

SIGMAS:基于二次交互的多智能体群集分组

Minah Lee, Saibal Mukhopadhyay

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SIGMAS通过二次交互建模实现多智能体群集的自监督分组,准确恢复潜在群体结构并平衡个体与集体动态。

Comments Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00477 2026-03-02 cs.CL 57%

Intention-Adaptive LLM Fine-Tuning for Text Revision Generation

意图自适应的LLM微调用于文本修订生成

Zhexiong Liu, Diane Litman

机构 * Department of Computer Science, Learning Research & Development Center University of Pittsburgh(计算机科学系、学习研究与开发中心宾夕法尼亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Intention-Tuning框架,通过意图自适应的逐层微调提升文本修订生成效果。

Comments In the Conference of the European Chapter of the Association for Computational Linguistics (EACL), March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24532 2026-03-02 cs.CL 57%

DeepQuestion: Systematic Generation of Real-World Challenges for Evaluating LLMs Performance

DeepQuestion: 为评估LLM性能系统生成现实世界挑战

Ali Khoramfar, Ali Ramezani, Mohammad Mahdi Mohajeri, Mohammad Javad Dousti, Majid Nili Ahmadabadi, Heshaam Faili

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DeepQuestion通过系统生成现实世界挑战,揭示LLM在复杂任务上的性能下降,强调需多样化评估以改进模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22808 2026-02-27 cs.AI 57%

MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks

MiroFlow:面向通用深度研究任务的高性能和鲁棒开源代理框架

Shiqian Su, Sen Xing, Xuan Dong, Muyan Zhong, Bin Wang, Xizhou Zhu, Yuntao Chen, Wenhai Wang, Yue Deng, Pengxiang Zhu, Ziyuan Liu, Tiantong Li, Jiaheng Yu, Zhe Chen, Lidong Bing, Jifeng Dai

机构 * Tsinghua University(清华大学) MiroMind AI National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MiroFlow是一种面向通用深度研究任务的高性能开源代理框架,通过灵活的工作流编排和深度推理模式提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22718 2026-02-27 cs.AI cs.DC 57%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21611 2026-02-26 cs.SE cs.AI 57%

Structurally Aligned Subtask-Level Memory for Software Engineering Agents

结构对齐的子任务级记忆用于软件工程代理

Kangning Shen, Jingyuan Zhang, Chenxi Sun, Wencong Zeng, Yang Yue

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结构对齐的子任务级记忆方法,通过与代理功能分解对齐来提升软件工程代理的长周期推理能力,实验表明在多种backbone上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21351 2026-02-26 cs.AI cs.IR cs.MA 57%

A Hierarchical Multi-Agent System for Autonomous Discovery in Geoscientific Data Archives

面向地质数据档案的分层多智能体系统

Dmitrii Pantiukhin, Ivan Kuznetsov, Boris Shapkin, Antonia Anna Jost, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute for Polar and Marine Research(阿尔弗雷德·韦格ener极地和海洋研究所)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 PANGAEA-GPT通过分层多智能体框架实现地质数据自动发现与分析,具备复杂工作流执行能力,减少人工干预。

Comments 20 pages, 6 figures, 7 tables, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00024 2026-02-26 cs.SI cs.AI 57%

EpidemIQs: Prompt-to-Paper LLM Agents for Epidemic Modeling and Analysis

EpidemIQs: 用于流行病建模与分析的提示到论文LLM代理

Mohammad Hossein Samaei, Faryad Darabi Sahneh, Lee W. Cohnstaedt, Caterina Scoglio

机构 * Department of Electrical and Computer Engineering, Kansas State University(电气与计算机工程系,堪萨斯州立大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 EpidemIQs是一种多代理LLM框架,通过五个阶段实现流行病建模与分析的自动化,利用科学家代理和任务专家代理提高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏