PreAct: Computer-Using Agents that Get Faster on Repeated Tasks
PreAct:在重复任务上加速的计算机使用代理
机构 * Pine AI
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PreAct:在重复任务上加速的计算机使用代理
机构 * Pine AI
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。
LongWebBench: 评估长程设置下的结构和功能性网页生成
机构 * Tsinghua University(清华大学) ; Yanshan University(燕山大学) ; University of Waterloo(滑铁卢大学) ; Beihang University(北京航空航天大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 提出LongWebBench基准,通过结构保真度和功能可执行性评估长网页生成,发现视觉相似性高但多步交互失败。
Comments 49 pages, 38 figures
纽约市拥堵收费后公共交通增益与空间不均的出行需求变化
机构 * Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院土木与环境工程系) ; Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) ; Mathematical Institute, University of Oxford(牛津大学数学院) ; Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) ; College of Urban and Environmental Sciences, Peking University(北京大学城市与环境科学学院) ; Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) ; Center for Computational Science and Engineering, Massachusetts Institute of Technology(麻省理工学院计算科学与工程中心)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 利用时间序列基础模型生成概率反事实预测,评估纽约市2025年实施的拥堵收费政策,发现公交和地铁客流量显著增加,但总体出行需求略有下降,且影响存在空间异质性。
将语音停顿上下文注入基于文本的痴呆症评估
机构 * Technische Hochschule Nürnberg(图林根应用技术大学纽伦堡分校) ; Technische Hochschule Rosenheim(图林根应用技术大学罗森海姆分校) ; Klinik für Psychiatrie und Psychotherapie, Universitätsklinik der Paracelsus Medizinischen Privatuniversität, Klinikum Nürnberg, Germany(帕拉塞尔斯医学私人大学纽伦堡大学心理治疗与精神病科诊所) ; KST Institut GmbH, Bad Emstal, Germany(KST研究所,巴德埃姆斯塔尔,德国)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本文研究利用停顿增强的转录文本,通过Transformer语言模型区分无认知障碍、轻度认知障碍和阿尔茨海默病患者,探讨停顿信息和声学上下文对不同任务的影响。
Comments Accepted at INTERSPEECH 2024
Journal ref Proceedings of Interspeech 2024
StereoFactory: 一种用于鲁棒立体匹配的统一合并框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; D-Star Robotics ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出StereoFactory,一种粗到细的进化框架,通过遗传算法选择模型子集和CMA-ES优化模块级路由,实现自适应模型合并,在多个基准上降低误差并显著减少训练时间。
GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。
Comments 28 pages, 11 Figures
NeuroClaw 技术报告
机构 * Electronic Engineering Department, The Chinese University of Hong Kong, China(香港中文大学电子工程系) ; School of Electronic Information, Northwest University, China(西北大学电子信息学院) ; Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系) ; Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(莱斯利大学计算机科学与工程系) ; Department of Radiology, Massachusetts General Hospital, Boston, MA, USA(麻省总医院放射科) ; Kempner Institute for Natural and Artificial Intelligence, Harvard University, Cambridge, MA, USA(哈佛大学自然与人工智能研究所)
专题命中 评测与基准 :LLM(abstract_cn)
AI总结 针对神经影像学中多模态数据、长流程和可重复性挑战,提出NeuroClaw多智能体研究助手,通过数据驱动决策、环境管理和三层技能架构实现可执行可复现的神经影像分析,并在NeuroBench基准上显著优于直接调用智能体。
LLMCodec:适配视频编解码器用于大型语言模型的高效权重压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出LLMCodec方法,利用视频编解码器(如VVC/H.266)结合仿射量化压缩LLM权重,无需微调或校准数据,在2-bit精度下显著降低困惑度并提升下游任务准确率。
Comments The authors need to make further revisions before resubmission
基于时变需求的约束赌博机在线LLM选择
机构 * Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) ; Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校曼宁信息与计算机科学学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对边缘云推理系统中异构LLM的选择问题,提出一种基于置信界估计和需求预测的在线学习算法,在硬预算和软延迟约束下实现亚线性遗憾和约束违反。
Comments 11 pages, 3 figures with multiple subfigures, 1 table, submitted for possible journal publication
弥合基于LLM的代码翻译中的功能正确性与运行时效率差距
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出SwiftTrans框架,通过多视角探索和差异感知选择两阶段,利用并行上下文学习和差异比较,同时提升LLM代码翻译的正确性和运行时效率。
Comments Accepted to ICML 2026
蓝图优先,模型其次:确定性LLM工作流框架
机构 * Alibaba(阿里巴巴)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出“蓝图优先,模型其次”框架,通过将工作流逻辑解耦为源代码蓝图并由确定性引擎执行,LLM仅处理子任务,在TravelPlanner上最终通过率提升97.6%,约束违反减少96.0%。
Comments 12 pages, 7 figures, 6 tables
LUMEN:分布式LLM服务的协调故障恢复
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对分布式LLM服务中工作节点故障导致KV缓存丢失和请求重算的问题,提出LUMEN系统,通过负载感知的协调恢复策略(检查点放置、中断请求分配、容量恢复)显著提升服务与恢复时间。
Bifrost: 面向隐私保护Transformer和LLM服务的混合TEE-FHE推理架构
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出Bifrost混合架构,利用CPU TEE处理非线性操作和状态刷新,FHE加密线性层委托给加速器,实现安全高效的LLM推理,相比纯FHE方案延迟降低9-53倍。
评估LLM编码代理在不同架构上的SZ系列有损压缩
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。
Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop
LLM特征可能损害GNN:同配图基准上的拼接干扰
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现将LLM特征通过纯输入拼接(而非联合训练)引入图神经网络时,会在同配基准上系统性地降低准确率,并提出了一个基于LLM单独判别性指标Delta_sig来预测拼接效果。
Comments 29 pages, 8 figures
新兴AI加速器上LLM推理的Prefill/Decode感知评估
机构 * Department of Computer Science(计算机科学系) ; San Francisco State University(旧金山州立大学) ; Argonne National Laboratory(阿贡国家实验室) ; Lawrence Berkeley National Laboratory(伯克利国家实验室)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过分离测量Prefill和Decode阶段,评估GPU与新兴AI加速器在Llama2-7B模型上的推理性能,发现GPU在计算密集的Prefill阶段占优,而GroqRack在Decode延迟上更优,但GPU随批处理增大在吞吐上反超。
Comments 8 pages, 5 figures. Accepted to the Workshop on HPC for AI Foundation Models & LLMs for Science (HPAI4S'26), co-located with IEEE IPDPS 2026
可信赖的自组合大数据即服务:一种LLM编排的多智能体框架,用于自动化数据工程、AutoML、MLOps部署和漂移感知生命周期优化
机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) ; Sirindhorn International Institute of Technology, Thammasat University(素金国际技术研究所,泰国 Thammasat 大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一种基于LLM编排的多智能体BDaaS框架,通过分解生命周期为专用智能体并协调执行,实现自动化数据工程、AutoML、MLOps部署和漂移感知优化,提升生命周期级可靠性。
Comments 7 pages, 3 figures, 5 tables
FacProcessTwin: 一种基于LLM的流程孪生开发系统
机构 * Swinburne University of Technology(斯winburne大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。
OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; National Taiwan University(国立台湾大学) ; Wuhan University(武汉大学) ; Wuhan University of Technology(武汉理工大学) ; Tsinghua University(清华大学) ; Jimei University(集美大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。
Comments 24 pages, 10 figures
并行化工具执行与LLM生成以实现低延迟代理服务
机构 * Shanghai Jiao Tong University(上海交通大学) ; Microsoft Research(微软研究院) ; Stevens Institute of Technology(Stevens 工程学院) ; Google(谷歌) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 提出PASTE系统,通过预测性执行未来工具调用与LLM生成并行,减少任务完成时间43.5%。
当LLM分析疤痕:从图像到临床有意义的特征
机构 * Liaoning University of Traditional Chinese Medicine(辽宁中医药大学) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出ScaFE框架,利用LLM作为知识驱动的特征工程师,将高维图像转化为低维临床可解释特征,在数据稀缺的疤痕分类中优于端到端深度学习方法。
RouteBalance: 面向异构LLM服务的融合模型路由与负载均衡
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 提出RouteBalance,通过融合模型路由与负载均衡为异构LLM服务实现质量、延迟和成本的三维联合优化,在13实例28GPU集群上达到最优前沿。
Comments 12 pages, 5 figures
ART:面向高效大语言模型解码的注意力运行时终止
机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) ; University of Central Florida(中央佛罗里达大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 提出注意力运行时终止(ART)机制,通过跟踪累积注意力输出并在贡献可忽略时终止后续KV块访问,在不显著影响准确率的情况下将大批量生成吞吐量提升20%。
理解LLM在标题-摘要筛选中的作用:从分歧到建议
机构 * University of Helsinki, Finland(赫尔辛基大学,芬兰) ; UFMS, Brazil(巴西UFMS) ; UTFPR – Federal University of Technology - Paraná, Brazil(巴西UTFPR – 法定技术大学-帕拉那) ; LUT University, Finland(芬兰LUT大学) ; Northern Arizona University, United States(美国北亚利桑那大学) ; UFAM, Brazil(巴西UFAM)
专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究通过定性分析LLM与人类在系统综述标题-摘要筛选中的分歧原因,提出改进建议,如验证语义理解、使用多个LLM和关注边界案例。
Comments 14 pages + references. Accepted for publication in the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026)
超越领域:通过可迁移交互模式重用网络技能
机构 * University of Michigan(密歇根大学) ; Alibaba Group(阿里巴巴集团) ; Purdue University(普渡大学) ; McMaster University(麦克马斯特大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SkillMigrator代理,通过学习可迁移交互模式(TIP)匹配布局结构而非元素引用,实现跨站点技能重用,在WebArena和Mind2Web上成功轨迹的LLM动作数减少8-10%。
Branch-and-Browse:具有树状推理与动作记忆的高效可控网页探索
机构 * University of Michigan(密歇根大学) ; Alibaba Group(阿里巴巴集团) ; McMaster University(麦马斯特大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Branch-and-Browse框架,通过树状结构化推理、网页状态重放和页面动作记忆,实现LLM网页代理的高效可控多分支探索,在WebArena上成功率35.8%,执行时间降低40.4%。
面向P2P网络的LLM分布式推理
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系)
专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI
AI总结 提出一种去中心化的前缀缓存感知路由方案,用于P2P网络中的LLM推理,通过本地基数树和异步反熵更新缓存信息,避免集中协调和KV缓存传输,在低延迟和偏斜前缀分布下提升性能。
CheckMIABench: 语言模型成员推理攻击的坚实基础
机构 * Harvard University(哈佛大学) ; Harvard Business School(哈佛商学院)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 为解决成员推理攻击评估中的分布偏移问题,提出基于训练中固定点前后数据同分布的基准框架,在Pythia和OLMo模型上评估多种攻击,并开源模块化库。
人工智能时代可持续的金属有机框架水收集器
机构 * Department of Chemistry, Washington University(华盛顿大学化学系) ; Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文探讨了金属有机框架(MOF)在干旱条件下水收集的设计原理,并介绍了人工智能(AI)、大语言模型(LLM)和数据挖掘如何加速高性能吸附剂的发现。
Comments 10 pages of main text, 26 total pages. 3 Figures and 1 Table of Content Graphic
MoSE: 混合可瘦身专家实现高效自适应语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed bin Zayed人工智能大学(MBZUAI)) ; Michigan State University (MSU), USA(密歇根州立大学(MSU)) ; Amazon Science, UK(亚马逊科学)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 提出MoSE架构,每个专家具有可变宽度的嵌套结构,支持在推理时连续调节精度-计算权衡,通过多宽度训练和轻量级测试时训练实现高效自适应。
Comments Accepted to ICML 2026