Persistence is All You Need -- A Topological Lens on Microstructural Characterization
持久性是全部所需——从拓扑学角度审视微结构表征
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出了一种结合计算拓扑与装配学习的回归方法,用于快速表征功能多孔材料的八个关键微结构描述符。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
持久性是全部所需——从拓扑学角度审视微结构表征
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出了一种结合计算拓扑与装配学习的回归方法,用于快速表征功能多孔材料的八个关键微结构描述符。
在 SE 3.0 中谁撰写文档?代理 vs. 人类文档拉取请求
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.SE
AI总结 研究发现 AI 代理在文档拉取请求中比人类更活跃,且其文档修改较少被人类跟进,引发对文档质量和人机协作的担忧。
Comments Comments: 5 pages, 5 figures. To appear in MSR 2026 Mining Challenge (April 2026). Code available at https://github.com/NAIST-SE/msr2026-docs-prs-replication
承诺、危险与(及时的)启发式方法用于挖掘编码代理活动
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本文探讨了编码代理在软件工程中的影响,分析了其快速采用带来的机遇与风险,并提出了研究此类代理活动的启发式方法。
Comments Preprint. Accepted for publication at MSR 2026
超越Bug修复:对代理生成拉取请求合并后代码质量问题的实证研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本研究通过分析代理生成的bug修复PR合并后代码质量问题,发现代码异味主导,且合并成功不等于代码质量高,需系统化质量检查。
我们是否都在以相同的方式使用代理?核心和边缘开发者对编码代理使用的一次实证研究
专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE
AI总结 本文通过实证研究发现,核心和边缘开发者在使用编码代理时存在差异,核心开发者更关注文档和测试,而边缘开发者更频繁使用代理进行任务分配。
Editrail: 通过可视化学生与AI交互理解AI的使用
专题命中 软件智能体 :workflow(abstract)
AI总结 Editrail通过可视化学生与AI的交互,帮助教师理解AI在代码编写中的使用情况,从而优化教学策略和干预措施。
OmegaUse:构建一个通用的 GUI 代理以实现自主任务执行
机构 * Baidu Frontier Research Department(百度前沿研究部)
专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI
AI总结 OmegaUse 是一种通用 GUI 代理模型,通过高质量数据和解耦训练方法实现跨平台自主任务执行,展现卓越的 GUI 任务性能。
Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互
机构 * Yunnan University(云南大学) ; Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Southeast University(东南大学) ; Chongqing University(重庆大学) ; Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL
AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。
UI Remix:通过交互式示例检索与混搭支持 UI 设计
专题命中 GUI与网页智能体 :workflow(abstract)
AI总结 UI Remix 通过交互式示例检索与混搭,帮助终端用户更高效地进行移动UI设计,提升设计可控性与信任度。
Comments Accepted at the 31st International Conference on Intelligent User Interfaces (IUI 2026)
基于大脑的多智能体记忆框架 BMAM
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; Institute of Science Tokyo(东京科学研究所) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL
AI总结 BMAM 提出了一种基于大脑认知机制的多智能体记忆框架,通过分解记忆为事件型、语义型等子系统,提升长时间交互中的信息保持和行为一致性,实验显示其在 LoCoMo 基准上达到 78.45% 的准确率。
Comments Submitted to ACL (ARR 2026 January submission); non-anonymous preprint
Mem2ActBench: 一个评估面向任务的自主代理长期记忆利用的基准
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 记忆与上下文管理 :autonomous agent(title);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 Mem2ActBench是一个评估自主代理利用长期记忆执行任务能力的基准,通过合成工具使用任务验证记忆应用的有效性。
具有序列计划反思和候选交叉的深度研究员(深度研究员反思进化)
机构 * Saurav Prateek(独立研究者)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 深度研究员通过序列计划反思和候选交叉算法,实现对博士级别研究任务的高效处理,取得优于现有方法的性能。
Comments 11 pages, 6 figures, 2 tables, source code: https://github.com/SauravP97/deep-researcher-reflect-evolve/
学习一个变化的状态
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文研究了在状态随时间变化时,贝叶斯代理人如何选择信号精度以平衡成本和信息性,比较了布朗运动和其他高斯过程下的最优策略。
Comments 23 pages; 2 figures. V2 fixes typos/grammar, adds some references, and removes some footnotes
AI能否掌握计量经济学?来自计量经济学AI代理在专家级任务上的证据
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出MetricsAI,一个基于MetaGPT框架的计量经济学AI代理,通过实证分析展示其在专家级任务中超越传统模型的能力,推动社会科学研究的智能化与教育应用。
HeuriGym: 一个用于评估LLM生成启发式算法的代理基准
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)
AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。
Comments Accepted to ICLR'26
陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理
机构 * UC Irvine(加州大学欧文分校) ; Cohere(Cohere公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。
代理基准测试未能满足公共部门要求
机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) ; Centre for Digital Governance, Hertie School(数字治理中心) ; Weizenbaum Institute(魏泽瑙研究所) ; Technical University of Munich(慕尼黑技术大学)
专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI
AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。
Comments Forthcoming @ IASEAI 2026
ECG-Agent: 用于ECG多轮对话的设备端工具调用代理
机构 * KAIST(韩国科学技术院) ; Ajou University School of Medicine(全州大学医学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。
Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)
预测市场中的操控:基于代理的建模实验
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过基于代理的模拟实验,探讨了高预算代理如何在预测市场中引入价格扭曲,并分析了市场中从众行为和学习率对价格波动的影响。
Comments Open source code for the agent-based model and Dash application available at https://github.com/ebbam/power_prediction/ 14 pages, 4 figures
适应强化学习智能体的行为以应对变化的动作空间和奖励函数
机构 * Trinity College Dublin(都柏林三一学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 MORPHIN通过动态调整超参数和概念漂移检测,实现强化学习智能体在变化的奖励函数和动作空间中的自适应学习,提升收敛速度和学习效率。
Journal ref 2025 IEEE International Conference on Autonomic Computing and Self-Organizing Systems Companion (ACSOS-C), Tokyo, Japan, 2025, pp. 148-153
注意差距:人类与LLM生成任务之间的差异
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究揭示了人类与LLM在任务生成中的核心差异,指出人类受心理驱动影响,而LLM在生成具身目标方面存在不足。
YNTP-100: 一个用于下一步令牌预测的基准,包含100人
机构 * Kyoto University(京都大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。
显然策略证明的多维分配与选择的价值
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了主导者如何通过委托部分控制权给代理人来优化多维分配,并提出了一类显然策略证明的机制以提高效率。
具有可调对齐角度的自驱动粒子集体行为
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种具有可调对齐角度的自驱动粒子模型,通过数值模拟发现其在特定参数范围内表现出反平行带等独特集体行为,揭示了多体相互作用对向列序的破坏作用。
Comments 7 pages, 5 figures
Journal ref Phys. Rev. E 113, 015411 (2026)
价值增强的人口合成:整合动机层
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出价值增强的人口合成框架,通过整合动机层提升社会模拟中代理行为的决策机制,生成保留真实人口分布的合成人口。
模型与仿真
专题命中 Agent评测 :agent(abstract)
AI总结 本书介绍了自1970年代以来的建模与仿真方法,涵盖社会科学、风险管理及云信息系统的应用,并总结了基于代理的仿真方法。
Comments in Turkish language. Published journal version available at the publisher website
Journal ref Teorik ve Uygulamali Muhendislik Calismalari, IKSAD, vol. 1, no. 1, pp. 135-156, Dec. 2021