arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-13 至 2026-08-13 共收录 165 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 17 篇

2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11225 2026-08-13 cs.AI 新提交 57%

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

来自外部的身份:AI人格克隆的概念框架与研究计划

Luc E. Brunet

机构 * R&D Mediation(调解研发部)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12195 2026-08-13 cs.HC 新提交 50%

IF:CARGO: LLM-Based Semantic Compilation for Al-Native Rule Programming Games

IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译

Ting-Chen Hsu, Lianye Zhang, Jiangxu Lin, Zhaoyi Yu, Fei Qin, Zihao Chen

专题命中 软件智能体 :agent(abstract)

AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。

Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11932 2026-08-13 math.OC 新提交 50%

Joint Identifiability and Conditioning in Finite-Horizon Continuous-Time Inverse LQR with Unknown Dynamics

未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束

Meiling Yu, Yuan-Hua Ni, Lei Jiang

专题命中 软件智能体 :agent(abstract)

AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 2 篇

2608.11588 2026-08-13 cs.AI 新提交 83%

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUI:面向未知GUI应用的工作流上下文与策略联合适配

Linqiang Guo, Li Gu, Zihuan Jiang, Zhixiang Chi, Siobhan Reid, Ziqiang Wang, Yuanhao Yu, Wei Liu, Yang Wang, Tse-Hsun, Chen

机构 * Li Gu(李谷(音译))

专题命中 GUI与网页智能体 :workflow(title,abstract);agent(abstract);分类 cs.AI

AI总结 CoAdapt-GUI框架通过联合适配工作流上下文与策略,在有限交互预算无目标演示的未知GUI应用场景下,将AndroidWorld泛化性能提至45.0%、AndroidWorld Plus提至52.9%,优于仅策略TTA基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11901 2026-08-13 cs.RO 新提交 50%

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 9 篇

2608.11224 2026-08-13 cs.AI cond-mat.mtrl-sci cs.CE cs.CL cs.MA 新提交 84%

Harnessing agent memory to build lifelong AI partners for materials scientists

利用智能体记忆构建面向材料科学家的终身AI合作伙伴

Siyu Liu, Bo Hu, Beilin Ye, He Cao, David J. Srolovitz, Tongqi Wen

机构 * The University of Hong Kong(香港大学) Materials Innovation Institute for Life Sciences and Energy (MILES), HKU-SIRI(香港大学-深圳国际研究院生命科学与能源材料创新研究院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 记忆与上下文管理 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出一种自进化记忆框架,可跨模型迁移材料研究经验,使GPT-5.2任务成功率翻倍,减少重复错误,降低材料模拟工作流程的追踪负担与工具调用次数。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11632 2026-08-13 cs.MA cs.AI 新提交 83%

Beyond Memory: A Transactional Continuity Kernel for Long-Lived AI Agents

超越记忆:面向长生命周期智能体的事务连续性内核

Jun He, Deying Yu

专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对长生命周期AI智能体的状态治理风险,提出连续性内核(CK)激活合约,通过解耦候选评估与状态激活,验证协议在大规模状态空间上无不变量违反。

Comments 9 pages, 6-page appendix, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11654 2026-08-13 cs.LG 新提交 79%

Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem

迈向智能体记忆的形式化定义:基础、跨度、最优性与序列记忆问题

Hongyao Tang

机构 * Tianjin University(天津大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.LG

AI总结 本文提出智能体记忆的形式化定义,定义最优记忆为容量受限的期望覆盖最大化器,实例化于《奥德赛》并将现有系统纳入框架,使记忆质量可度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01138 2026-08-13 cs.CR cs.AI cs.DC 版本更新 79%

memorywire: A Vendor-Neutral Wire Format for Agent Memory Operations

AMP:一种用于智能体内存操作的供应商中立线格式

Thamilvendhan Munirathinam

机构 * Independent Researcher(独立研究者)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 提出一种基于JSON-Schema 2020-12的供应商中立线格式memorywire,支持五种内存操作和四种内存类型,通过参考实现和基准测试验证其性能与兼容性。

Comments 18 pages, 1 figure, 6 tables. v4: PurgeBench is a companion benchmark by the same author (previously called "external"), plus a threats-to-validity note; no results changed. v3 added the memory-poison recovery evaluation and recover tool. Code: github.com/mthamil107/memorywire

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11879 2026-08-13 cs.CL cs.IR 新提交 74%

Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

全量召回的代价是什么?智能体记忆系统的服务成本基准测试

Natchanon Pollertlam, Witchayut Kornsuwannawit

机构 * Bricks Technology(布里克科技)

专题命中 记忆与上下文管理 :agentic(title);分类 cs.CL

AI总结 本研究基准测试 Mem0 等三种智能体记忆系统的服务成本,对比固定窗口与全量重发策略,发现其成本受内部行为驱动,且无系统同时在成本与准确率上占优。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14401 2026-08-13 cs.AI cs.DB 版本更新 70%

Credo: Declarative Control of LLM Pipelines via Beliefs and Policies

Credo:通过信念和策略实现LLM流水线的声明式控制

Duo Lu, Andrew Crotty, Uğur Çetintemel

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Credo,通过声明式策略和信念管理LLM流水线的决策,实现可适应、可审计和可组合的执行。

Comments VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11340 2026-08-13 cs.NI cs.AI 新提交 57%

Self-evolving network verifiers

自演进网络验证器

Ioannis Protogeros, Tibor Schneider, Laurent Vanbever

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11248 2026-08-13 cs.AI cs.MA 新提交 57%

EvoGraph-Mem: Failure-Aware Editable Graph Memory for Long-Term Language Agents

EvoGraph-Mem:面向长期语言智能体的故障感知可编辑图记忆

Yuxi Qian, Yuxiang Ren

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文针对长期语言智能体的记忆污染问题,提出故障感知可编辑图记忆框架,通过见解节点跟踪与图级编辑优化记忆,实验显示其性能优于现有记忆增强智能体基线。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11436 2026-08-13 cs.CR 新提交 50%

When Agents Talk: Honeytokens under Shared Memory

当智能体对话时:共享内存下的蜜罐

Joshua S. Gans

专题命中 记忆与上下文管理 :AI agent(abstract)

AI总结 该研究通过2026年网络能力评估案例,分析共享内存下蜜罐的安全缺陷,提出将令牌身份存于私有引用监视器等架构应对方案,指出蜜罐仍需单独安全边界。

Comments artificial intelligence, cybersecurity, honeytokens, defensive deception, shared memory, intrusion detection

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 28 篇

2608.11596 2026-08-13 eess.SP 新提交 88%

Small Language Model enabled Autonomous agent for Language-Conditioned Cognitive Radar

基于小型语言模型的语言条件认知雷达自主智能体

Minhaj Uddin Ahmad, Zakia Zaman, Shunqiao Sun, Mizanur Rahman

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract)

AI总结 本文提出一种小型语言模型驱动的自主智能体框架,作为语言条件认知雷达的智能控制器,经实验验证可在多种雷达场景下完成算法选择,且雷达特定提示与基于物理的工具执行是可靠决策的必要条件。

Comments Accepted at MLSP 2026, ATL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11469 2026-08-13 cs.CR cs.AI cs.SE 新提交 84%

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

智能体网络安全的下一个挑战:一个现实、无污染的逆向工程基准

Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对智能体逆向工程基准的缺陷,构建SRE-Bench基准,评估五款前沿LLMs的逆向工程能力,发现RE仍未解决,强调其为智能体网络安全重要前沿及SRE-Bench的测试价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11236 2026-08-13 cs.CL cs.AI 新提交 84%

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

TRACE Bench:任务驱动的角色扮演智能体清单评估基准

Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

机构 * Kuaishou GameMind Lab(快手GameMind实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。

Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11679 2026-08-13 cs.AI cs.IR cs.MA 新提交 83%

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) Auburn University(奥本大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新 83%

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23300 2026-08-13 q-fin.PM cs.AI cs.MA q-fin.ST 版本更新 83%

Designing Agentic AI-Based Screening for Portfolio Investment

基于代理AI的资产组合投资筛选设计

Mehmet Caner, Agostino Capponi, Nathan Sun, Jonathan Y. Tan

机构 * North Carolina State University, Nelson Hall, Department of Economics(北卡罗来纳州立大学,Nelson Hall,经济学系) Columbia University. Department of Industrial Engineering and Operations Research and Columbia Business School(哥伦比亚大学,工业工程与运筹学系及哥伦比亚商学院) Columbia University. Department of Industrial Engineering and Operations Research(哥伦比亚大学,工业工程与运筹学系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的资产组合投资筛选框架,通过两个专用代理筛选优质公司并生成买卖信号,结合高维精度矩阵估计确定最优权重,实验证明其在S&P 500数据上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11434 2026-08-13 cs.AI cs.CL cs.CV 新提交 81%

Benchmarking LLM Judges for Mobile Agent Evaluation

面向移动智能体评估的LLM评判基准测试

Ziqiang Wang, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang

机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) Shanghai University(上海大学) McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究推出MobileJudgeBench基准,评估6种LLM评判器方法在移动智能体轨迹上的可靠性,发现简单基线评判器具竞争力、基准质量指标可预测评判器效用,且不同LLM后端故障特征相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12002 2026-08-13 cs.AI 新提交 79%

CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations

CTBench:评估AI智能体在真实电信网络运维中的故障排查能力

Xingyu Yan, Tingting Dai, Antonio De Domenico, Mohamed Sana, Nicola Piovesan, Changchang Li, Bowen Liu, Kun Jiang, Mengjie Zhang, Dingcheng Shan, Jing-Cheng Pang, Chenwei Wu, Sijie Wu, Lianying Chao, Haoran Cai, Jiantao Ye, Xubin Li, Simon Mark Lucas, Xin Chen

机构 * Huawei Technologies(华为技术有限公司) Paris Research Center, Huawei Technologies(华为技术有限公司巴黎研究中心) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本研究提出CTBench基准,评估AI智能体的电信故障排查能力,发现其路径恢复表现好于根本原因分析,且资源消耗与诊断效果无必然关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11683 2026-08-13 cs.AI cs.CL 新提交 79%

FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents

FrontierFinance:用于衡量金融智能体前沿智能的具有挑战性的基准

Yuhao Zhang, O. Ozan Koyluoglu, Thejas Venkatesh, Richard Diehl Martinez, Vishank Bhatia, Arash Alidoust, Ashwin Paranjape

机构 * Samaya AI(萨马亚人工智能公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究推出覆盖投资者全流程的FrontierFinance基准,评估发现工具框架影响智能体表现,Samaya内部系统最优,开源模型Kimi K3成本更低且接近专有模型,最难用例为筛选与发现等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01039 2026-08-13 cs.CR cs.AI 版本更新 77%

Evaluation and Hardening of LLM System Instructions Against Extraction via Encoding Attacks

用于评估和加固LLM系统指令对抗编码攻击的自动化框架

Anubhab Sahu, Diptisha Samanta, Reza Soosahabi

机构 * Keysight Technologies

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出自动化框架评估LLM系统指令在对抗编码攻击时的保密性,通过四个模型和46条指令测试发现结构化序列化攻击成功率高,提出基于Chain-of-Thought的缓解策略。

Comments An earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12246 2026-08-13 cs.CR cs.AI cs.CL cs.SE 新提交 75%

VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

VICBench:一个用于代码漏洞检测的多语言基准测试集

Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha Rungta

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究构建了多语言代码漏洞检测基准VICBench,包含100个CVE对应的VIC,规模显著大于现有数据集,经评估现有漏洞检测算法性能有限,该基准可用于可靠评估漏洞检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 73%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12310 2026-08-13 cs.CL cs.AI 版本更新 73%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-13 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 73%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 70%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏