arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-30 至 2026-01-30 共收录 112 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 7 篇

2512.15824 2026-01-30 cs.AI 57%

State-Augmented Graphs for Circular Economy Triage

具有状态增强的图用于循环经济分拣

Richard Fox, Rui Li, Gustav Jonsson, Farzaneh Goli, Miying Yang, Emel Aktas, Yongjing Wang

机构 * Department of Mechanical Engineering, University of Birmingham(布里斯托尔大学机械工程系) School of Management, Cranfield University(克兰菲尔德大学管理学院)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于状态增强图的决策框架,用于优化循环经济分拣决策,通过递归评估和条件感知效用实现灵活的分拣策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01429 2026-01-30 cs.LG 57%

An Algorithm for Fixed Budget Best Arm Identification with Combinatorial Exploration

带组合探索的固定预算最佳臂识别算法

Siddhartha Parupudi, Gourab Ghatak

机构 * Department of Electrical Engineering, IIT Delhi(电子工程系,德里理工学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出一种带组合探索的固定预算最佳臂识别算法,通过构建log2K个组并执行似然比检验来确定最佳臂,基于新参数H4推导误差上界,并在特定情况下优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 20 篇

2601.09150 2026-01-30 cs.HC 85%

World Craft: Agentic Framework to Create Visualizable Worlds via Text

World Craft: 一种通过文本创建可视化世界的代理框架

Jianwen Sun, Yukang Feng, Kaining Ying, Chuanhao Li, Zizhen Li, Fanrui Zhang, Jiaxin Ai, Yifan Chang, Yu Dai, Yifei Huang, Kaipeng Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18352 2026-01-30 cs.CL cs.AI 84%

LLM-based Few-Shot Early Rumor Detection with Imitation Agent

基于大语言模型的少样本早期谣言检测与模仿代理

Fengzhu Zeng, Qian Shao, Ling Cheng, Wei Gao, Shih-Fen Cheng, Jing Ma, Cheng Niu

机构 * Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于自主代理和大语言模型的少样本早期谣言检测框架,通过轻量级代理提升效率,实现准确性和早熟性的提升。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 83%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21347 2026-01-30 eess.AS cs.SD 78%

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

迈向鲁棒的口吃语音识别:LLM代理在WER之外的ASR后修正

Xiuwen Zheng, Sixun Dong, Bornali Phukon, Mark Hasegawa-Johnson, Chang D. Yoo

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于LLM的代理用于ASR后修正,通过语义校正提升口吃语音识别的鲁棒性,实现WER降低和语义性能提升。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20996 2026-01-30 cs.LG cond-mat.mtrl-sci 77%

MADE: Benchmark Environments for Closed-Loop Materials Discovery

MADE:用于闭环材料发现的基准环境

Shreshth A Malik, Tiarnan Doherty, Panagiotis Tigas, Muhammed Razzak, Stephen J. Roberts, Aron Walsh, Yarin Gal

机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) Diffractive Labs Machine Learning Research Group, Department of Engineering Science, University of Oxford(机器学习研究组,工程科学系,牛津大学) Thomas Young Centre(托马斯·杨中心) Department of Materials, Imperial College London(材料系,伦敦帝国学院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.LG

AI总结 MADE提出了一种闭环材料发现的基准框架,通过模拟受限预算下的材料发现流程,评估发现算法的有效性和效率,并支持灵活的工作流研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21096 2026-01-30 cs.AI cs.LG cs.PL 73%

Magellan: Autonomous Discovery of Novel Compiler Optimization Heuristics with AlphaEvolve

Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法

Hongzheng Chen, Alexander Novikov, Ngân Vũ, Hanna Alam, Zhiru Zhang, Aiden Grossman, Mircea Trofin, Amir Yazdanbakhsh

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。

Comments Accepted to C4ML@CGO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13561 2026-01-30 cs.SE cs.AI 73%

OpenDerisk: An Industrial Framework for AI-Driven SRE, with Design, Implementation, and Case Studies

OpenDerisk: 一个面向AI驱动SRE的工业框架,包含设计、实现与案例研究

Peng Di, Faqiang Chen, Xiao Bai, Hongjun Yang, Qingfeng Li, Ganglin Wei, Jian Mou, Feng Shi, Keting Chen, Peng Tang, Zhitao Shen, Zheng Li, Wenhui Shi, Junwei Guo, Hang Yu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 OpenDerisk是一个专为SRE设计的开源多智能体框架,通过整合诊断协作模型、推理引擎和知识引擎,实现复杂问题的自动化解决,已在蚂蚁集团大规模部署并验证其高效性和可扩展性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20975 2026-01-30 cs.CL 70%

DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents

DeepSearchQA:弥合深度研究代理的全面性差距

Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 DeepSearchQA通过设计具有挑战性的多步骤信息检索任务,评估代理在复杂搜索计划中的全面性能力,揭示当前代理在高召回与精确性平衡上的局限性。

Comments DeepSearchQA can be found at https://www.kaggle.com/benchmarks/google/dsqa/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20905 2026-01-30 eess.IV cs.AI cs.CV cs.LG eess.SP 62%

Denoising and Baseline Correction of Low-Scan FTIR Spectra: A Benchmark of Deep Learning Models Against Traditional Signal Processing

低扫描傅里叶变换红外光谱的去噪与基线校正:深度学习模型与传统信号处理的基准测试

Azadeh Mokari, Shravan Raghunathan, Artem Shydliukh, Oleg Ryabchykov, Christoph Krafft, Thomas Bocklitz

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种物理引导的级联Unet模型,通过分离去噪和基线校正任务,有效提升FTIR成像速度和精度,实现51.3%的RMSE降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21629 2026-01-30 quant-ph cs.LG 57%

Reinforcement Learning for Adaptive Composition of Quantum Circuit Optimisation Passes

强化学习用于量子电路优化传递的自适应组合

Daniel Mills, Ifan Williams, Jacob Swain, Gabriel Matos, Enrico Rinaldi, Alexander Koziell-Pipe

机构 * Quantinuum

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出利用强化学习自适应组合量子电路优化传递,有效提升优化效果。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07110 2026-01-30 cs.AI 57%

Two Heads are Better than One: Distilling Large Language Model Features Into Small Models with Feature Decomposition and Mixture

双头胜于单头:通过特征分解和混合将大语言模型特征蒸馏到小模型中

Tianhao Fu, Xinxin Xu, Weichen Xu, Jue Chen, Ruilong Ren, Bowen Deng, Xinyu Zhao, Jian Cao, Xixin Cao

机构 * Peking university(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出CMM框架,通过特征分解和混合将大语言模型特征蒸馏到小模型中,提升市场做市效率。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04194 2026-01-30 stat.ML cs.LG 57%

Stochastic Matching Bandits with Rare Optimization Updates

具有稀有优化更新的随机匹配老虎机

Jung-hun Kim, Min-hwan Oh

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种批量算法,通过限制匹配更新次数来减少计算开销,同时在随机匹配老虎机中实现O(√T)的遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03827 2026-01-30 cs.AI 57%

What Would an LLM Do? Evaluating Large Language Models for Policymaking to Alleviate Homelessness

LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用

Pierre Le Coz, Jia An Liu, Debarun Bhattacharjya, Georgina Curto, Serge Stinckwich

机构 * United Nations University Institute in Macau(联合国大学澳门研究所) IBM Research(IBM研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。

Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04503 2026-01-30 physics.soc-ph cs.AI cs.MA 57%

When LLMs Play the Telephone Game: Cultural Attractors as Conceptual Tools to Evaluate LLMs in Multi-turn Settings

当LLMs玩电话游戏:文化吸引子作为评估多轮设置中LLM的观念工具

Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

机构 * Inria(法国国家信息与自动化研究所) Université de Bordeaux(波尔多大学) MIT(麻省理工学院) Computational Cognitive Science Lab(计算认知科学实验室) University of California, Berkeley(加州大学伯克利分校) Institute for Advanced Study in Toulouse(图卢兹高级研究学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过电话游戏实验揭示LLM多轮交互中的信息失真与吸引子现象,探讨初始文本、指令等对吸引子效应的影响。

Comments Code available at https://github.com/jeremyperez2/TelephoneGameLLM. Companion website with a Data Explorer tool at https://sites.google.com/view/telephone-game-llm . This paper was published at the 2025 International Conference on Learning Representations (ICLR2025) https://iclr.cc/virtual/2025/poster/28880

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22099 2026-01-30 physics.soc-ph 50%

Towards Universal Urban Patterns-of-Life Simulation

迈向通用的城市生活方式模拟

Sandro M. Reia, Henrique F. de Arruda, Shiyang Ruan, Taylor Anderson, Hamdi Kavak, Dieter Pfoser

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种可扩展且通用的城市生活方式模拟框架,通过模拟日常活动生成模式,并验证了其在不同城市中的有效性,适用于城市系统中的多种场景分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22082 2026-01-30 cs.HC 50%

Auditorily Embodied Conversational Agents: Effects of Spatialization and Situated Audio Cues on Presence and Social Perception

听觉具身化对话代理:空间化和情境音频线索对沉浸感和社会感知的影响

Yi Fei Cheng, Jarod Bloch, Alexander Wang, Andrea Bianchi, Anusha Withana, Anhong Guo, Laurie M. Heller, David Lindlbauer

专题命中 Agent评测 :agent(abstract)

AI总结 本研究探讨了通过空间化音频和情境声音线索提升对话代理沉浸感和社交感知的方法,发现空间化和 Foley 增强共在感但降低对代理注意力的感知。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15260 2026-01-30 cs.CV 50%

DrivIng: A Large-Scale Multimodal Driving Dataset with Full Digital Twin Integration

DrivIng: 一个具有完整数字孪生集成的大规模多模态驾驶数据集

Dominik Rößle, Xujun Xie, Adithya Mohan, Venkatesh Thirugnana Sambandham, Daniel Cremers, Torsten Schön

机构 * Department of Computer Science and AImotion Bavaria, Technische Hochschule Ingolstadt(计算机科学系和AImotion巴伐利亚,因斯布鲁克大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract)

AI总结 DrivIng是一个具有完整数字孪生集成的大规模多模态驾驶数据集,提供高精度定位和多传感器数据,用于自动驾驶感知算法的评估和仿真到现实测试。

Comments Copyright 2026 IEEE. This is the accepted manuscript (postprint), not the final published version. For code and dataset, see https://github.com/cvims/DrivIng

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21365 2026-01-30 cs.CY 50%

Small models, big threats: Characterizing safety challenges from low-compute AI models

小模型,大威胁:从低计算量AI模型中characterizing安全挑战

Prateek Puri

专题命中 Agent评测 :agentic(abstract)

AI总结 本文指出低计算量AI模型因性能提升而变得危险,需加强安全防护以应对新兴威胁。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21319 2026-01-30 cs.GT 50%

Alliance Mechanisms in General Lotto Games

一般彩票游戏中的联盟机制

Vade Shah, Jason R. Marden

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了联盟一般彩票游戏中三种联盟机制的差异,发现预算转移和联合转移在集体改进方面等价,但相互改进方面存在本质不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16569 2026-01-30 math.NA cs.NA 50%

On the data-sparsity of the solution of Riccati equations with applications to feedback control

关于Riccati方程解的数据稀疏性及其在反馈控制中的应用

Stefano Massei, Luca Saluzzi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出两种高效求解Riccati方程的算法,利用解的数值拟分离性,应用于反馈控制问题,验证了算法在不同场景下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏