World Craft: Agentic Framework to Create Visualizable Worlds via Text
World Craft: 一种通过文本创建可视化世界的代理框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
World Craft: 一种通过文本创建可视化世界的代理框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。
基于大语言模型的少样本早期谣言检测与模仿代理
机构 * Singapore Management University(新加坡管理大学) ; Hong Kong Baptist University(香港 Baptist大学)
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出基于自主代理和大语言模型的少样本早期谣言检测框架,通过轻量级代理提升效率,实现准确性和早熟性的提升。
Comments Accepted at KDD 2026
DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析
机构 * Peking University(北京大学)
专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。
迈向鲁棒的口吃语音识别:LLM代理在WER之外的ASR后修正
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出基于LLM的代理用于ASR后修正,通过语义校正提升口吃语音识别的鲁棒性,实现WER降低和语义性能提升。
Comments Accepted to ICASSP 2026
MADE:用于闭环材料发现的基准环境
机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) ; Diffractive Labs ; Machine Learning Research Group, Department of Engineering Science, University of Oxford(机器学习研究组,工程科学系,牛津大学) ; Thomas Young Centre(托马斯·杨中心) ; Department of Materials, Imperial College London(材料系,伦敦帝国学院)
专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.LG
AI总结 MADE提出了一种闭环材料发现的基准框架,通过模拟受限预算下的材料发现流程,评估发现算法的有效性和效率,并支持灵活的工作流研究。
Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法
机构 * Google(谷歌) ; Google DeepMind(谷歌DeepMind) ; Cornell University(康奈尔大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。
Comments Accepted to C4ML@CGO'26
OpenDerisk: 一个面向AI驱动SRE的工业框架,包含设计、实现与案例研究
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 OpenDerisk是一个专为SRE设计的开源多智能体框架,通过整合诊断协作模型、推理引擎和知识引擎,实现复杂问题的自动化解决,已在蚂蚁集团大规模部署并验证其高效性和可扩展性。
Comments 23 pages
DeepSearchQA:弥合深度研究代理的全面性差距
机构 * Google(谷歌)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL
AI总结 DeepSearchQA通过设计具有挑战性的多步骤信息检索任务,评估代理在复杂搜索计划中的全面性能力,揭示当前代理在高召回与精确性平衡上的局限性。
Comments DeepSearchQA can be found at https://www.kaggle.com/benchmarks/google/dsqa/leaderboard
低扫描傅里叶变换红外光谱的去噪与基线校正:深度学习模型与传统信号处理的基准测试
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种物理引导的级联Unet模型,通过分离去噪和基线校正任务,有效提升FTIR成像速度和精度,实现51.3%的RMSE降低。
强化学习用于量子电路优化传递的自适应组合
机构 * Quantinuum
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出利用强化学习自适应组合量子电路优化传递,有效提升优化效果。
Comments 14 pages, 7 figures
双头胜于单头:通过特征分解和混合将大语言模型特征蒸馏到小模型中
机构 * Peking university(北京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出CMM框架,通过特征分解和混合将大语言模型特征蒸馏到小模型中,提升市场做市效率。
Comments accepted by AAAI2026
具有稀有优化更新的随机匹配老虎机
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种批量算法,通过限制匹配更新次数来减少计算开销,同时在随机匹配老虎机中实现O(√T)的遗憾界。
LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用
机构 * United Nations University Institute in Macau(联合国大学澳门研究所) ; IBM Research(IBM研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。
Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work
当LLMs玩电话游戏:文化吸引子作为评估多轮设置中LLM的观念工具
机构 * Inria(法国国家信息与自动化研究所) ; Université de Bordeaux(波尔多大学) ; MIT(麻省理工学院) ; Computational Cognitive Science Lab(计算认知科学实验室) ; University of California, Berkeley(加州大学伯克利分校) ; Institute for Advanced Study in Toulouse(图卢兹高级研究学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文通过电话游戏实验揭示LLM多轮交互中的信息失真与吸引子现象,探讨初始文本、指令等对吸引子效应的影响。
Comments Code available at https://github.com/jeremyperez2/TelephoneGameLLM. Companion website with a Data Explorer tool at https://sites.google.com/view/telephone-game-llm . This paper was published at the 2025 International Conference on Learning Representations (ICLR2025) https://iclr.cc/virtual/2025/poster/28880
迈向通用的城市生活方式模拟
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种可扩展且通用的城市生活方式模拟框架,通过模拟日常活动生成模式,并验证了其在不同城市中的有效性,适用于城市系统中的多种场景分析。
听觉具身化对话代理:空间化和情境音频线索对沉浸感和社会感知的影响
专题命中 Agent评测 :agent(abstract)
AI总结 本研究探讨了通过空间化音频和情境声音线索提升对话代理沉浸感和社交感知的方法,发现空间化和 Foley 增强共在感但降低对代理注意力的感知。
Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain
DrivIng: 一个具有完整数字孪生集成的大规模多模态驾驶数据集
机构 * Department of Computer Science and AImotion Bavaria, Technische Hochschule Ingolstadt(计算机科学系和AImotion巴伐利亚,因斯布鲁克大学) ; School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)
专题命中 Agent评测 :agent(abstract)
AI总结 DrivIng是一个具有完整数字孪生集成的大规模多模态驾驶数据集,提供高精度定位和多传感器数据,用于自动驾驶感知算法的评估和仿真到现实测试。
Comments Copyright 2026 IEEE. This is the accepted manuscript (postprint), not the final published version. For code and dataset, see https://github.com/cvims/DrivIng
小模型,大威胁:从低计算量AI模型中characterizing安全挑战
专题命中 Agent评测 :agentic(abstract)
AI总结 本文指出低计算量AI模型因性能提升而变得危险,需加强安全防护以应对新兴威胁。
Comments 11 pages, 4 figures
一般彩票游戏中的联盟机制
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了联盟一般彩票游戏中三种联盟机制的差异,发现预算转移和联合转移在集体改进方面等价,但相互改进方面存在本质不同。
关于Riccati方程解的数据稀疏性及其在反馈控制中的应用
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出两种高效求解Riccati方程的算法,利用解的数值拟分离性,应用于反馈控制问题,验证了算法在不同场景下的有效性。