Practical challenges of control monitoring in frontier AI deployments
前沿AI部署中的控制监控实际挑战
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文探讨了前沿AI部署中控制监控面临的实际挑战,分析了同步、半同步和异步监控方案,并通过案例研究探讨了监督、延迟和恢复等关键问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
前沿AI部署中的控制监控实际挑战
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文探讨了前沿AI部署中控制监控面临的实际挑战,分析了同步、半同步和异步监控方案,并通过案例研究探讨了监督、延迟和恢复等关键问题。
信号窃听者:利用DRL引导的反射阵列增强无线接收
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出基于DRL的反射阵列控制方法,通过多智能体强化学习提升非视线场景下的无线信号接收性能。
下一代网络中的网络韧性:威胁图景、理论基础与设计范式
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本书探讨下一代网络中网络韧性的重新概念化与工程化,通过零信任架构、博弈论威胁建模和AI技术,应对复杂威胁挑战。
面向路牌的视觉问答:ViSignVQA数据集、方法与基准
机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) ; Vietnam National University(越南国家大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。
Comments Dataset paper; code and data will be released
字典学习:通过反馈学习稀疏叠加特征的复杂性
机构 * Department of Computer Science \& Engineering, University of California, San Diego, USA
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 通过反馈机制,研究在稀疏设置下学习字典特征的复杂性,并验证了理论结果在特征恢复和字典提取中的有效性。
Comments ICML'25, 35 pages
ClinDEF: 一种用于大语言模型临床推理的动态评估框架
机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ; ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) ; AntGroup(蚂蚁集团)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。
Comments 23 pages, 4 figures, under review
可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。
Comments 27 pages, 16 figures
TCEval:利用热舒适性评估人工智能的认知与感知能力
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。
三值评分下的三方面冲突分析可行策略
机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) ; Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering(湖南省工程数学建模与分析重点实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出基于一致性和不一致性度量的三值评分冲突分析方法,通过计算代理团评分和加权度量,系统识别可行策略和最优解,优于现有方法。
Journal ref International Journal of Approximate Reasoning 185, 109516, 2025
可操作的无信号约束及其影响
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种统一框架,研究相对论时空中的非局部和时间相关性,探讨了无信号约束的违反及其对因果循环和超光速信号的反驳。
Comments Comments are welcome!
识别阻碍生成式人工智能作为工作同事接受度的障碍,使用新的AGAWA量表
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出AGAWA量表,用于测量学生对生成式人工智能作为工作同事的态度,发现积极态度与三个因素呈负相关,且因素间呈正相关,揭示了信任与职场AI态度的关系。
MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?
机构 * Tsinghua University(清华大学) ; Nankai University(南开大学) ; Northwest Polytechnical University(西北工业大学) ; Chinese Academy of Sciences(中国科学院) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 Agent评测 :planning(abstract)
AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。
Comments 25 pages
最优依赖与报酬的设计
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了在两期委托-代理模型中,预算约束下通过最优报酬方案和成本相关结构设计提升代理表现的机制,发现低预算时应采用充分表现目标,高预算时应采用持续表现目标,负成本相关性在两者中均有益。
多地点代理的设施选址游戏
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了多地点代理的设施选址游戏,设计了群体策略证明机制以最大化满足度总和或最小值,同时保证代理真实报告位置。
线性二次最优控制用于非交换型均场随机微分方程及其在系统风险中的应用
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种用于非交换型均场随机微分方程的线性二次最优控制方法,并应用于系统风险模型,探讨了代理人异质性对风险缓解策略的影响。
超越精确公平:无嫉妒不完全连通公平分配
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种高效参数化近似方案,解决无嫉妒不完全连通公平分配问题,在容忍轻微嫉妒的情况下实现高效计算。
Comments Published at FSTTCS 2025
通过使用氯化前驱体的湿化学合成路线降低斜方辉石的形成温度
专题命中 Agent评测 :agent(abstract)
AI总结 本研究通过使用氯化前驱体的湿化学合成路线,探索了降低斜方辉石形成温度的方法,比较了不同合成工艺对晶体结构和均匀性的影响,发现共沉淀法能有效在低温下制备纳米斜方辉石。
Journal ref Ceramics International, 43 (2017) 13781-13785
超越特权:将密集奖励知识蒸馏到稀疏奖励策略中
机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。