A Tractable Continuous-Time Model for Designing Interventions for Time-Inconsistent Agents
一种用于为时间不一致代理设计干预措施的可处理连续时间模型
专题命中 Agent评测 :agent(abstract)
AI总结 研究为时间不一致代理在有期限约束的基于进度的任务中设计干预措施,提出可处理连续时间模型,分析代理行为并研究最优目标设定与奖励调度问题,给出结果及与离散时间模型的差异。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
一种用于为时间不一致代理设计干预措施的可处理连续时间模型
专题命中 Agent评测 :agent(abstract)
AI总结 研究为时间不一致代理在有期限约束的基于进度的任务中设计干预措施,提出可处理连续时间模型,分析代理行为并研究最优目标设定与奖励调度问题,给出结果及与离散时间模型的差异。
马尔可夫信息过程
专题命中 Agent评测 :agent(abstract)
AI总结 研究有承诺的设计者塑造有策略互动、有远见的智能体信息的信息设计,引入马尔可夫贝叶斯相关均衡,给出设计者问题求解算法,通过例子和数值研究阐述理论。
Comments 18 pages, 1 figure
欧拉约束与完全二分偏好结构的三次临界性
专题命中 Agent评测 :agent(abstract)
AI总结 研究完全二分偏好结构的多面体可实现性问题,通过碰撞强边要求、二分平面图边界和多面体图最小度约束证明欧拉型临界性定理,区分弱实现并指出欧拉区间未完全可实现,在立方体情形给出偏好理论表现。
Comments 8 pages; comments welcome
U3DWind:用于城市空中交通的低空风场数据集及基准
专题命中 Agent评测 :planning(abstract)
AI总结 研究针对城市空中交通低空风害评估数据资源不足问题,用GPU加速框架生成U3DWind数据集,涵盖中国五座大城市,定义五项基线任务,为低空交通风影响评估及城市空域管理等提供基准。
审核可逆酶动力学中的霍尔丹一致性:精心策划的双边主干和标记的折叠误差基准
专题命中 Agent评测 :workflow(abstract)
AI总结 研究通过霍尔丹关系审核可逆酶动力学常数,用互易成本作为校准对称报告尺度,应用于示范集并构建双边主干,还通过半合成基准量化可检测性,贡献包括生化整理、可重复工作流程及折叠误差校准。
Comments 50 pages, 8 figures, supplementary material and reproducibility code/data included as ancillary files
单壁碳纳米管内掺杂封装方法的比较评估
专题命中 Agent评测 :workflow(abstract)
AI总结 研究单壁碳纳米管内掺杂封装电荷转移分子的方法,比较熔体填充、溶液回流、真空相升华等填充方式;通过多种手段评估封装效率与电子改性,还介绍一种无需大量溶剂洗涤的真空相法提高封装系统清洁度。
Comments 53 pages, 19 figures
超越视线:复杂场景中V2X集体感知的混合验证
机构 * European Union(欧盟)
专题命中 Agent评测 :agent(abstract)
AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。
Comments 6 pages, 4 figures, to be presented in ITS World 2026
医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估
机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) ; Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)
专题命中 Agent评测 :planning(abstract)
AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。
带有嫉妒比率的设施选址博弈
专题命中 Agent评测 :agent(abstract)
AI总结 研究实数线上以嫉妒比率为目标的一设施选址博弈,提出策略证明或群体策略证明机制以最小化嫉妒比率,并在两种场景下获得最优解和最佳确定性机制。
Journal ref Computers & Industrial Engineering (2020) 106710
结合分组元启发式与强化学习的一维装箱问题求解
专题命中 Agent评测 :agent(abstract)
AI总结 提出RL-HGGA混合算法,将分组遗传算法与Q学习结合,通过动态选择八种宏动作,在标准测试集上达到0.95%平均最优性差距,计算时间从64.22秒降至1.29秒(50倍加速)。
Comments 10 pages, 7 figures
约束分布式异构双设施选址问题与最大变体成本
专题命中 Agent评测 :agent(abstract)
AI总结 研究在最大变体成本模型下,受限于候选位置且每个位置最多设一个设施,设计策略证明的分布式机制,以近似四种社会目标,并给出常数下界与上界。
注意差距:标准 3DGS 评估主要衡量近轨迹插值
机构 * Advanced Micro Devices, Inc.(超威半导体公司)
专题命中 Agent评测 :planning(abstract)
AI总结 标准 3DGS 评估采用隔帧留出法,实际衡量近轨迹插值而非空间泛化。本文提出匹配计数协议,发现插值与外推之间存在 3~12dB 的稳定差距,该差距跨表示族存在,主要由几何代理分量主导,并建议采用空间留出基准。
VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型
机构 * National Tsing Hua University(国立清华大学) ; NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)
专题命中 Agent评测 :agent(abstract)
AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。
Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/
面向工程设计优化的分布式量子近似优化算法模拟器
专题命中 Agent评测 :workflow(abstract)
AI总结 提出一个兼容Qiskit的分布式量子近似优化算法模拟器,用于解决工程设计中的QUBO问题,支持单QPU和分布式多QPU执行模式,并包含运行时优化和图形界面。
Comments 37 pages, 7 figures, 5 tables
ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台
专题命中 Agent评测 :agent(abstract)
AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。
Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026
在线公平分配遇上重排序缓冲区
专题命中 Agent评测 :agent(abstract)
AI总结 研究在线公平分配不可分割混合物品问题,通过引入有限大小的缓冲区,在个性化k-值实例中实现每个时间步EF1且大多数时间步EF的分配。
推荐系统与网络结构对内容和创作者可见性的联合影响
专题命中 Agent评测 :agent(abstract)
AI总结 通过基于代理的模拟,研究推荐逻辑(流行度与协同过滤)和网络拓扑如何共同塑造社交媒体中内容和创作者的可见性分布。
冲突约束下的公平分配问题:基于强可着色性
专题命中 Agent评测 :agent(abstract)
AI总结 研究冲突约束下公平分配问题,引入强色数层次结构,证明SD-EF1、EF1和EF[1,1]公平分配的存在性与算法条件,给出最大度相关的最优界限。
Comments 32 pages
Labimus: 化学实验室中类人灵巧操作的仿真与基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 Agent评测 :workflow(abstract)
AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。
Comments Project page: https://labimus.github.io/
SENSE-VAD:面向自动驾驶的情感和语义视频异常检测
机构 * University of South Florida(南佛罗里达大学)
专题命中 Agent评测 :agent(abstract)
AI总结 针对自动驾驶中社会关系导致的异常(如追逐、被抱等),提出首个合成视频异常检测基准SENSE-VAD,利用CARLA和UE生成多类别社交异常场景,并分离社交异常与运动异常,评估现有方法发现其难以解决该挑战。
数据访问与数据交换的逻辑
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一种扩展动态认知逻辑的新逻辑,结合命题知识模态与数值条件非命题知识算子,并引入基于最小化算子的限定描述,用于数据交换场景的推理,给出了完全公理化并证明了可判定性与共表达性。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 93-116
AtomiMed:用于通用临床感知医学报告评估的分层原子事实核查
专题命中 Agent评测 :agentic(abstract)
AI总结 提出AtomiMed框架,将复杂医学叙述分解为分层原子临床事实,通过代理交叉验证循环模拟多放射科医生同行评审,实现诊断检测和描述准确性的解耦评估。
Comments 11 pages, 4 figures
通过潜在场景嵌入揭示轨迹预测中的可迁移性
机构 * Linköping University(林雪平大学) ; Lund University(隆德大学)
专题命中 Agent评测 :agent(abstract)
AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。
Comments Accepted to ECCV 2026
重构与地外自主性的AGI对抗
专题命中 Agent评测 :agent(abstract)
AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。
利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性
专题命中 Agent评测 :agent(abstract)
AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。
基于FPGA的纳米机械系统LQG控制器与硬件在环仿真器实现
专题命中 Agent评测 :workflow(abstract)
AI总结 提出在低成本Red Pitaya STEMlab FPGA平台上实现实时LQG控制与硬件在环仿真,支持三自由度耦合振荡系统,并通过悬浮纳米粒子双势阱稳定实验验证。
Comments Submission to SciPost
群体规模下社会信息中的犹豫与准确性
专题命中 Agent评测 :agent(abstract)
AI总结 研究社会信息下群体决策的犹豫与准确性,发现社会信息加速决策并提高准确性,但个体准确性在有限最优群体规模时最大,多数选择准确性随规模单调增加,且决策波常无法解决集体犹豫,未决定者后续决策偏差增大。
Comments 20 pages Main document, 18 pages Supplementary Material (together making 38 pages total). Main document has 9 Figures (20 Subfigures), Supplementary has 13 Figures (70 Subfigures), so total of 22 Figures (90 Subfigures)
SimPol: 模拟欧洲国家政治信念网络中的极化现象
专题命中 Agent评测 :agent(abstract)
AI总结 结合实证网络分析与基于智能体的建模,研究信念系统结构如何影响极化驱动,并揭示欧洲信念系统多样性导致的不同极化轨迹。
心理健康虚拟仿真
专题命中 Agent评测 :agent(abstract)
AI总结 本文探索利用虚拟仿真技术,通过基于智能体的建模评估社区层面结果,以及通过具身控制空间进行个体训练,为心理健康干预提供安全实验环境。
Comments Doctoral Dissertation, Carnegie Mellon University
FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准
机构 * National Science Foundation(国家科学基金会) ; NASA(美国国家航空航天局)
专题命中 Agent评测 :planning(abstract)
AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。