Representation in Peer Selection: A Liquid Democracy Perspective
同行选择中的代表性:一种液体民主视角
专题命中 Agent评测 :agent(abstract)
AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
同行选择中的代表性:一种液体民主视角
专题命中 Agent评测 :agent(abstract)
AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。
ATOBench:当目标证据存在时,追踪自主渗透测试代理如何验证漏洞
专题命中 Agent评测 :agent(abstract)
AI总结 研究人员提出ATOBench框架,通过注入响应转换实现自主渗透测试代理验证过程的可观测性,经450回合评估发现,活动增加会掩盖断裂的验证链,成功恢复依赖于找到并保留可用证据。
FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。
Comments Under review. 15 Pages. 9 tables, 3 Figures
GateTruth:通过变异测试审计RTL设计基准的严谨性
专题命中 Agent评测 :agentic(abstract)
AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。
训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法
专题命中 Agent评测 :agent(abstract)
AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。
带容量约束验证的最优序贯分配
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。
SOFR衍生品的最优定价与对冲
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。
E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。
具有二元边际的单调成本函数下,EFX chore分配不存在性
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。
是选择EFX还是MMS,这是个问题
专题命中 Agent评测 :agent(abstract)
AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。
优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程
专题命中 Agent评测 :workflow(abstract)
AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。
Comments * These authors contributed equally to this work
高阶相互作用对集体运动的影响
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。
Comments 6 pages, 7 figures
切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析
专题命中 Agent评测 :agent(abstract)
AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。
无成本信息与免费权威
专题命中 Agent评测 :agent(abstract)
AI总结 针对无货币转移、代理人未完全内化成本的委托代理项目决策问题,研究提出委托人最优机制无需代理人报告,可选择忽略代理人或赋予其免费信息与完全决策权威。
SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台
专题命中 Agent评测 :workflow(abstract)
AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。
Comments Submitted for journal
从诊断到修正:真实世界表格解析的基准测试与改进
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 Agent评测 :agentic(abstract)
AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。
最小非线性观点动力学中涌现动态极化的分析与共识控制
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出M-NOD框架解析社交网络观点演化产生的动态极化,证明其稳定性条件,开发局部控制策略仅锚定单个智能体即可消除振荡分歧、恢复共识。
策略proof双设施选址问题中突破4近似比障碍
专题命中 Agent评测 :agent(abstract)
AI总结 该研究在Ptolemaic度量空间中提出随机策略proof双设施选址机制,将最优近似比从4降至约3.667,同时将最优下界从1.045提升至约1.207,突破了此前的4近似比障碍。
Comments 23 pages, 1 figure
基于百慕大策略的非线性最优停止:无限时域情形
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对无限时域下带非线性评估的最优停止问题,基于百慕大策略证明动态规划原理、ε-最优停时与最优停时的存在性,给出Doob型收敛结果并提供BSDEs相关示例。
功能金属表面的直接激光干涉图案化:从写入几何到功能界面
专题命中 Agent评测 :agent(abstract)
AI总结 本综述以DLIP为模型系统,指出仅靠几何无法预测金属表面功能,需分离写入几何与形成的界面,明确跨领域变量可转移性,为DLIP表面工程提供预测框架。
Comments Review article, 6 figures, 2 tables
MMAG:多控制混合音频生成基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 Agent评测 :agentic(abstract)
AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。
Comments 15 pages, 6 figures
设施布局问题中基于语言模式的经济与空间均匀性准则优化
专题命中 Agent评测 :agent(abstract)
AI总结 本文扩展LP Alinks框架,引入NCS空间均匀性准则,通过实验揭示结构与语言参数对布局的影响,推导参数选择矩阵,对比显示其在成本与均匀性权衡上表现更优。
Comments 28 pages, 14 figures
Journal ref Grobelny, J., Michalski, R. Linguistic pattern based optimization of economic and spatial uniformity criteria in facility layout problems. Cent Eur J Oper Res 2026
模拟并不总是意味着理解:当模型复杂性掩盖生物学本质时
专题命中 Agent评测 :agent(abstract)
AI总结 该研究指出细胞生物学模型的理解关键是自由参数与实验约束的比率而非复杂性,建议减少参数、开展与简单模型的系统比较以追踪细胞行为的涌现机制。
Comments 17 pages, 2 figures
灾难性注意力偏好
专题命中 Agent评测 :agent(abstract)
AI总结 本文为仅关注不利结果子集的灾难性思维建立了公理化的灾难性注意力偏好模型,完成了行为学刻画,参数可识别,还刻画了比较模糊厌恶,模型嵌套主观期望效用并收敛到最大最小期望效用。
偏币最小化下的快速功效评估:抽样与随机化校准
专题命中 Agent评测 :planning(abstract)
AI总结 针对偏币最小化下设计阶段功效评估计算量大的问题,开发SIGA框架及SIGA-S、SIGA-R程序,可高效近似参考随机化检验的结果并显著降低计算量。
OmniMech:面向3D重建的全合一多模态机械基准
专题命中 Agent评测 :agentic(abstract)
AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。
议程设置权力的去中心化与领域选择性桥接:超越回音室辩论的算法设计
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出议程民主化指数与社会信息健康模型,设计领域选择性桥接算法,经智能体模拟验证,该算法能在集体决策相关领域改善信息共享,同时维持爱好与生活方式领域用户体验,将回音室辩论转化为工程设计问题。
Comments 34 pages, 6 figures
从研究问题到列:感知操作化的数据发现
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。
Comments 6 pages, 2 figures
基于基础模型的厨房机器人操作
机构 * Kumoh National Institute of Technology(金乌国立技术大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 Agent评测 :planning(abstract)
AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。
Comments Intelligent Service Robotics (ISR)
面向6G的新型中频段(FR3,6-24 GHz)超大規模多输入多输出(XL-MIMO):信道建模、算法评估与现场试验
专题命中 Agent评测 :planning(abstract)
AI总结 本文针对6G的新型中频段XL-MIMO,综述其频谱规划、信道建模、算法进展,比较不同规模XL-MIMO系统性能,结合U6GHz频段现场试验,明确目标信噪比是影响XL-MIMO性能的关键因素。