Group-Fair Metric Distortion of Facility Assignment Problems
设施分配问题的群体公平度量失真
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究受群体公平约束的设施分配问题的度量失真,提出全信息与有序信息算法,推导最大和、和最大社会目标的失真上下界,且下界与上界匹配,覆盖单向匹配与聚类问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
设施分配问题的群体公平度量失真
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究受群体公平约束的设施分配问题的度量失真,提出全信息与有序信息算法,推导最大和、和最大社会目标的失真上下界,且下界与上界匹配,覆盖单向匹配与聚类问题。
不可分割家务分配中加权PROPX与帕累托最优的不相容性
专题命中 Agent评测 :agent(abstract)
AI总结 研究不可分割家务分配中,加权PROPX与帕累托最优的不相容性,给出2主体4家务、n主体n+1家务的反例,且该不相容性在物品数不超主体数时不成立,与EF1的兼容性结果形成对比。
专题命中 Agent评测 :agent(abstract)
Comments 15 pages
个性化双值估值下的精确最大最小份额(MMS)分配:物品与劳务
专题命中 Agent评测 :agent(abstract)
AI总结 针对个性化双值估值下不可分物品与劳务的精确最大最小份额(MMS)分配这一开放问题,研究人员通过结合配额重新表述等方法,证明该分配始终存在且可在多项式时间内计算。
Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写
专题命中 Agent评测 :agent(abstract)
AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。
Comments 13 pages, 4 figures, and 3 tables
沙普利-斯卡夫住房市场中基于群体的非明显可操纵性
专题命中 Agent评测 :agent(abstract)
AI总结 该研究在沙普利-斯卡夫住房市场中,将策略完备性替换为基于群体的非明显可操纵性,定义了超群体下的顶端交易循环机制类,并证明此类机制的结果具有一致性。
Comments 14 pages, no figures
分布式AI推理何时需要更多广域网带宽?光学、分组与软件杠杆的协同设计评估
专题命中 Agent评测 :agentic(abstract)
AI总结 本文对比了分布式AI推理中,跨站点迁移推理状态与KV重计算等方案的优劣,推导了70B多头注意力模型的带宽交叉点,分析了敏感性因素及经济性,提出了测试计划。
Comments 10 pages, 4 figures, 3 tables
SynthGuard-ReleaseBench:合成表格数据发布的锁定审计证据
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出SynthGuard-ReleaseBench审计框架,通过锁定审计要素对比工作流,在多类数据上验证其可复现性与区分性,为合成表格数据发布提供特定用途的审计证据。
Comments 45 pages, 20 figures, 11 tables. Software and evidence archive with locked configurations, tests, and a fail-closed release-gate validator archived at Zenodo, DOI 10.5281/zenodo.21909680
专题命中 Agent评测 :agent(abstract)
正常细胞与癌细胞主动模型中的剪切效应
专题命中 Agent评测 :agent(abstract)
AI总结 本研究通过三维智能体模型结合GMM与平均场理论,探究正常及癌细胞组织在剪切下的力学响应,揭示刚度与活性异质性决定其非仿射运动的规律,与实验结果吻合。
在策略智能体间构建自筹资金的市场
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对策略智能体,提出自筹资金市场的机制设计问题,证明现有 truthful auction 近似性能上限,给出序贯 auction 实现对数级近似,还设计 auction 实现最大最小份额基准的常数级近似。
Comments Extended Abstract accepted 27th ACM Conference on Economics and Computation (ACM EC 2026)
THRIVE:虚拟环境中的治疗性人形机器人
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。
受限因子投资组合优化中的光子量子计算与经典求解器对比
专题命中 Agent评测 :agent(abstract)
AI总结 该研究对比光子量子计算、Gurobi、SAC三种优化范式在因子投资组合优化中的表现,发现光子硬件在窄范围有优势,经典混合整数规划在严格尾部风险控制场景更优,还揭示了强化学习分配器的失效模式并给出应用指南。
84个星系SPARC基准中重子旋转曲线重建的可复现双边界运动学校正
专题命中 Agent评测 :workflow(abstract)
AI总结 本研究针对Flynn等人提出的omega运动学校正,基于84星系SPARC基准开展可复现验证,通过双边界系数校正将平均偏差降至30.15 km/s,明确了算法流程与结果,为天文数据变换提供可复现基准。
Comments 22 Pages 7 Figures
同行选择中的代表性:一种液体民主视角
专题命中 Agent评测 :agent(abstract)
AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。
ATOBench:当目标证据存在时,追踪自主渗透测试代理如何验证漏洞
专题命中 Agent评测 :agent(abstract)
AI总结 研究人员提出ATOBench框架,通过注入响应转换实现自主渗透测试代理验证过程的可观测性,经450回合评估发现,活动增加会掩盖断裂的验证链,成功恢复依赖于找到并保留可用证据。
FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。
Comments Under review. 15 Pages. 9 tables, 3 Figures
GateTruth:通过变异测试审计RTL设计基准的严谨性
专题命中 Agent评测 :agentic(abstract)
AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。
训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法
专题命中 Agent评测 :agent(abstract)
AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。
带容量约束验证的最优序贯分配
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。
SOFR衍生品的最优定价与对冲
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。
E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。
具有二元边际的单调成本函数下,EFX chore分配不存在性
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。
是选择EFX还是MMS,这是个问题
专题命中 Agent评测 :agent(abstract)
AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。
优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程
专题命中 Agent评测 :workflow(abstract)
AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。
Comments * These authors contributed equally to this work
高阶相互作用对集体运动的影响
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。
Comments 6 pages, 7 figures
切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析
专题命中 Agent评测 :agent(abstract)
AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。
无成本信息与免费权威
专题命中 Agent评测 :agent(abstract)
AI总结 针对无货币转移、代理人未完全内化成本的委托代理项目决策问题,研究提出委托人最优机制无需代理人报告,可选择忽略代理人或赋予其免费信息与完全决策权威。
SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台
专题命中 Agent评测 :workflow(abstract)
AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。
Comments Submitted for journal
从诊断到修正:真实世界表格解析的基准测试与改进
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 Agent评测 :agentic(abstract)
AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。