A Human-in-the-Loop Autonomous Agent for Industry Time Series Forecasting
面向工业时间序列预测的人在回路自主智能体
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出面向工业时间序列预测的人在回路自主系统CastClaw,整合多类资源实现预测全流程,在5个电价数据集上优于16个基线,还经电力负荷数据离线验证。
高校专区
面向工业时间序列预测的人在回路自主智能体
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出面向工业时间序列预测的人在回路自主系统CastClaw,整合多类资源实现预测全流程,在5个电价数据集上优于16个基线,还经电力负荷数据离线验证。
ATLAS:面向工业工具使用智能体的双视角诊断评估框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 本文针对工业工具使用LLM智能体的评估缺陷,提出双视角诊断评估框架ATLAS,经美团小团生产流量验证,可提升服务质量并优化策略。
Comments 25 pages
基于答案探测引导的大语言模型多样化解决方案探索搜索
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。
Comments Accepted to the EMNLP 2026 Main
SPARK:基于大规模科学文献的骨架引导推理合成
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; East China Normal University(华东师范大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学)
AI总结 针对开源模型科学推理数据不足的问题,提出基于Sci-Base的SPARK框架构建Spark-234K科学推理数据集,该数据集难度与多样性更优,仅需更少训练样本即可实现更强性能。
Comments 24 pages, 15 figures
FIS-OT:用于无监督动作分割的特征诱导最优传输
机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) ; School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) ; Suzhou Big Data & AI Research and Engineering Center(苏州大数据与人工智能研究工程中心) ; Shanghai Key Laboratory of Data Science(上海数据科学重点实验室)
AI总结 针对现有最优传输方法忽略局部信息、易受伪标签噪声影响的问题,本文提出FIS-OT框架,通过FEG模块、特征诱导残差结构先验及循环优化环,在三个数据集上验证了方法的有效性。
Comments Accepted by ICME2026
MASQ:面向无监督骨骼动作分割的掩码感知时空量化
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 该研究针对无监督骨骼动作分割中空间掩码与离散量化引发的不稳定问题,提出MASQ框架,通过JLSD机制与掩码感知速度损失优化,在三个数据集上实现优于现有方法的帧均值准确率。
面向影响力引导的知识蒸馏:解决采样 token 在线策略蒸馏中的多样性瓶颈
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai University of Finance and Economics(上海财经大学)
AI总结 该研究针对采样 token 在线策略蒸馏的多样性瓶颈,提出 IDA-OPD 方法,通过保留熵扩张更新、替换熵收缩更新,在降低成本的同时提升 pass@k,继承教师模型的多样性,且保持普通 OPD 的 pass@1 性能。
DriftingVLA:基于逐维度时序漂移的原生单步视觉-语言-动作生成模型
机构 * University of Science and Technology of China(中国科学技术大学) ; LYNSENSE(灵犀科技)
AI总结 DriftingVLA是基于逐维度时序漂移的原生单步VLA模型,通过单步生成动作块,在多个机器人任务上优于基线模型,同时实现3.36倍的动作块生成加速。
FORESIGHT-9:自适应交易智能体的前瞻性与过程感知评估
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 FORESIGHT-9是含9条反事实压力世界线的前瞻性基准,用于评估自适应交易智能体,实验显示其能揭示终端收益未暴露的智能体失败,且等权策略表现优异。
Comments 27 pages, 15 figures
基于稀疏自编码器(SAE)的 steering 增强:邻居集成特征选择
机构 * The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文针对现有基于 SAE 的 steering 方法采用 top-k 特征选择易遗漏有效特征的问题,提出 NIFS 策略,通过利用表征相似性改进特征选择,在多项任务上实现性能提升。
Comments 15 pages
FLM:用于生成式图像压缩的频率感知语言模型
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; University of Science and Technology of China(中国科学技术大学) ; College of Intelligent Systems Science and Engineering, Harbin Engineering University(哈尔滨工程大学智能系统科学与工程学院) ; Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局信息通信研究院) ; National Tsing Hua University(国立清华大学)
AI总结 本研究提出频率感知语言模型FLM,通过频域概率建模实现高效图像压缩,兼容有损与无损JPEG重压缩,在多数据集上较JPEG基准获显著BD-PSNR增益,性能优于传统及生成式压缩方法。
多模态大语言模型(MLLMs)真的理解低资源高棉语文档吗?一项关于高棉语文档视觉问答(VQA)的试点研究
机构 * University of Science and Technology of China(中国科学技术大学) ; Université Paris Cité(巴黎城市大学)
AI总结 本研究针对高棉语文档VQA,评估开源MLLMs的性能,发现直接使用Qwen3-VL-8B准确率51.9%,外部OCR辅助的Tesseract、PaddleOCR分别达61.9%、61.6%,但高棉语文档理解仍存挑战。
SOLO:稳定全地形长视距感知类人机器人运动
机构 * Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院) ; X-Humanoid(X-人形机器人) ; The University of Hong Kong(香港大学) ; The Australian National University(澳大利亚国立大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学)
AI总结 SOLO是解决长视距类人机器人运动脆弱性的统一框架,通过QR与TA-MSE蒸馏提升地形感知与策略学习,仿真及实际测试中通行成功率显著优于基线方法,可零样本完成长距离复杂地形任务。
ExMesh++:通过拓扑自适应重建与分解从多视图图像生成可重光照UV-PBR网格资产
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团)
AI总结 ExMesh++是一种分阶段框架,通过拓扑自适应重建与分解,从多视图图像生成可重光照UV-PBR网格资产,在几何精度、重光照性能上表现优异,导出资产可直接用于标准DCC工作流。
Comments Project page: https://fan-treasure.github.io/ExMeshpp_page/
TopoSurfel:闭合高斯面元与网格间的循环以实现表面重建
机构 * University of Science and Technology of China(中国科学技术大学) ; Deep Space Exploration Laboratory(深空探测实验室)
AI总结 针对3D高斯溅射直接提取高保真表面易产生伪影和浮点数的问题,提出闭合高斯面元与网格循环的TopoSurfel框架,通过动态生成代理网格及相关策略实现高质量表面重建与新视图合成。
Comments Project page: https://fan-treasure.github.io/TopoSurfel_page/
终端对称性作为决策资源:用于任何时间验证构造的状态细化
机构 * School of Astronomy and Space Science(天文与空间科学学院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 该研究提出将终端对称性作为定向顺序构造的可复用决策资源,提出“传递—细化—验证”方法,经多任务实验,其状态级刷新提升了 AUC,且在 GRN 场景中验证器成本更低。
超越平滑DAG精确性的支持选择:完备几何、得分边际与选择性证书
机构 * School of Computer Science and Engineering, University of Science and Technology of China(中国科学技术大学计算机科学与工程学院)
AI总结 该研究针对超越平滑DAG精确性的支持选择,推导了孤立环精确选择时间,验证了相关规律,提出无真值分离统计量预测选择时间,用父集置信族等证明标签,区分DAG可行性等内容。
Comments 49 pages, 17 figures, 20 tables
VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Huazhong University of Science and Technology(华中科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。
Comments Home page: https://zhxie0117.github.io/VideoRAE
场景条件PINN-GNN用于多径射频地图:跨场景生成与场景内补全
机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) ; Wireless Technology Lab, Huawei(华为无线技术实验室)
AI总结 提出基于物理信息神经网络和图神经网络的统一射频地图构建框架,支持跨场景生成和场景内补全,采用峰值加权动态时间弯曲度量评估多径重建质量,实验表明优于多种基线方法。
DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Xiamen University(厦门大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。
Joycent: 基于扩散的口音语音合成,无需口音音素预测
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出Joycent,一种基于扩散模型的口音TTS方法,直接从标准音素序列和语音参考合成口音语音,无需口音音素预测,通过条件层归一化集成口音和说话人表征,并引入WhisAID口音识别模型,在保持说话人身份的同时提升口音自然度。
超越NL2Code:多模态代码智能的结构化综述
机构 * Meituan(美团) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; University of Science and Technology of China(中国科学技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。
Comments Accepted by TMLR 2026
用于控制函数工具变量的图扩散残差
机构 * School of Computer Science and Engineering, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
AI总结 提出自适应各向异性工具热流(A-IHF),一种基于图扩散的残差提取方法,用于灵活控制函数,通过检测处理跳跃并调整图传导性,在合成基准测试中优于多种基线方法。
Comments 86 pages, 9 figures, including supplementary material. Revised version; submitted to Artificial Intelligence
IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。
LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Kuaishou Technology(快手科技) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学)
AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。
Comments Accepted by EMNLP 2026
ExMesh: 具有拓扑自适应的显式网格重建
机构 * University of Science and Technology of China(中国科学技术大学) ; National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家空间科学探测重点实验室,深空探测实验室)
AI总结 提出ExMesh框架,通过可微优化与离散拓扑更新直接优化显式网格,引入自适应顶点分裂合并和实时UV维护,实现从粗到细的优化,兼顾精度、效率和网格简洁性。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026); Project page: https://fan-treasure.github.io/ExMesh_page.github.io/
GRASP:面向可扩展预训练数据归因的几何感知残差对齐
机构 * Wizard Quant ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。
VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Manchester(曼彻斯特大学) ; Beihang University(北航) ; Fudan University(复旦大学) ; University of New South Wales(新南威尔士大学)
AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。
面向大规模人脸识别数据集的高效、免验证的内在质量评估
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)
AI总结 提出一种无需训练的内在质量(IQ)指标,通过邻域一致性得分和全局表示子空间复杂度来估计人脸识别数据集生成高性能模型的潜力,实现快速数据集诊断与筛选。
Comments ICML 2026
AsyncTool: 多任务场景下异步函数调用能力的评估
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Toronto(多伦多大学)
AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。