arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-09-01 至 2026-09-01 共收录 45
2608.31119 2026-09-01 cs.CL 新提交

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

PaperGym:以评分标准为中心的研究计划生成演化框架

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司)

AI总结 本文提出PaperGym框架,将论文转化为研究计划生成的训练环境,采用评分标准分阶段训练Qwen3系列模型,显著提升了研究规划能力,在多项基准上优于现有方法。

Comments 34 pages, 6 figures, 6 tables. Code: https://github.com/ZJU-REAL/PaperGym. Project page: https://zju-real.github.io/PaperGym. Dataset: https://huggingface.co/datasets/CabbageWyh/PaperGym-Data. Model: https://huggingface.co/CabbageWyh/PaperGym-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31077 2026-09-01 cs.AI 新提交

Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization

协调过程监督与智能体策略优化中基于结果的信用分配

Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

AI总结 针对智能体策略优化中监督与信用分配的差距,提出 TASPO 方法,通过聚合特权信息的动作级似然变化分配结果信用,在三个基准上较 GRPO 提升 10.6% 且泛化性更好。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31076 2026-09-01 cs.CL cs.AI cs.IR cs.LG cs.MA cs.SE 新提交

Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

先评估再改进:面向自动研究智能体的自动评分准则生成

Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu, Jintian Zhang, Yijun Chen, Zirui Xue, Shumin Deng

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出AutoSciRub框架,在自主科学研究前生成任务特定可执行评分准则,经多基准测试可提升智能体研究表现,为自主科研提供有效控制机制。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30785 2026-09-01 cs.AI 新提交

SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents

SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩

Xiaofan Bai, Chao Liu, Hongqiang Lin, Di Wu, Mingli Song, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30769 2026-09-01 cs.LG 新提交

TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training

TrainSDC:大型语言模型训练中静默数据损坏的特征表征与缓解

Zhipeng Xia, Haotian Xu, Siyu Yun, Liqi Lin, Hu Liu, Yu Li, Cheng Zhuo

机构 * Zhejiang University(浙江大学) Huawei(华为)

AI总结 研究针对LLM训练的SDC问题,系统表征其在Transformer训练中的脆弱性,提出TrainSDC框架,经实验验证可有效缓解SDC且运行时开销较低。

Comments 12 pages, 5 figures, and 6 tables. Includes an appendix with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30657 2026-09-01 cs.CV 新提交

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30466 2026-09-01 cs.AI cs.IR 新提交

CHASE: How Content Ecosystems Are Reshaped When Ranking Is the Only Target

CHASE:当排序成为唯一目标时,内容生态系统如何被重塑

Qianwen Gao, Zichang Su, Yiwen Hou, Arlen Kumar, Leanid Palkhouski

机构 * University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

AI总结 本研究提出CHASE模拟框架,发现针对固定LLM排序信号的重复优化会使内容质量与排序一致性下降,且生态系统动态具领域依赖性,揭示了GEO的群体层面效应。

Comments Accepted to the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30395 2026-09-01 cs.CL 新提交

When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角

Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Stony Brook University(石溪大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本综述将大语言模型的推理视为搜索,系统化基于树搜索的推理进展,引入统一设计空间并倡导标准化计算报告,以优化推理权衡。

Comments Accepted by EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30368 2026-09-01 cs.RO 新提交

SpectraTac: A Compact Camera-Free Optical Tactile Sensor with Distributed Color Sensing

SpectraTac:一种具备分布式颜色感知的紧凑型无相机光学触觉传感器

Hao Wu, Haotian Guo, Yu Feng, Yutong Wang, Yanzhe Wang, Jianshu Zhou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本研究提出SpectraTac无相机光学触觉传感器,采用分布式颜色感知,实现紧凑低成本,三维力预测误差低、接触分类准确率高,可用于机器人等领域的触觉传感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29903 2026-09-01 cs.CL cs.AI 新提交

When Less is More: Understanding When Token Filtering Helps and Fails in AI-generated Text Detection

少即是多:理解AI生成文本检测中词元过滤的有效与失效情形

Xiaoyang Han, Lvxiaowei Xu, Ming Cai

机构 * College of Computer Science and Technology(计算机科学与技术学院) College of Artificial Intelligence(人工智能学院) Zhejiang University(浙江大学)

AI总结 该研究针对AI生成文本检测中词元过滤的共识,通过实证与理论分析,发现仅保留40%词元可获最优性能,且过滤效果因源LLM强弱而异,揭示了词元级检测的双向权衡。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29841 2026-09-01 cs.CL cs.PL 新提交

SkillForge: Compositional Skill Synthesis with Verification-in-the-Loop for Generating Formally Verified Dafny Programs

SkillForge:结合验证循环的组合技能合成方法,用于生成形式化验证的 Dafny 程序

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Jinbo Su

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) MIT(麻省理工学院) Weixin AI Lab(微信AI实验室) Renmin University(中国人民大学)

AI总结 SKILLFORGE 是将形式化代码合成分解为原子技能库并结合验证循环协调的框架,在自然语言转 Dafny 程序任务上性能优于现有方法。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29685 2026-09-01 cs.LG 新提交

Last Step Matters: Early Uncertainty Cannot Predict Failure in Long-Horizon Agents

最后一步很重要:早期不确定性无法预测长视界智能体的失败

Zongyue Li, Chengyue Yu, Lei Zang, Chenyi Zhuang, Linjian Mo, Leilei Gan

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 该研究发现长视界智能体的早期不确定性无法预测失败,仅最后一步的语言置信度可可靠区分失败,建议用最后一步置信度决定是否重启,其效果优于轨迹内干预。

Comments Accepted to the Main Conference of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29616 2026-09-01 cs.CL 新提交

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

JPO:用于刑事判决预测中结构化法律推理的司法策略优化

Zhaolu Kang, Yantao Liu, Tailong Luo, Leqi Zheng, Lei Wei, Chenghua Zhu, Junhao Gong, Jiachen Qian, Eric Hanchen Jiang, Jiaxin Liu, Yuan Wang, Hao Zhang, Zixia Wang, Rong Fu, Zheng Lin, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) University of California(加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) University of Hong Kong(香港大学)

AI总结 JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29345 2026-09-01 cs.AI cs.CL 新提交

BIRD-History: A Benchmark for History-Driven Text-to-SQL with Fine-Grained Knowledge Annotations

BIRD-History:带有细粒度知识标注的历史驱动型Text-to-SQL基准测试

Yunfan Zhou, Qiming Shi, Yizhou Yang, Di Weng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

AI总结 本研究推出带细粒度知识标注的BIRD-History基准测试,针对现有Text-to-SQL系统无法利用历史查询日志处理隐含领域知识的问题,提出插件式检索器,可提升多个Text-to-SQL系统的未明确查询处理性能。

Comments Accepted at Findings of the Association for Computational Linguistics: EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29278 2026-09-01 cs.CL 新提交

Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

模态断层线:结构损坏揭示脆弱的全模态推理

Zhaolu Kang, Meixin Wu, Yu Xue, Yingjie He, Qiming Shi, Lei Wei, Yidi Wang, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本研究提出SCEval诊断评估协议,通过结构损坏揭示全模态模型的脆弱推理,发现文本-视觉损坏是最稳定的共享断层线,多模态退化非相加性,干净准确率不代表结构不可靠时仍可靠。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29269 2026-09-01 cs.CV 新提交

LightFuse: Relightable Interactive Gaussian Scene Reconstruction via Multi-Scan Fusion and 2D Gaussian Ray Tracing

LightFuse:通过多扫描融合与2D高斯光线追踪实现可重光照的交互式高斯场景重建

Haonan Zhou, Gaoxiang Linghu, Youlin Jia, Hongyu Cui, Kewei Wei, Kaiyue Zhou, Bruce X. B. Yu, Gaoang Wang

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) College of Mathematics, Sichuan University(四川大学数学学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Chengdu Minto Tech(成都敏途科技)

AI总结 LightFuse是基于2D高斯框架的交互式场景重建方法,通过多扫描融合、几何细化与材质-光照分解,实现可重光照的可编辑场景,在合成场景上重光照质量优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29242 2026-09-01 cs.RO 新提交

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

AnyWorld:用于跨 embodiments 泛化的分解式第一人称世界模型

Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

机构 * Nanyang Technological University(南洋理工大学) Institute of Advanced Intelligence and Computing, A*STAR(新加坡科技研究局高级智能与计算研究院) XPENG Robotics(小鹏机器人) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 AnyWorld 框架通过分解交互为动作、相机、embodiment 因子,将人类交互重组为机器人原生经验,生成数据可提升机器人操作性能,验证了动作校准与视觉重组的必要性。

Comments Project page: https://xpeng-robotics.github.io/anyworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29228 2026-09-01 cs.AI cs.MA 新提交

Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay

智能体AI中涌现故障的定位:通过反事实回放恢复最小修复族

Bingjie Li, Yumeng Song, Zhongming Yao, Tianyi Li

机构 * Northeastern University(东北大学) Aalborg University(奥尔堡大学) Zhejiang University(浙江大学)

AI总结 本研究针对智能体AI中LLM智能体交互引发的涌现故障,提出GCJR方法恢复最小修复族,在基准和试点案例中实现1.000族精确匹配,显著减少回放或模型调用次数。

Comments 6 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29220 2026-09-01 cs.CV 新提交

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29207 2026-09-01 cs.AI cs.LG 新提交

Hyper-Fold: Exploring the Expressive Limit of Sequence-Geometry Learning for Proteins via Hypergraph Modeling

Hyper-Fold:通过超图建模探索蛋白质序列-几何学习的表达极限

Yifan Feng, Guanjie Cheng, Shihui Ying, Shaoyi Du, Yue Gao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai University(上海大学) Xi’an Jiaotong University(西安交通大学)

AI总结 Hyper-Fold通过超图建模探索蛋白质序列-几何学习的表达极限,其相关变体在多项蛋白质结构相关任务中取得最优结果,且Hyper-Fold-Pocket性能优于对比模型,参数与延迟更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28592 2026-09-01 cs.AI 新提交

A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making

前沿大语言模型在符合指南且针对具体病例的肿瘤决策中的集体能力边界

Zhang Sheng, Jinming Li, Wangyang Chen, Zhiwei Bao, Yu YoSean Wang

机构 * City University of Hong Kong(香港城市大学) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院) Affiliated Hangzhou First People’s Hospital, Westlake University School of Medicine(西湖大学医学院附属杭州市第一人民医院) Zhejiang University(浙江大学) Shaoxing Vocational & Technical College(绍兴职业技术学院)

AI总结 该研究构建肿瘤决策边界基准评估9个前沿LLMs,发现其存在临床元判断盲点,需架构干预,模型质量非临床部署主瓶颈,需可检测自身能力边界并路由决策至临床医生的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-09-01 cs.CV 版本更新

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22676 2026-09-01 cs.AI 版本更新

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

智能体人工智能对不一致和不完整工具响应的鲁棒性分析

Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

机构 * Aalborg University(奥尔堡大学) Zhejiang University(浙江大学) Northeastern University(东北大学)

AI总结 该研究通过在零售客户服务领域注入受控故障,分析智能体AI对不一致、不完整工具响应的鲁棒性,发现两类响应在特定通道中可不对称识别,动作分布特征存在差异。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22215 2026-09-01 cs.CL 版本更新

Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation

带有快速写入路由与慢速整合的双层智能体记忆

Wenzhi Li, Dong Nie, Rui Lan, Tongtong Lyu, Peiyao Wang, Lingzi Hong, Weihang Pan, Binbin Lin, Boyuan Pan, Yao Hu

机构 * Zhejiang University(浙江大学) Xiaohongshu(小红书) University of North Texas(北得克萨斯大学)

AI总结 该研究针对LLM智能体动态环境下的记忆管理问题,提出双层智能体记忆框架,通过成本感知路由与周期性整合实现高效记忆处理,在保留高检索性能的同时减少冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20817 2026-09-01 cs.CR cs.RO 版本更新

GhostTac: Manipulating Tactile Sensors without Physical Contact

GhostTac:无物理接触的触觉传感器操纵技术

Kun Wang, Xuancun Lu, Ruochen Zhou, Kai Wang, Tongjun Ye, Yihao Shao, Chen Yan, Xiaoyu Ji, Wenyuan Xu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究人员提出首个非接触式触觉传感器操纵攻击GhostTac,利用电磁干扰引发测量偏差,在15个传感器上验证有效性,揭示机器人触觉传感的新型物理攻击向量。

Comments Accepted at ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-09-01 cs.MM cs.AI cs.CV cs.GR 版本更新

When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Haoyu Wang, Yangchen Zeng, Jiaqi Zhang, Li Jiuxing, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin, Alexander Lim Han Yang, Yusen Wu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) ByteDance(字节跳动) Nankai University(南开大学) JD Research, JD.com, Inc.(京东研究院(京东有限公司)) Zhejiang University(浙江大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) The University of Hong Kong(香港大学)

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-09-01 cs.CV 版本更新

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures, accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14551 2026-09-01 cs.RO cs.AI 版本更新

TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation

TRACE: 用于延迟证据视觉运动模仿的轨迹路由因果记忆

Zihao Li, Ranpeng Qiu, Yincong Chen, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) The University of Sydney(悉尼大学)

AI总结 针对视觉运动模仿中早期线索消失导致观察歧义的问题,提出TRACE记忆框架,利用路径签名存储和检索任务相关证据,在长周期任务中提升分支选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-09-01 cs.CV 版本更新

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏