arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 7341
2609.04193 2026-09-04 cs.RO 新提交

GIFT: Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation

GIFT:面向机器人操作的基于动作导向结构监督的引导式中间特征训练

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Chaoyue Li, Qichao Zhang, Haoran Li, Zhongpu Xia, Ya-Qin Zhang, Shuicheng Yan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 该研究提出 GIFT 框架,通过几何对齐、可供性预测和目标区域重建约束中间特征,在 LIBERO-Plus 和 RoboCasa 数据集上,其多个变体在机器人操作任务中显著优于基准模型,性能提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04172 2026-09-04 cs.AI cs.CL 新提交

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

大型语言模型的在线策略蒸馏再思考 II:一个训练示例

Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang, Ruhang Xiao, Cheng Qian, Qinyu Luo, Huan-ang Gao, Yudong Wang, Zhiyuan Liu, Ning Ding, Chaojun Xiao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究通过单查询训练探究在线策略蒸馏(OPD)的训练数据作用,发现单查询 OPD 可恢复大部分全数据增益,16 个语义查询可匹配全数据效果,指出 OPD 数据过剩但算法不足,为后续研究指明方向。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04148 2026-09-04 cs.AI cs.CL 新提交

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学)

AI总结 Terminal-Universe 是将智能体轨迹转化为可重用终端环境的框架,可扩展任务的广度与深度,经其生成的语料库微调 Qwen3.5-27B,显著提升了代码智能体的单轮与多轮任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03937 2026-09-04 cs.LG cs.AI 新提交

RATL: Learning from Retrieved Residuals for Robust Multivariate Time-Series Forecasting

RATL:从检索到的残差中学习以实现鲁棒多元时间序列预测

Yuchen He, Yueyang Cang, Zhiyuan Ning, Ningyu Wang, Li Shi

机构 * Tsinghua University(清华大学)

AI总结 该研究提出即插即用的RATL方法,通过检索基础预测器的历史残差并经路由组合校正,提升多元时间序列预测性能,在iTransformer等基准中表现优异且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03919 2026-09-04 cs.CV 新提交

OctWorld: Long-Range World-Consistent Video Generation with Octree-Based 3D Mapping

OctWorld:基于八叉树三维映射的长程世界一致视频生成

Zelong Lv, Sicheng Xu, Jianfeng Xiang, Ruicheng Wang, Yue Dong, Yu Deng, Guangzhong Sun, Jiaolong Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

AI总结 研究提出带持久三维记忆的视频扩散框架OctWorld,通过引入空间自适应三维记忆OctMap解决长程生成的空间一致性难题,生成的视频在基准及长程设置下优于现有方法。

Comments Accepted to ECCV 2026 Project page: https://maxtirerror.github.io/octworldpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03915 2026-09-04 cs.CL cs.IR 新提交

RuleMem: Active Rule Memory for Long-Term Conversational Agents

RuleMem:面向长期对话智能体的主动规则记忆

Xingyuan Zeng, Zuohan Wu, Quanming Yao, Yue Wang, Wei Liu, Libin Zheng, Jiuke Wang, Jian Yin

机构 * Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen Institute of Computing Sciences(深圳计算科学研究院) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学)

AI总结 针对长期对话智能体记忆机制的被动性局限,提出RuleMem规则记忆框架,通过归纳逻辑规则指导推理,在LoCoMo基准上较14个基线实现最高准确率,相对提升54.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03889 2026-09-04 cs.RO cs.AI 新提交

FWBC-VLA: Force-Aware Whole-Body Compensation for Contact-Rich Loco-Manipulation

FWBC-VLA:面向接触丰富型移动操纵的力感知全身补偿

Yutian Zhang, Siyuan Ma, Liwen Yang, Yang Li, Ce Hao, Haozhen Chi, Dong We, Qiaojun Yu, Dibo Hou

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Deep Robotics(深度机器人公司) Zhejiang University of Science and Technology(浙江科技大学)

AI总结 该研究针对现有VLA模型无法解释物理交互、WBC策略无法区分任务相关力与扰动的问题,提出FWBC-VLA力感知框架,结合无传感器接触估计与补偿控制,在轮腿机器人的接触丰富型移动操纵任务中验证了有效性。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03688 2026-09-04 cs.CV 新提交

ToPO: Token-Conditioned Preference Routing for Attention-Based Latent Diffusion Models

ToPO:面向注意力型潜在扩散模型的令牌条件偏好路由

Juntao Xu, Shihong Li, Hoi Fan Au, Ning Zhu

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Stanford University(斯坦福大学)

AI总结 该研究提出ToPO方法,通过构建时空路由优化注意力型潜在扩散模型的偏好,在SD-1.5和SDXL相关指标上优于Diffusion-DPO,且在盲测中胜率更高。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03681 2026-09-04 cs.RO 新提交

WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models

WISE:用于视觉-语言-动作模型高效后训练的世界模型引导式想象调度

Chenhao Zhang, Hanyu Zhao, Hang Cheng, Tengfei Pan, Long Zeng

机构 * Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院(BAAI))

AI总结 该研究提出WISE框架,通过世界模型引导的想象调度优化VLA模型后训练,在多操作任务上提升性能,减少约80%GPU计算时间,增强真实世界下的鲁棒性与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03557 2026-09-04 cs.CV cs.GR 新提交

Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation

构建世界模型的预训练数据:基于Unreal Engine的动作条件视频生成流水线

Haoyu Wang, Songchun Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan

机构 * Joy Future Academy, JD(京东探索研究院) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究开发了基于Unreal Engine的分布式流水线,用于生成动作条件多视角合成视频,为世界模型提供大规模预训练数据,已产出大量不同分辨率的视频。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03443 2026-09-04 cs.LG 新提交

Beyond Straightness: Non-Crossing Flow Matching via Quantile AlignTree Coupling

超越平直性:基于分位数对齐树耦合的无交叉流匹配

Junyi Lin, Mengyu Li, Jingxuan Hu, Kejun He, Cheng Meng

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系)

AI总结 该研究针对流匹配的路径交叉与耦合成本高问题,提出QAT-FM方法,通过分位数对齐树构建高效结构化耦合,在多基准数据集上实现了性能与成本的优化平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03342 2026-09-04 cs.LG 新提交

Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards

梯度知晓结果所不知:用梯度对齐奖励解锁大语言模型推理的强化学习

Leqi Zheng, Jinbo Su, Fang Niu, Chaokun Wang, Weiping Wang, Jiajun Zhang, Shannan Yan, Jie Wu, Zhaolu Kang, Rong Fu, Hang Zhang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Institute of Information Engineering, CAS(中国科学院信息工程研究所) USTC(中国科学技术大学) The Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Macau(澳门大学)

AI总结 该研究提出梯度对齐奖励(GAR)方法,在策略梯度空间中生成密集推理感知奖励,提升大语言模型在数学等基准上的推理性能,且无需领域特定数据即可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03276 2026-09-04 cs.RO 新提交

R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

R2S-Eval:基于视觉语言模型的现实到仿真校准的机器人评估方法

Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang

机构 * Sharpa(夏普) Nanjing University(南京大学) Tongji University(同济大学) Tsinghua University(清华大学)

AI总结 R2S-Eval结合现实到仿真校准与VLM偏好评估,实现机器人操纵策略的自动化、稳定且感知质量的评估,减少硬件操作工作量并揭示二元成功标签未捕捉的行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02954 2026-09-04 cs.CL 新提交

LexIssue: Benchmarking Legal Issue Identification in Chinese Civil Litigation

LexIssue:面向中国民事诉讼的法律问题识别基准测试

Huiyuan Xie, Yuqin Huang, Zhicheng Hao, Yida Cai, Shaochun Wang, Zhenghao Liu, Yuxiao Ye

机构 * Tsinghua University(清华大学) Peking University(北京大学) Modelbest Inc.(模贝斯特公司) Northeastern University(东北大学)

AI总结 本研究构建了LexIssue基准及配套法律知识库,将法律问题识别拆分为生成与分类任务,实验验证检索增强生成可提升相关识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02291 2026-09-04 cs.CV cs.AI 版本更新

VoRTeC: Taming Foundation Flow for One-step Real time Video Compression

VoRTeC:驯服基础流模型实现单步实时视频压缩

Yichong Xia, Qinhong Wu, Bin Chen, Jinpeng Wang, Zeyuan Chen, Haoqian Wang

机构 * Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 该研究针对超低码率视频压缩的模糊伪影、解码延迟与时间一致性问题,提出基于Wan2.1的VoRTeC框架,实现单步解码,比特消耗降58%,解码速度提升3至197倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02082 2026-09-04 cs.MM cs.AI cs.CL cs.CR 版本更新

Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models

多模态大语言模型中跨模态安全漂移的迁移安全感知

Tianqi Xiao, Shiyao Cui, Minghao Zhang, Junxiao Yang, Renmiao Chen

机构 * Tsinghua University(清华大学) Northwestern Polytechnical University(西北工业大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文针对多模态大语言模型的跨模态安全漂移问题,提出轻量级安全感知表征迁移(SRT)方法,经多基准实验验证,该方法可在保留模型实用性的同时有效提升跨模态场景安全性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27370 2026-09-04 cs.CL cs.LG 版本更新

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Puro-2B:Poor Lab基于RTX 5090训练的Qwen2-1.5B模型,训练成本低于5090美元

Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Chengxia Li, Mingzhe Zhang, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室)

AI总结 该研究提出开源预训练方案,在RTX 5090上低成本训练出Puro-2B模型,推导出成本缩放定律并开展数据课程影响下游性能的案例研究,完整方案已开源。

Comments 63 pages, 20 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22793 2026-09-04 cs.CL cs.AI 版本更新

TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

TRACE:面向一致性、极限感知的自进化技能库

Wenhao Wu, Menghao Zhang, Xin Wang, Zhi Wang, Kun Shao, Jian Luan

机构 * Xiaomi Inc.(小米公司) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15144 2026-09-04 stat.ML cs.AI cs.LG 版本更新

A Posterior-Dynamics Framework for Imaging Inverse Problems with Pretrained Diffusion Priors

扩散逆问题的尺度一致后验动力学

Zhaoqiang Liu, Tongyao Pang, Ruibing Wang, Yang Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

AI总结 该研究针对扩散逆问题,提出尺度一致后验动力学方法,通过设计SDE模型、离散化算法并完成理论证明,在FFHQ和ImageNet的超分辨率等任务中取得竞争力结果。

Comments 26 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10581 2026-09-04 cs.CL cs.SD eess.AS 版本更新

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

ParaBridge: 弥合语音语言模型中的副语言感知与对话行为

Yuxiang Wang, Qinke Ni, Shengbo Cai, Wan Lin, Liqiang Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Hunyuan(腾讯混元) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司) Tsinghua University(清华大学)

AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28791 2026-09-04 cs.CL cs.AI 版本更新

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

技能条件门控自蒸馏用于大语言模型推理

Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。

Comments Accepted by EMNLP 2026 Findings. Code is available at https://github.com/walawalagoose/SGSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09038 2026-09-04 cs.RO cs.CV cs.LG 版本更新

Towards Lifelong Aerial Autonomy: Geometric Memory Management for Continual Visual Place Recognition in Dynamic Environments

迈向终身空中自主:面向动态环境的几何记忆管理用于连续视觉地点识别

Xingyu Shao, Zhiqiang Yan, Liangzheng Sun, Mengfan He, Chao Chen, Jinhui Zhang, Chunyu Li, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) College of Instrument Science and Opto-electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Key Laboratory of Complex System Intelligent Control and Decision Making, Beijing Institute of Technology(北京理工大学复杂系统智能控制与决策重点实验室) School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学宇航学院)

AI总结 本文提出一种异构记忆框架,通过静态卫星锚点和动态经验回放缓冲区,提升动态环境中连续视觉地点识别的鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16551 2026-09-04 cs.RO cs.SY eess.SY 版本更新

Learning-based Adaptive Safety-Critical Control With Evolving Unsafe Regions

SafeLink: 在动态和不规则不安全区域下的安全关键控制

Songqiao Hu, Zidong Wang, Zeyi Liu, Zhen Shen, Xiao He

机构 * Department of Automation, and the Institute for Embodied Intelligence and Robotics, Tsinghua University(自动化系,以及 embodied intelligence and robotics 研究所,清华大学) Department of Computer Science, Brunel University London(计算机科学系,布鲁内尔大学伦敦分校) State Key Laboratory of Multimodal Artificial Intelligence Systems, Beijing Engineering Research Center of Intelligent Systems and Technology, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,北京智能系统与技术工程研究中心,中国科学院自动化研究所)

AI总结 SafeLink通过成本敏感的增量随机向量函数链接神经网络,实现动态和不规则不安全区域下的安全关键控制,提升系统安全性和计算效率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18407 2026-09-04 cs.CL cs.AI cs.LG 版本更新

AgentRM: Enhancing Agent Generalization with Reward Modeling

AgentRM:通过奖励建模增强智能体泛化能力

Yu Xia, Jingru Fan, Weize Chen, Siyu Yan, Xin Cong, Zhong Zhang, Yaxi Lu, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学)

AI总结 本研究提出AgentRM奖励模型,通过显式、隐式建模及LLM评判三种方式构建,结合N选最优采样等方法,在9个任务上提升智能体泛化与专门化能力,效果优于现有模型。

Comments Published in ACL 2025 Main Conference (Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02747 2026-09-03 cs.CV 新提交

InceptionGS: Generative Bootstrapping for Large-Scale Gaussian Splatting under Unstructured View Sampling

InceptionGS:非结构化视角采样下大规模高斯溅射的生成式自举

Tianheng Lu, Guangyu Wang, Ruqi Huang, Lu Fang

机构 * Tsinghua University(清华大学)

AI总结 针对非结构化视角采样下大规模高斯溅射的视角稀缺与生成方法缺陷,提出InceptionGS,通过平衡重建与生成、引入自适应先验修复问题区域,在真实场景实验中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02702 2026-09-03 cs.CL 新提交

Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers

轨迹即状态:将推理轨迹用作长上下文Transformer的条件状态

Xu Zou, Jie Tang

机构 * Tsinghua University(清华大学)

AI总结 该研究提出Trace as State方法,将推理轨迹置于长上下文Transformer的上下文前,在27组实验组合中26组优于对照方法,显著提升了模型在长上下文推理任务上的表现。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02504 2026-09-03 cs.CV 新提交

SR-Edit: Region-Aware Image Editing via Self-Refinement

SR-Edit:基于自细化的区域感知图像编辑

Andong Wang, Zehua Chen, Yuxuan Jiang, Jun Zhu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

AI总结 SR-Edit是一种图像编辑框架,通过迭代自细化解决现有方法区域估计不准、易产生伪影的问题,实验表明其在区域保留和图像质量上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02414 2026-09-03 cs.CL cs.AI 新提交

Before the Script, Set the Stage: How Worldview Simulation Amplifies Psychologically Grounded Persuasion in Multi-Turn Jailbreaking

脚本之前,搭建舞台:世界观模拟如何放大多轮越狱中基于心理学的说服效果

Siyu Chen, Haoran Wang, Xiaojian Li, Yao Huang, Yinpeng Dong, Wei Xu

机构 * AI4S Center, Shanghai Qi Zhi Institute(上海期智研究院AI4S中心) College of AI, Tsinghua University(清华大学人工智能学院) Fangcun AI(方寸人工智能) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 本研究提出BLUEPRINT安全评估框架,结合WORLDVIEWSIM模块与蒙特卡洛树搜索优化18种心理学影响因子,在6个前沿模型上实现接近上限的攻击成功率,揭示多轮越狱的漏洞机制并为安全评估提供新方向。

Comments 19 pages, 7 figures. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02371 2026-09-03 cs.AI 新提交

Diagnosing with Insights: Structured Analysis of Agent Failures via Behavioral Abstractions

洞察式诊断:基于行为抽象的智能体失败结构化分析

Jiayi Bi, Yanjie Gao, Yuanmin Xie, Liqun Li, Tianyin Xu, Fan Yang, Mao Yang

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) Microsoft(微软公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出神经符号方法AGENTSCOPE,通过将智能体轨迹行为抽象为结构化表示并结合LLM引导推理,在Who&When、AgentErrata数据集上显著提升智能体失败的故障定位与归因准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02316 2026-09-03 cs.IR cs.CL cs.CR 新提交

Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization

Counter-GEO-Bench:评估针对信息扭曲生成式引擎优化的防御措施

Bing Zheng, Zongyao Zhao, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学)

AI总结 Counter-GEO-Bench是评估GEO错误信息防御的基准,实验显示现有防御效果有限,而新提出的C-GEO Guard可大幅降低攻击成功率且效用损失极小,验证了威胁可应对。

Comments Accepted to EMNLP 2026 (Main Conference). 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏