arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2601.08467 2026-07-07 cs.CV cs.LG eess.IV 版本更新 57%

Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

基于双解耦视觉语言模型的零样本分心驾驶员检测

Takamichi Miyata, Sumiko Miyata, Andrew Morris

机构 * Chiba Institute of Technology(千叶工业大学) Institute of Science Tokyo(东京科学大学) Loughborough University(拉夫堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。

Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02046 2026-07-03 cs.LG 新提交 57%

Fast and Accurate Anomaly Detection in Time Series

时间序列中快速准确的异常检测

Emanuele Mele, Massimo Cafaro, Angelo Coluccia, Italo Epicoco

机构 * University of Salento(萨勒诺大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出一种基于Haar离散小波和t检验的无监督时间序列异常检测算法,在343个数据集上超越现有无监督和自监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01287 2026-07-03 cs.RO cs.AI cs.SY eess.SY 新提交 57%

Adaptive Companionship for Group-Following Robots: Handling Dynamically Changing Group Formations

群体跟随机器人的自适应陪伴:处理动态变化的群体编队

Cong-Thanh Vu, Yen-Chen Liu

机构 * National Cheng Kung University(国立成功大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出基于视觉语言模型的自适应群体陪伴方法,通过语义推理推断同伴位置、维持社交距离并理解群体动态,结合MPPI控制器实现稳定安全跟随,在五个场景中成功率提升15%,碰撞率降低25%。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新 57%

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24747 2026-07-03 cs.AI cs.MA 版本更新 57%

Formal Semantics for Agentic Tool Protocols: A Process Calculus Approach

智能体工具协议的形式语义:一种进程演算方法

Andreas Schlapbach

机构 * Swiss Federal Railways (SBB)(瑞士联邦铁路公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文通过进程演算形式化两种智能体工具协议(SGD和MCP),证明它们在映射Phi下结构互模拟,但反向映射有损,进而提出MCP+扩展实现完全等价。

Comments Logical flaw in Theorem 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01065 2026-07-02 cs.LG 新提交 57%

GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache

GSRQ: 面向亚1比特KV缓存的增益-形状残差量化

Soosung Kim, Minjae Park, Eui-Young Chung, Jaeyong Chung

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对大语言模型KV缓存压缩中向量量化导致的方向保持问题,提出增益-形状K均值(GSKM)替代标准K均值,并构建增益-形状残差量化(GSRQ),在1比特下将LongBench平均准确率从11.34提升至33.54。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00309 2026-07-02 cs.SD cs.CL cs.HC eess.AS 新提交 57%

A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

一种通过语言模型驱动文本可操控的草图式程序化声景乐器

Prabal Gupta

机构 * Rama Labs(Rama实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出一种实时音乐界面,将自然语言场景描述转化为可演化的程序化声景,通过直接参数调整实现细粒度控制,并采用三种可互换后端生成连贯音频流。

Comments 10 pages, 7 figures, 2 tables. Accepted to the International Conference on New Interfaces for Musical Expression (NIME 2026), London, UK. Supplementary material included as an appendix. Code and demo: https://github.com/prabal-rje/latentscore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新 57%

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23605 2026-07-02 cs.AI 版本更新 57%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21397 2026-07-02 cs.CV cs.LG 版本更新 57%

MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

MMLoP: 多模态低秩提示用于高效视觉-语言适配

Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出MMLoP框架,通过低秩分解参数化视觉和文本提示,仅用11.5K可训练参数实现深度多模态提示,并引入自调节一致性损失、均匀漂移校正和共享上投影三个组件,在11个数据集上达到79.70%的基类到新类泛化调和平均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15692 2026-07-02 cs.HC cs.CL cs.CV 交叉投稿 57%

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions

表面化变异以校准MLLM生成图像描述的可信度感知

Meng Chen, Akhil Iyer, Amy Pavel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 通过系统性地展示多个MLLM响应间的变异,帮助盲人或低视力用户无需视觉检查即可检测不可靠信息,实验表明该方法将识别不可靠声明的能力提升4.9倍。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29793 2026-07-01 cs.CL q-fin.GN 版本更新 57%

Fund2Persona: A Framework for Building and Refining Financial Advisor Personas from Fund Disclosure Data

Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架

Suhwan Park, Hoyoung Lee, Zhangyang Wang, Alejandro Lopez-Lira, Young Cha, Chanyeol Choi, Jaewon Choi, Yongjae Lee

机构 * UNIST(蔚山科学技术院) LinqAlpha University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Florida(佛罗里达大学) Blackstone(黑石集团) Hanwha Life(韩华生命)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。

Comments 17 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31085 2026-07-01 cs.AI 新提交 57%

DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction

DDIAgents: 机制条件上下文流用于药物相互作用预测

Zhenqian Shen, Yu Liu, Xiaoyi Fu, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30942 2026-07-01 cs.HC cs.CY 新提交 57%

Anthropomorphism in AI Companion Communities: Age, Gender, and Emotional Correlates

AI伴侣社区中的拟人化:年龄、性别与情感相关性

Afia Mubashir, Boden Moraski, Stephanie Choi, Rose E. Guingrich

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本研究利用Reddit数据,分析AI伴侣社区中用户年龄、性别与拟人化倾向及情感表达的关系,发现成年人和女性更易拟人化,积极情感与拟人化正相关,且这些关系在成年人中更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30899 2026-07-01 cs.CR cs.AI 新提交 57%

Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models

曲率引导的模块定位用于后门大语言模型的低秩解毒

Arash Raftari, Mehrdad Mahdavi, Nathan Blackthorn, Andrew Arash Mahyari

机构 * AIVault Inc.(AIVault公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出一种基于激活修补和Fisher/K-FAC曲率分析的机制引导权重空间修复框架,定位并低秩修复后门大语言模型中最有影响力的模块,有效抑制触发条件恶意行为同时保持良性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29904 2026-06-30 cs.CL 57%

Timesteps of Mamba Align with Human Reading Times

Mamba的时间步长与人类阅读时间对齐

Yuji Yamamoto, Shinnosuke Isono, Yoshinobu Kawahara, Sho Yokoi

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究发现状态空间语言模型Mamba的每词时间步长能显著预测人类阅读时间,即使控制GPT-2惊讶度等已知预测因子后仍显著,表明Mamba可作为研究人类实时语言处理的新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29773 2026-06-30 cs.LG 57%

GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

GLIP:面向图级任务的图与大型语言模型联合预训练

Haoxin Sun, Yiqing Lin, Yajun Huang, Chenhui Dong, Mingjun Li, Zhongzhi Zhang

机构 * Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 57%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29586 2026-06-30 cs.CV cs.AI 57%

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练

Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国) Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国) National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出SonoCLIP,首个百万级区域可控胎儿超声视觉-语言基础模型,通过掩码引导的全局-局部对比学习,提升对临床关键局部结构的敏感性,在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28667 2026-06-30 cs.CL 57%

Phonological Perception of Sign Language Models

手语模型的音系感知

Kayo Yin, Jessica Carter, Alex Xijie Lu, Annemarie Kocab

机构 * University of California, Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过最小对测试和表征对齐评估手语识别模型的音系感知能力,发现模型具有涌现音系敏感性但存在架构权衡:姿态模型对手形敏感,像素模型对位置敏感。

Comments Accepted to CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22282 2026-06-30 cs.CV cs.AI 57%

UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

UniMotion: 一种用于运动-文本-视觉理解和生成的统一框架

Ziyi Wang, Xinshun Wang, Shuang Chen, Yang Cong, Mengyuan Liu

机构 * Peking University(北京大学) Donghua University(东华大学) South China University of Technology(华南理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 UniMotion首次提出统一框架,同时处理人类运动、自然语言和RGB图像的理解与生成,通过连续模态处理和自监督预训练解决传统模型的局限性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02425 2026-06-30 cs.RO cs.AI 57%

Multi-Class Human/Object Detection on Robot Manipulators using Proprioceptive Sensing

使用本体感知传感进行机器人机械臂的多类人类/物体检测

Justin Hehli, Marco Heiniger, Maryam Rezayati, Hans Wernher van de Venn

机构 * MINDLab, Institute of Mechatronic Systems, ZHAW(苏黎世应用科技大学机电系统研究所MINDLab) Institute of Mechatronics system, ZHAW(苏黎世应用科技大学机电系统研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出多类人类/物体检测方法,通过Franka Emika Panda机械臂采集数据,采用LSTM、GRU和Transformer模型,实现实时91.11%的识别准确率,验证了多类检测模型的可行性。

Comments 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), Los Angeles, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26933 2026-06-26 cs.CR cs.AI 新提交 57%

Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities

Chai:加密误用漏洞的智能发现

Corban Villa, Sohee Kim, Austin Chu, Alon Shakevsky, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出Chai系统,利用AI改进差分测试,从库级缺陷出发沿依赖图传播,发现并验证加密误用漏洞,在X.509、JWT、SAML库中发现超100个漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26205 2026-06-26 cs.AI 新提交 57%

Knowledge-augmented Agentic AI for Mental Health Medication Information Seeking

面向心理健康药物信息检索的知识增强型智能体AI

Huizi Yu, Jian Liu, Wenkong Wang, Lingyao Li, Jiayan Zhou, Zhaoqian Xue, Xiang Li, Xinxin Lin, Zhiying Liang, Zhuoru Wu, Siyuan Ma, Xin Ma, Lizhou Fan

机构 * Department of Medicine and Therapeutics, The Chinese University of Hong Kong(香港中文大学内科及药物治疗学系) Department of Psychiatry, The Chinese University of Hong Kong(香港中文大学精神科学系) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) College of Information Science, University of Arizona(亚利桑那大学信息科学学院) Department of Medicine, Stanford University School of Medicine, Stanford University(斯坦福大学医学院医学系) Perelman School of Medicine, The University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院) Department of Biostatistics, Vanderbilt University(范德堡大学生物统计学系) Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院李嘉诚健康科学研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出一种基于知识图谱的多智能体框架,整合Reddit、WebMD和FDA不良事件报告,通过来源感知集成实现可审计的精神科药物信息检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14717 2026-06-26 cs.LG 版本更新 57%

Training-Free Generation of Protein Sequences from Small Family Alignments via Stochastic Attention

基于随机注意力的小家族比对无训练蛋白质序列生成

Jeffrey D. Varner

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出随机注意力(SA)方法,利用现代Hopfield能量和Langevin动力学从少量序列中无训练生成蛋白质序列,在8个Pfam家族上实现低组成差异、新颖性和结构合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08275 2026-06-26 q-bio.NC cs.CL 版本更新 57%

Linguistics and Human Brain: A Perspective of Computational Neuroscience

语言学与人脑:计算神经科学的视角

Fudong Zhang, Bo Chai, Yujie Wu, Wai Ting Siok, Nizhuan Wang

机构 * Institute of AI and Robotics, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(人工智能与机器人研究院,智能机器人与先进制造学院,复旦大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文从计算神经科学视角,通过建模、模拟和数据分析将语言层次动态结构转化为可测试神经模型,并利用深度学习和大语言模型探索语言处理的神经基础。

Journal ref Cognitive Neurodynamics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04470 2026-06-26 cs.CY 57%

Six Fallacies in Substituting Large Language Models for Human Participants

将大型语言模型用于人类参与者中的六大谬误

Zhicheng Lin

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文批判性地评估了将LLM用于行为和心理研究的替代观点,指出六个谬误,包括将token预测等同于人类智能、将LLM视为平均人类等,强调LLM作为实用模拟工具的价值,而非人类替代品。

Journal ref Advances in Methods and Practices in Psychological Science, 8(3), 1-19 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25705 2026-06-25 cs.AI 新提交 57%

GUI agent: Guided Exploration of User-Sensitive Screens

GUI代理:用户敏感屏幕的引导探索

Aradhana Nayak, Mussadiq Nazeer, Wang Peng, Feng Liu

机构 * Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出一种探索代理,通过系统性地探索查询空间,识别在GUI环境中执行后会导致用户敏感状态的查询,以提升LLM代理的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25657 2026-06-25 cs.CV cs.AI 新提交 57%

Steering Vision-Language Models with Joint Sparse Autoencoders

用联合稀疏自编码器引导视觉-语言模型

Huizhen Shu, Xuying Li, Hongxu Lin, Wenjie Sun, Hui Li

机构 * yunshanai(云山AI) HKUST(Guangzhou)(香港科技大学(广州)) Zidongtaichu(紫东太初) University of British Columbia(不列颠哥伦比亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出联合稀疏自编码器(JSAE),通过显式对齐约束联合分解视觉和语言激活,得到可解释的跨模态特征,并在LLaVA等模型上验证了层依赖的干预效果。

Comments 19pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24255 2026-06-24 cs.CV cs.AI 新提交 57%

Social Structure Matters in 3D Human-Human Interaction Generation

社会结构在三维人-人交互生成中的重要性

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达) Nanjing University(南京大学) University of Technology Sydney(悉尼科技大学) Australian National University(澳大利亚国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出Solo-to-Social框架,利用LLM规划社会结构(阶段分解、角色分配)并指导运动执行器生成协调的双人3D运动,解决文本驱动的人-人交互生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏