arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2608.09133 2026-08-11 cs.CV cs.AI 新提交 62%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 62%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22665 2026-08-11 cs.CV cs.AI 版本更新 62%

SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery

SARVLM:一种用于SAR图像语义理解的视觉语言基础模型

Qiwei Ma, Xukun Lu, Wang Liu, Puhong Duan, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Yuelushan Center for Industrial Innovation(岳麓山创新中心) School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14750 2026-08-07 eess.AS cs.AI cs.CV cs.SD 版本更新 62%

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

Pixel-TTS: 基于图像的文字渲染实现鲁棒文本转语音

Adarsh Arigala, Arjun Gangwar, S Umesh, Yova Kementchedjhieva

机构 * SPRING Lab, Indian Institute of Technology, Madras, India(SPRING实验室,印度理工学院,马德拉斯,印度) MBZUAI, UAE(MBZUAI,阿联酋)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Pixel-TTS框架,将文本渲染为图像并通过2D卷积生成嵌入,消除嵌入矩阵扩展,提升对未见字符和拼写变体的鲁棒性,实现零样本泛化。

Comments 11 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新 62%

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 62%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01407 2026-08-06 cs.CV cs.AI 版本更新 62%

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03979 2026-08-05 cs.CV cs.AI 新提交 62%

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Video-DeepResearch:迈向新一代多模态深度研究智能体

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00119 2026-08-04 cs.CV cs.AI 新提交 62%

Counting the Cost of War Under Satellite Embargo: Zero-Shot Estimation of Impacted Infrastructure

卫星禁运下的战争损失统计:受影响基础设施的零样本估计

Saleh Sakib Ahmed, M. Sohel Rahman

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对冲突区人道主义救援中受影响建筑估计受卫星数据禁运阻碍的问题,提出基于打击前地图的零样本几何投影方法,引入两项技术创新,在2026年中东冲突数据上验证了深度增强大视觉语言模型的优势,确立了混合零样本危机映射范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00007 2026-08-04 cs.CL cs.AI cs.LG 新提交 62%

MemoryForge: Synthesize Lifelong Memory for Human-Like LLM Agents

MemoryForge:为类人LLM智能体合成终身记忆

Bohan Tang, Yiwen Guo

机构 * Tencent(腾讯)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MemoryForge是从简短目标画像合成终身记忆的框架,通过记忆条件让冻结LLM动态检索相关记忆,在两类任务实验中使其表现更类人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 62%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21799 2026-08-03 cs.LG cs.AI 版本更新 62%

Towards White-Box Deep Wireless Sensing

迈向白盒深度无线感知

Xie Zhang, Yina Wang, Chenshu Wu

机构 * The University of Hong Kong(香港大学) MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对现有深度无线感知模型为黑盒的问题,提出基于复稀疏率降维原理的全复值Transformer模型RF-CRATE,引入子空间正则化解决数据稀缺问题,在五项数据集的多类任务中验证其性能优于黑盒模型且具备可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28618 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 62%

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

AskChem:面向化学文献综合的以主张为中心的基础设施

Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho

机构 * New York University(纽约大学) Matterstack, Inc.(Matterstack公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06254 2026-07-30 cs.CV cs.AI 版本更新 62%

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

机构 * Universidade da Beira Interior(贝拉内斯大学) Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。

Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16035 2026-07-30 cs.LG cs.AI 版本更新 62%

Equivariant Eikonal Neural Networks: Grid-Free, Scalable Travel-Time Prediction on Homogeneous Spaces

等变 eikonal 神经网络:齐性空间上无网格、可扩展的走时预测

Alejandro García-Castellanos, David R. Wessels, Nicky J. van den Berg, Remco Duits, Daniël M. Pelt, Erik J. Bekkers

机构 * Amsterdam Machine Learning Lab (AMLab), University of Amsterdam(阿姆斯特丹机器学习实验室(AMLab),阿姆斯特丹大学) New Theory(新理论) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Leiden Institute of Advanced Computer Science, Universiteit Leiden(莱顿高级计算机科学研究所,莱顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将等变神经场与神经 eikonal 求解器结合的新型框架,用于齐性空间等任意黎曼流形的走时预测,经地震走时建模验证,性能优于现有基于神经算子的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 62%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 62%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04364 2026-07-29 cs.CV cs.LG 版本更新 62%

Spatially Grounded Concept Bottleneck Models via Part-Factorized Attention

通过部分分解注意力的空间基础概念瓶颈模型

Dhanesh Ramachandram

机构 * Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出一种部分分解的概念瓶颈模型,通过空间先验约束注意力,在细粒度识别中实现可解释性并提升定位精度。

Comments Updated references, abstract and rewrite to remove terse language

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10643 2026-07-29 stat.ML cs.AI cs.LG 版本更新 62%

TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models

TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因

Yuchi Tang, Iñaki Esnaola, George Panoutsos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。

Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22612 2026-07-28 cs.SC cs.AI cs.LG cs.MS 新提交 62%

Quotient Tree Arithmetic: Deferred-Division Computation with Bounded Symbolic Depth and Cross-Subtree Cancellation

商树算法:具有有界符号深度和跨子树抵消的延迟除法计算

Gregory Magarshak

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究提出商树算法(QTA),值以延迟商对表示,比值延迟求值。有界深度增长、跨子树抵消和延迟稳定性三个定理支撑。用于机器学习训练有多种优势,还提出矢量化硬件归一化指令,代数基础是环的局部化,联系代数结构理论与硬件原生算术。

Comments 20 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15553 2026-07-28 cs.CV cs.LG 版本更新 62%

Self-Distillation of Hidden Layers for Self-Supervised Representation Learning

隐藏层自蒸馏用于自监督表示学习

Scott C. Lowe, Anthony Fuller, Sageev Oore, Evan Shelhamer, Graham W. Taylor

机构 * Vector Institute(向量研究所) Carleton University(卡尔顿大学) Dalhousie University(达尔豪斯大学) University of British Columbia(不列颠哥伦比亚大学) University of Guelph(圭尔夫大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Bootleg方法,通过预测教师网络多层隐藏层的潜在表示,提升自监督学习中高层概念特征的学习能力,在ImageNet-1K等数据集上表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 62%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20691 2026-07-24 cs.CV cs.AI 新提交 62%

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis

用于可靠乳腺超声诊断的空间基础概念瓶颈模型

Moshiur Rahman Tonmoy, Dunren Che, Haitham Y. Adarbah, Afzel Noore

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究乳腺超声诊断中概念瓶颈模型可信度受监督限制问题,提出空间基础概念瓶颈模型(SG-CBM),利用病变轮廓弱监督,通过导出特定区域训练概念图,经交叉验证等提升诊断指标与概念证据空间对齐,强调数据质量监督设计及可信度验证的必要。

Comments Accepted to the Workshop on Data Quality Aware, High-Performance, and Trustworthy AI Systems for Healthcare at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 62%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20152 2026-07-23 cs.LG cs.AI stat.ML 新提交 62%

Active Inference as a Convex Markov Decision Process

作为凸马尔可夫决策过程的主动推理

Nikola Milosevic, Nicolás Hinrichs, Nico Scherf

机构 * Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究将主动推理构建为策略优化,证明其可表述为凸马尔可夫决策过程,分析了相关公式并推导MD算法,表明结合世界模型学习与策略优化能赋予主动推理执行性强化学习结构,为其奠定理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19793 2026-07-23 cs.AI cs.CV 新提交 62%

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

多模态智能体搜索中的无声故障:一种诊断分类法与跨评判者评估

Zhengxian Wu, Junjie Gao, Kai Yang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态智能体搜索中无声故障这一隐藏可靠性问题,引入六类分类法,构建轨迹级诊断管道,通过实验表明表面准确性高估真实正确性,且无声故障与能力相关、常转移。

Journal ref SIGIR 2026 SynthIR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18850 2026-07-22 cs.CV cs.AI 新提交 62%

OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation

OPD-IAD:通过策略内自蒸馏从语言判断到工业异常检测

Shuimu Chen, Jing Jin, Nan Su, Hongbo Xu, Zebang Cheng, Wenming Yang, Fei Ma, Guijin Wang

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究如何利用大型视觉语言模型进行工业异常检测,提出OPD-IAD框架,通过策略内自蒸馏和语言引导视觉锚定,将语言判断转化为像素级异常图,在相关方法中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17564 2026-07-21 cs.AI cs.LG 新提交 62%

ZifaMem: Structured Memory for Persona, Preference, and Emotional Continuity in AI Companions

ZifaMem:人工智能伴侣中用于人物形象、偏好和情感连续性的结构化记忆

Jingzhe Fang, Guozhi Xu, Yunfan Cui, Xiaochen Yang, Zhangyu Hua

机构 * ZifaCorp(紫发公司) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能伴侣情感连续性问题,提出结构化记忆系统ZifaMem,通过组织对话形成多种记忆模型。实验表明其能提升情商得分、改善人物形象基础等,多种记忆系统均有改善,且ZifaMem与Mem0在主要偏好端点统计等效,相关工具已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 62%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16903 2026-07-21 cs.CY cs.AI cs.CL cs.LG 新提交 62%

A Method for Learning Value Systems in Generative AI

一种在生成式人工智能中学习价值系统的方法

Andrés Holgado-Sánchez, Holger Billhardt, Sascha Ossowski

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究生成式人工智能中价值系统学习问题,提出将先前验证的方法用于此场景,基于成对偏好数据同时学习价值基础实现与价值系统表示,算法动态排序,评估显示其性能优、权衡小且可解释性强。

Comments Full version of a to be published paper in proceedings of the 9th AAAI/ACM conference in AI, Ethics and Society (AIES 2026). Includes supplementary material. 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏