arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 784 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 784 篇

2607.04761 2026-07-07 cs.CV 新提交 50%

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

专题命中 其他LLM :language model(abstract)

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 50%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 其他LLM :language model(abstract)

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04382 2026-07-07 cs.GT 新提交 50%

Beyond Self-Resolution: Settlement Factorization for Robust Natural Language Mechanism

超越自我解析:用于稳健自然语言机制的结算分解

Nicolas Della Penna

专题命中 其他LLM :language model(abstract)

AI总结 研究语言模型中介付费建议时的结算分解问题,核心方法是将报告硬化为官方记录等,主要贡献是得出类似揭示原理的结果,确定自身报告泄漏量是机制固有不变量等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03419 2026-07-07 cs.CY cs.SE 新提交 50%

Analyzing the Difficulty of Programming Assignments with Interpretable Knowledge Component Metrics

用可解释的知识组件指标分析编程作业的难度

Tsvetomila Mihaylova, Jing Fan, Bita Akram, Narges Norouzi, Peter Brusilovsky, Juho Leinonen, Arto Hellas

专题命中 其他LLM :LLM(abstract)

AI总结 研究如何用知识组件(KC)理解编程入门课程作业难度与学生学习困境,分析基于KC的指标,如作业KC数量及连续作业间KC覆盖变化,揭示相关规律并提出分析框架。

Comments Accepted to IEEE FIE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02949 2026-07-07 cs.SE 新提交 50%

BeSpec: Behavior-Level Specification Alignment for Code Generation

BeSpec:用于代码生成的行为级规范对齐

Qinghua Xu, Guancheng Wang, Boxi Yu, Lionel Briand

专题命中 其他LLM :LLM(abstract)

AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01339 2026-07-03 hep-ph astro-ph.HE hep-ex hep-th 新提交 50%

Electron stability constrains neutrino time delays

电子稳定性限制中微子时间延迟

Mauricio Bustamante, José Manuel Carmona, José Luis Cortés, Ardit Gkioni, Maykoll A. Reyes

专题命中 其他LLM :prompting(abstract)

AI总结 通过分析电子稳定性,约束洛伦兹不变性破缺(LIV)对中微子时间延迟的解释,排除亚光速LIV解释高能宇宙中微子延迟的可能性。

Comments 6 pages, 2 figures, plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31363 2026-07-03 cs.CV 新提交 50%

Language-Assisted Super-Resolution from Real-World Low-Resolution Patches

语言辅助的真实世界低分辨率图像超分辨率

Joonkyu Park, Kyoung Mu Lee

机构 * IPAI, Seoul National University(首尔大学IPAI)

专题命中 其他LLM :language model(abstract)

AI总结 提出LA-SR框架,利用视觉语言模型在语言空间中对齐LR和HR图像,通过语言内容损失和语言质量损失实现无配对真实LR图像的超分辨率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00804 2026-07-02 cs.CV 新提交 50%

Spotted: Location-informed Reidentification of Hyenas and Leopards in Camera Trap Surveys

Spotted: 基于位置信息的相机陷阱调查中鬣狗和豹子的重新识别

Halil Sina Kelebek, Julia Hindel, Kobus Hoffman, Lauren Hoffman, Andrew Loveridge, Bob Mandinyenya, Kudakwashe Ncube, Justin Seymour-Smith, Andrea Sibanda, Abhinav Valada, Matthew Wijers, Daniele De Martini

机构 * Oxford Robotics Institute, University of Oxford(牛津大学牛津机器人研究所) Department of Computer Science, University of Freiburg(弗莱堡大学计算机科学系) Bubye Valley Conservancy(布比耶谷保护区) Wildlife Conservation Research Unit, Department of Biology, University of Oxford(牛津大学生物系野生动物保护研究组) Gonarezhou National Park(戈纳雷若国家公园) Oxford e-Research Centre, University of Oxford(牛津大学牛津电子研究中心)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出Spotted框架,结合视觉相似性与时空可行性先验,减少专家审核量,在三个数据集上Top-5准确率提升最高9pp,查询比较量减少69pp。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00635 2026-07-02 cs.SE 新提交 50%

Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators

从执行视频中检查程序恢复:针对不可信生成器的可靠预言机

Yuan Si, Jialu Zhang

专题命中 其他LLM :language model(abstract)

AI总结 提出一种双层验证预言机,通过静态检查证明镜头等价性并颁发证书,确保从不正确程序中拒绝,从而可靠恢复Scratch程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 50%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 其他LLM :language model(abstract)

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31909 2026-07-01 cs.RO 新提交 50%

CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations

CoDex: 无需演示学习组合式灵巧功能性操作

Bowen Jiang, William Painter Reger, Roberto Martin-Martin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他LLM :language model(abstract)

AI总结 提出零演示框架CoDex,结合视觉语言模型与强化学习,自主发现并执行涉及物体内部机制操控的灵巧操作策略,在多种工具任务中验证了其有效性。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026. Project page: https://robin-lab.cs.utexas.edu/CoDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31245 2026-07-01 cs.CV 新提交 50%

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

机构 * Zhejiang University(浙江大学) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357) IHU Strasbourg(斯特拉斯堡IHU) Technical University of Munich(慕尼黑工业大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出双曲空间手术视频-语言预训练框架HyperVLP,通过保留层次结构、缓解结构假负例并强制父子语义一致性,提升零样本和少样本手术阶段识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31125 2026-07-01 cs.CV 新提交 50%

WildProp: Visual Estimation of Wildlife Body Proportions at Scale

WildProp: 大规模野生动物身体比例视觉估计

Mustafa Chasmai, Aaron Sun, Subhransu Maji

专题命中 其他LLM :foundation model(abstract)

AI总结 提出WildProp,一种无需训练的框架,通过检索驱动的对应关系从大规模非约束图像中估计野生动物身体比例分布,无需逐物种训练,在鸟类和两栖动物数据集上中位相对误差10-20%。

Comments Accepted to ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31007 2026-07-01 cs.CV 新提交 50%

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos

手术视频中稀疏功能标志点定位的密集结构先验

Chenyan Jing, Hao Ding, Lalithkumar Seenivasan, Jacob M. Delgado López, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出利用SAM 3作为结构先验,通过零样本点提示掩码和轻量级精炼框架,在无像素级标注下实现手术视频中功能标志点定位,F1达72.4%(尖端)和58.0%(锚点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31265 2026-07-01 math-ph hep-th math.MP 新提交 50%

Boundaries in the Instantaneous Formulation of Field Theories

场论瞬时形式中的边界

Silvester G. A. Borsboom

专题命中 其他LLM :prompting(abstract)

AI总结 研究经典场论中协变与瞬时形式下的边界条件,揭示恒定狄利克雷边界条件导致瞬时状态空间为满足该条件的场位形空间的切丛,而仅要求场速度在边界为零时产生扇区结构,每个扇区由边界位形标记的切丛构成,经勒让德变换得到叶状典范泊松结构的扇区相空间,应用于杨-米尔斯理论并与通量超选择扇区关联。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27111 2026-06-26 cs.HC cs.SI 新提交 50%

Behind the Mask: A Taxonomic Analysis of Activities in Online Social Networks

面具背后:在线社交网络中活动的分类学分析

Debora F De Souza, Gabriela Beltrao, Berta Chulvi, Sergio Dantonio, Mehmet Gokay Ozerim, Javier Torregrosa, Adrian Giron, Angel Panizo, Pablo Miralles Gonzalez, Helena Liz, Javier Huertas Tato, Sonia Sousa, Alejandro Martin, Monika Maciuliene, David Camacho

专题命中 其他LLM :prompting(abstract)

AI总结 通过专家协作和文献综述设计分类法,分析恶意行为者的特征与活动,并以反移民话语案例研究验证其帮助识别虚假信息传播的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26075 2026-06-25 astro-ph.EP 新提交 50%

Glossy Silicate Clouds on the Scorched Dayside of LTT9779b

LTT9779b灼热昼侧的硅酸盐云

Suman Saha, James S. Jenkins, Jonathan Brande, Reza Ashtari, Ian J. M. Crossfield, Sarah Stamer, Diana Dragomir, Kevin B. Stevenson, Vivien Parmentier, Thomas M. Evans-Soma, Tansu Daylan, Hayley Beltz, Emma Esparza-Borges

专题命中 其他LLM :prompting(abstract)

AI总结 利用JWST NIRISS和NIRSpec/GH95观测,首次在LTT9779b昼侧以3-5σ置信度探测到硅酸盐云,并发现高反射云层而非高金属丰度是其高光学反照率的原因。

Comments 18 pages, 11 figures, 2 tables. Accepted for publication in ApJ Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交 50%

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23593 2026-06-23 cs.RO cs.CV 新提交 50%

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

机器人辅助手术中的实时多模态活动感知错误检测

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他LLM :prompting(abstract)

AI总结 提出统一框架,利用视频、运动学数据和文本提示等多模态输入,通过活动提示和活动感知视觉嵌入,在JIGSAWS和SAR-RARP50数据集上分别提升F1分数达5%和16.6%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22214 2026-06-23 cs.CR 新提交 50%

TRACE: A Threat Modelling Methodology for Distributed, Cloud-First, and Decentralized Organisations

TRACE:面向分布式、云优先和去中心化组织的威胁建模方法

Stefan Beyer

专题命中 其他LLM :language model(abstract)

AI总结 提出TRACE方法,通过三层模型(协议、系统、组织)和证据链,解决现有威胁建模在云优先、去中心化场景下对授权恶意行为、共谋等风险的遗漏问题。

Comments 12 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09717 2026-06-23 cs.SD eess.AS 新提交 50%

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

什么让合成语音听起来讽刺?一项韵律控制的感知研究

Zhu Li, Shekhar Nayak, Matt Coler

机构 * University of Groningen(格罗宁根大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 通过可控神经TTS系统操纵语速、音高变化和响度,发现响度主要驱动人类对讽刺的感知,而模型更依赖语速,揭示了韵律线索权重差异。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19598 2026-06-19 cs.RO 新提交 50%

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification

Fail-RAG:一种基于检索增强生成的机器人故障识别框架

Ameya Salvi, Jie Hu

机构 * Hitachi America, Ltd.(日立美国有限公司)

专题命中 其他LLM :language model(abstract)

AI总结 提出Fail-RAG框架,利用检索增强生成和视觉语言模型,通过嵌入故障图像和上下文信息并查询数据库,实现机器人操作故障的高效检测,在仓库自动化任务中平均检测准确率提升25个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17721 2026-06-17 cs.IR 新提交 50%

Understanding and Debugging Failures in N-Gram-Based Generative Retrieval

理解和调试基于N-Gram的生成式检索中的失败

Richard Takacs, Adrian Bracher, Svitlana Vakulenko

专题命中 其他LLM :language model(abstract)

AI总结 本文通过分类法、实证分析和可视化工具,系统研究了基于n-gram的生成式检索方法(如SEAL和MINDER)的失败模式,包括歧义文档ID、低标识符多样性和特定标识符的不成比例影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17468 2026-06-17 cs.IR 新提交 50%

RSRank: Learning Relevance from Representational Shifts

RSRank: 从表示偏移中学习相关性

Archit Gupta, Sai Sundaresan, Debabrata Mahapatra

专题命中 其他LLM :language model(abstract)

AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14880 2026-06-16 cs.SI 新提交 50%

Can We Unmask the Underground? Detecting and Predicting Hidden Forum Interactions

我们能揭露地下世界吗?检测和预测隐藏的论坛互动

Abdoul Nasser Hassane Amadou, Imane Fouad, Anas Motii

专题命中 其他LLM :language model(abstract)

AI总结 提出无监督框架HADES,利用预训练语言模型对用户文本交互进行语义嵌入,聚类检测地下论坛中主导和隐藏的威胁社区,并在三个主要论坛上验证其有效性,可提前一年预测社区形成。

Comments Accepted at ARES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14411 2026-06-15 cs.HC 新提交 50%

Fabula: Building a Narrative Storytelling Sidekick with the Writers' Community

Fabula: 与作家社区共建叙事故事创作助手

Piotr Mirowski, Ben Wedin, Reinald Kim Amplayo, Rich Galt, Duncan Williams, Rida Qadri, Jaume Sanchez-Elias, Erin Drake-Kajioka, Sian Gooding, Lucia Lopez-Rivilla, Joao G. M. Araujo, Lion Schulz, Satinder Baveja, Shakir Mohamed, Edward Grefenstette, Laura Rimell, Richard Evans

专题命中 其他LLM :language model(abstract)

AI总结 通过参与式AI设计,与42位专家合作评估Fabula交互式写作应用,探讨基于叙事理论的故事规划、语言模型自动评估及UI设计对故事质量和创造力的影响。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13675 2026-06-15 cs.RO 新提交 50%

Improving Robotic Generalist Policies via Flow Reversal Steering

通过流反转引导改进机器人通用策略

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 其他LLM :language model(abstract)

AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13215 2026-06-12 eess.SY cs.CE cs.SY 新提交 50%

Mitigating business risks from renewable PPA power sourcing uncertainties for European green hydrogen production: Robust system design, regulatory adjustments and offtake flexibility

缓解可再生能源PPA电力采购不确定性对欧洲绿氢生产的商业风险:稳健系统设计、监管调整与承购灵活性

Jonathan Brandt, Astrid Bensmann, Richard Hanke-Rauschenbach

专题命中 其他LLM :prompting(abstract)

AI总结 针对欧洲绿氢生产因可再生能源电力采购规则(如附加性和时间相关性)导致的商业风险,本研究通过系统设计优化、监管调整和承购灵活性分析,提出缓解措施并评估成本影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12811 2026-06-12 cond-mat.mtrl-sci 新提交 50%

A wrong ground-state structure of HfO$_2$ predicted by machine-learning interatomic potentials based on the PBE functional

基于PBE泛函的机器学习原子间势预测的HfO$_2$错误基态结构

Shuqi Tang, Jinchen Wei, Kang Wang, Junjie Zhou, Yihan Zhang, Menglin Huang, Shiyou Chen

专题命中 其他LLM :foundation model(abstract)

AI总结 发现基于PBE泛函的机器学习势预测HfO2的I41/amd结构比已知基态P21/c更稳定,错误源于PBE泛函过度稳定含六配位Hf-O八面体的低密度结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11819 2026-06-11 cs.IT math.IT 新提交 50%

STCC: A Unified Source-Channel Semantic Token Coding Framework for Semantic Communications

STCC:一种用于语义通信的统一源信道语义令牌编码框架

Zhicheng Bao, Chen Dong, Sen Wang, Long Liu, Nan Ma, Hao Chen, Xiaodong Xu, Yinqiu Liu, Ping Zhang

专题命中 其他LLM :foundation model(abstract)

AI总结 提出STCC框架,通过语义令牌编解码器(STC)将离散语义令牌映射为几何结构化的星座图,利用三重损失优化使信道噪声转化为拓扑错误,在低信噪比下显著优于传统系统。

详情

展开后加载摘要…

URL PDF HTML 收藏