arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2606.27375 2026-06-26 cs.RO 新提交 50%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27098 2026-06-26 cs.AR 新提交 50%

Residual GPU Cache State on Apple M4 Pro

Apple M4 Pro 上的残留 GPU 缓存状态

Faruk Alpay, Baris Basaran

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过测量 Apple M4 Pro 上 GPU 命令完成后的缓存状态,发现大 GPU 足迹会导致后续 CPU 访问变慢,但第二次访问可消除大部分开销,表明存在残留共享缓存置换而非 DRAM 争用。

Comments 16 pages, 10 figures, 2 tables; ancillary artifacts included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03371 2026-06-26 cs.CL 版本更新 50%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25533 2026-06-25 cs.CR cs.CL 新提交 50%

Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

检索增强生成中的安全与隐私:构建可信系统的架构、威胁、防御与未来方向

Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering(电子与电气工程系) Birla Institute of Technology and Science, Pilani, Pilani Campus(比拉理工学院和科学学院,比拉校区) Department of Computer Engineering, KIIT University(计算机工程系,KIIT大学) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory(量子云计算与分布式系统(qCLOUDS)实验室) Department of Computing and Information Systems(计算与信息系统系) The University of Melbourne(墨尔本大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了检索增强生成系统在集中式、设备端、联邦和混合范式下的隐私与安全挑战,提出了涵盖检索、上下文构建和生成阶段的统一威胁分类,并分析了攻击类别及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25610 2026-06-25 astro-ph.IM astro-ph.GA 新提交 50%

The Galaxy's Guide to the Tokenizer: A Benchmark for Scientific Foundation Models

银河系分词器指南:科学基础模型的基准测试

Sogol Sanjaripour, Michael J. Smith, Manuel Pérez-Carrasco, Juan Rafael Martínez-Galarza, Bahram Mobasher, Gabriela Canalizo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究在统一transformer框架下比较四种分词策略对天文图像重建和物理属性预测的影响,发现重建与表征质量解耦,无单一方法全面最优。

Comments Accepted as a spotlight talk at the Conference on Physics and AI (PAI) 2026, Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19157 2026-06-25 eess.AS cs.CL 新提交 50%

IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages

IndicContextEval:评估8种印度语言音频大语言模型上下文利用能力的基准

Sakshi Joshi, Dhruv Subhash Rathi, Sanskar Singh, Eldho Ittan George, R J Hari, Kaushal Bhogale, Mitesh M. Khapra

机构 * AI4Bharat, Indian Institute of Technology Madras, India(AI4Bharat,印度理工学院马德拉斯分校) Sarvam AI, India(Sarvam AI,印度)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出IndicContextEval基准,包含8种印度语言555位说话人的56小时自然语音,通过7级提示框架评估音频大语言模型是否真正利用上下文而非依赖参数化知识。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13814 2026-06-25 cs.IR 新提交 50%

TASR: Training-Free Adaptive Stopping for Iterative Retrieval

TASR:无需训练的迭代检索自适应停止规则

Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出TASR,一种无需训练的迭代检索停止规则,通过重复答案检测和逻辑回归边际阈值减少冗余检索,在多种配置下保持高F1值并降低调用次数。

Comments 20 pages, 5 figures. Accepted at Agent4IR Workshop, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07826 2026-06-25 quant-ph math-ph math.MP 新提交 50%

The classical boundaries of the EPR argument and quantum ontology

EPR论证与量子本体论的经典边界

Vincenzo Chilla

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过希尔伯特空间经典力学将经典性归结为布尔性逻辑约束,指出EPR论证揭示的是其前提的经典边界而非量子不完备性,并基于观察环境与观察对象的结构二分提出一种语境依赖的量子本体论。

Comments 41 pages, corrected one mathematical equation, minor corrections and changes in the text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24610 2026-06-24 cs.CL 新提交 50%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24448 2026-06-24 cs.RO 新提交 50%

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

监督幸存信息:基于几何引导的合成机器人视频VLA适配

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10452 2026-06-24 cs.CL 50%

NOSE: Neural Olfactory-Semantic Embedding with Tri-Modal Orthogonal Contrastive Learning

NOSE:神经嗅觉-语义嵌入与三模态正交对比学习

Yanyi Su, Hongshuai Wang, Zhifeng Gao, Jun Cheng

机构 * State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University, Xiamen, China(厦门大学固体表面物理化学国家重点实验室,化学与化学工程学院,厦门,中国) DP Technology(DP技术) Laboratory of AI for Electrochemistry (AI4EC), Tan Kah Kee Innovation Laboratory (IKKEM), Xiamen, China(电化学人工智能实验室(AI4EC),淡凯实验室(IKKEM),厦门,中国) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(人工智能研究院,厦门大学,厦门,中国)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出NOSE框架,通过三模态正交对比学习实现分子结构、受体序列和语言描述的对齐,解决嗅觉路径表示学习的碎片化问题,实现生物基础与语义可解释性的统一。

Comments Accepted to the ACL 2026 Main Conference

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, 19615-19647

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 50%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23052 2026-06-23 eess.AS 新提交 50%

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

CAAD:对比音频感知蒸馏用于高效语音语言模型

Chun-Wei Chen, Tzu-Quan Lin, Ke-Han Lu, Wei-Ping Huang, Hung-Yi Lee

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出对比音频感知蒸馏(CAAD)框架,通过同步教师强制策略将教师模型的对比推理内化到学生模型权重中,在Dynamic-SUPERB上相对提升约8%,并减少语言偏倚。

Comments Accepted to interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22397 2026-06-23 cs.RO 新提交 50%

Do Rigid-Body Simulators Dream of Soft Robots? Learning Contact-Rich Manipulation for Tendon-Driven Continuum Robots

刚体模拟器会梦见软体机器人吗?学习肌腱驱动连续体机器人的接触丰富操作

Chengnan Shentu, Nicholas Baldassini, Tongjia Zheng, Priyanka Rao, Jessica Burgner-Kahrs

机构 * University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对肌腱驱动连续体机器人缺乏接触丰富操作模拟基础设施的问题,提出基于连续介质力学的离散化方法,将软体机器人原生集成到MuJoCo中,实现仿真到真实世界的零样本迁移。

Comments Project Page: https://continuumroboticslab.github.io/opencr-mujoco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 50%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21059 2026-06-23 cs.CR 新提交 50%

DEFENGRAPH: Knowledge Graph-Enhanced LLMs for Blue Team Cyber Defense

DEFENGRAPH:面向蓝队网络防御的知识图谱增强型大语言模型

Zhen Wang, Kristen Moore, Qin Wang, Guangsheng Yu, Minjune Kim, Diksha Goel, Gang Li, Ahmed Ibrahim, Ahmad Mohsin, Helge Janicke

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出DEFENGRAPH框架,通过双层静态-动态知识图谱与图路径检索、上下文过滤和重排序增强LLM的上下文推理,在红蓝对抗演习数据上显著提升防御决策的召回率和精确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20113 2026-06-23 cs.CL cs.IR 新提交 50%

When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation

流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化

Elroy Galbraith

机构 * SMG Labs(SMG实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10703 2026-06-23 cs.CL cs.IR 版本更新 50%

LatentCRS: A Variational EM Framework for Bridging Semantics and Behavior in LLM-based Conversational Recommendation

LatentCRS:一种用于桥接基于LLM的对话推荐中语义与行为的变分EM框架

Guanrong Li, Kuo Tian, Jinnan Qi, Qinghan Fu, Zhen Wu, Rui Xia, Xinyu Dai

机构 * Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出LatentCRS框架,通过变分EM过程桥接LLM的语义空间与用户行为模式,解决对话推荐中语义理解与推荐精度不匹配的问题,实验表明其有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20369 2026-06-19 cs.CL 新提交 50%

CATCH-ME if you RAG: a dataset of Contextually Annotated multi-Turn Counterspeech against Hate and Misinformation Exchanges

CATCH-ME if you RAG:针对仇恨与虚假信息交流的上下文注释多轮对抗言论数据集

Helena Bonaldi, Genoveffa Martone, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Università Cattolica del Sacro Cuore(圣心天主教大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出首个大规模、专家策划的多语言对话数据集,覆盖仇恨与虚假信息重叠问题,包含事实核查锚定和跨度标注,支持RAG系统训练更可信的对抗言论模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19644 2026-06-19 cs.SE 新提交 50%

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究

Richard Sserunjogi, Daniel Ogenrwot, John Businge

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。

Comments 48 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10416 2026-06-19 cs.RO 版本更新 50%

TASC: Task-Aware Shared Control for Relational Telemanipulation

TASC:面向关系遥操作的任务感知共享控制

Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(KU莱顿机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(KU莱顿电气工程系,语音与图像处理研究单位)

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出TASC框架,通过视觉构建开放词汇交互图推断任务级用户意图,并基于空间约束提供共享控制辅助,提升关系遥操作效率与泛化能力。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19122 2026-06-18 cs.RO 新提交 50%

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning

基于混合2D-3D学习的人行道机器人单目3D占用感知

Yukai Ma, Joe Lin, Liu Liu, Honglin He, Lulu Ricketts, Brad Squicciarini, Yong Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) Coco Robotics(Coco机器人) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出WalkOCC框架,通过混合射线行进单目3D占用感知,结合LiDAR-RGB配对数据与大规模无配对单目图像学习,提升人行道机器人导航的预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05925 2026-06-18 cs.RO 版本更新 50%

DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions

DexSynRefine:合成与精炼人-物交互运动以实现物理可行的灵巧机器人动作

Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

机构 * Korea Institute of Science and Technology(韩国科学技术院) KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出DexSynRefine框架,通过HOI-MMFP运动先验合成手-物轨迹,结合任务空间残差强化学习和接触动力学适应,将人-物交互数据转化为物理可行的灵巧操作,在五个任务上成功率提升50-70个百分点。

Comments Project page: https://dexsynrefine.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18103 2026-06-17 cs.CL cs.IR 新提交 50%

HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice

HistoRAG:通过批判性技术实践将历史方法论嵌入检索增强生成

Noah J. Kim-Baumann, Torsten Hiltmann

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对历史学等解释性学科,提出HistoRAG框架,通过分离检索与生成、时间窗口化、LLM作为评判者等架构干预,将历史编纂原则转化为RAG设计,解决标准RAG中的时间偏差、相关性评估等问题。

Comments 25 pages, 6 figures. Companion preprint to a Journal of Digital History notebook article (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17861 2026-06-17 cs.CL 新提交 50%

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

GameCraft-Bench:智能体能否在真实游戏引擎中端到端构建可玩游戏?

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Hunyuan Team, Tencent(腾讯混元团队) USTB(北京科技大学) DualverseAI SJTU(上海交通大学) NUS(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GameCraft-Bench基准,评估编码智能体在Godot引擎中端到端生成可玩游戏的能力,最强智能体仅达41.46%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17688 2026-06-17 cs.CL 新提交 50%

LLMs Infer Cultural Context but Fail to Apply It When Responding

LLMs 能推断文化背景但在回应时未能应用

Yisong Miao, Jian Zhu, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究大型语言模型在生成文化适应性回应时,能否根据用户文化背景使用本地计量单位。提出CAPRI数据集,实验发现模型能推断文化背景但常未能应用,除非明确提示。

Comments 9 pages, 7 figures, 2 tables (24 pages, 12 figures, 8 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18009 2026-06-17 physics.soc-ph nlin.AO physics.hist-ph physics.pop-ph 新提交 50%

Making Sense of Symbols: Yin and Yang in Zurich

解读符号:苏黎世的阴阳

Frank Schweitzer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过苏黎世纬度上的白天时长模型,将阴阳符号与昼夜和季节现象关联,并揭示其几何中的黄金比例与公历的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16009 2026-06-17 cs.CL cs.HC 新提交 50%

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

弥合可用性差距:口译研究对机器口译设计的启示

Claudio Fantinuoli

机构 * University of Mainz(美因茨大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文定义机器口译为语音翻译的子领域,指出其存在“准确性幻觉”,并借鉴口译研究提出未来设计的三个优先方向:能动性、共同基础与体验,以弥合可用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02854 2026-06-17 cs.PL cs.LO math.CT 版本更新 50%

Fixed-Point Scaffolding in the Clef Programming Language

Clef 编程语言中的不动点脚手架

Houston Haynes

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于不动点组合子的编译器中间表示方法,通过范畴论构造实现类型结构保持和正确性验证,并利用 MLIR 工具链支撑实际编译。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏