arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Georgia Institute of Technology(佐治亚理工学院)

共收录 2663
2609.03460 2026-09-04 cs.AI 新提交

Beyond "Made with AI": Visualizing Provenance Density to Mitigate the Transparency Penalty

超越“AI生成”:可视化来源密度以缓解透明度惩罚

Qing Zhang, Yifei Huang, Juyoung Lee, Thad Starner, Jun Rekimoto

机构 * The University of Tokyo(东京大学) Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Korea Advanced Institute of Science and Technology(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院) Sony CSL Kyoto(索尼京都计算机科学实验室)

AI总结 该研究针对生成式AI带来的“流畅陷阱”问题,提出Provenance Density界面可视化文本中已验证主张的密度,经用户研究和技术审计证实其能提升内容辨别能力,为AI内容透明度提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03402 2026-09-04 cs.AI 新提交

A Prompt-Engineering Approach to Develop Scalable, Flexible, and Real-Time Hybrid Micro-Level Personalization in a General Purpose AI Teaching Assistant

一种用于在通用AI助教中开发可扩展、灵活且实时的混合微观层面个性化的提示工程方法

Saptarshi Basu, Sandeep Kakar, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本研究提出基于提示工程的框架,通过六个学习者维度和布鲁姆教育目标分类法,在无需重新训练LLM的情况下实现通用AI助教的个性化,经实验验证可产生自适应响应。

Comments 7 pages, 9 figures, IAAI27 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03153 2026-09-04 cs.CV 新提交

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

VeriPhy:用于世界模型评估与优化的智能体物理推理系统

Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学) Adobe Research(奥多比研究院)

AI总结 本文提出可审计的物理验证系统VeriPhy,通过纯文本规划器编译物理义务,结合冻结低级专家与三值状态裁决,在1500片段语料库评估中缺陷识别效果优于对比方法,可用于世界模型评估优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28974 2026-09-04 cs.AI 版本更新

From Analytics to Tumor Boards: An Evidence-Linked Multi-Agent Workflow for Oncology Feature Extraction

从分析学到肿瘤委员会:一种用于肿瘤学特征提取的证据关联多智能体工作流

Daniel Kang, Michelle Hu, Soorya Ram Shimgekar, Shayan Vassef, Yufan Wang, Anit Kumar Sahu, Munmun De Choudhury, Vedant Das Swain, Christian Poellabauer, Li Yan Khor, Koustuv Saha, Robert Wojciechowski, Elliot Kidd, Piyum Zonooz, Navin Kumar

机构 * Nimblemind School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) NYU Tandon School of Engineering, New York University(纽约大学坦登工程学院) Florida International University(佛罗里达国际大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) Singapore General Hospital(新加坡中央医院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) OncoLens

AI总结 该研究针对肿瘤学文档的结构化提取需求,提出nMAS多智能体工作流,在230份肿瘤学文档上的F1值达85.0%,优于对照模型,验证了其将碎片化肿瘤学文档转为结构化数据的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27624 2026-09-04 cs.RO cs.LG 版本更新

Physics-Guided Robotic Radiation Source Localization along Arbitrary Measurement Paths in Unstructured Environments

物理引导的机器人辐射源定位:非结构化环境中沿任意测量路径

Hojoon Son, Kai Tan, Fan Zhang

机构 * George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology(乔治·W·伍德拉夫机械工程学院,佐治亚理工学院)

AI总结 提出基于物理信息机器学习(PIML)的框架,使机器人沿任意路径在未知环境中精确估计辐射源位置,避免接近源,并通过并行计算提高鲁棒性。

Comments 17 pages, 14 figures, 2 tables

Journal ref IEEE Transactions on Automation Science and Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24851 2026-09-04 cs.LG 版本更新

Real vs. Complex Spectral Bases for Neural Operators: The Role of Green's Function Alignment

神经算子的实与复谱基:格林函数对齐的作用

Jason Sulskis, Sathya Ravi

机构 * Georgia Tech Research Institute(佐治亚理工学院研究 institute) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文提出Hartley神经算子(HNO),作为傅里叶神经算子(FNO)的纯实值镜像,通过离散Hartley变换替代FFT,并基于格林函数对称性理论,揭示了椭圆型算子适合实谱基、时变算子适合复谱基的预测性规则。

Comments Submitted to/in consideration for the 62nd Allerton Conference on Communication, Control, and Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08343 2026-09-04 cs.LG 版本更新

GENERIC-FNO: Embedding Energy Conservation and Entropy Production into Fourier Neural Operators

GENERIC-FNO:将能量守恒和熵产生嵌入傅里叶神经算子

Jason Sulskis, Sathya Ravi

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Georgia Tech Research Institute(佐治亚理工学院研究所)

AI总结 提出GENERIC-FNO,首个在函数空间直接嵌入非平衡热力学完整GENERIC结构的神经算子,通过秩一投影精确满足退化条件,实现能量守恒与熵产生,在超分辨率下保持结构保证。

Comments Under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01761 2026-09-03 stat.ML cs.LG 新提交

Pooling and Drift in Delayed Bandits

延迟多臂老虎机中的池化与漂移

Melika Baghi

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究针对延迟多臂老虎机问题,利用行动产生的状态池化结果,提出旋转算法与单副本算法,证明其 regret 上界,经实验可显著降低 regret。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02811 2026-09-03 cs.RO 新提交

Do Better Imagined Rollouts Mean Better Robot Control? A Controlled Study of World-Model Evaluation Under Feedback

更好的想象式回滚是否意味着更好的机器人控制?反馈下世界模型评估的对照研究

Dharini Raghavan, Amritpal Singh

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

AI总结 该研究通过差速驱动路径跟踪任务对照实验发现,离线回滚的感知与修正模式需匹配闭环操作,轨迹重放比回滚误差更能反映机器人控制性能,评估预测模型需明确预测时间范围和测量更新计划

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01896 2026-09-03 cs.LG cs.AI 新提交

OutageDiT: A Generative Foundation Model for Power Outage Forecasting and Scenario Simulation

OutageDiT:用于停电预测与场景模拟的生成式基础模型

Yunqin Zhu, Feng Qiu, Yao Xie

机构 * Georgia Institute of Technology(佐治亚理工学院) Argonne National Laboratory(阿贡国家实验室)

AI总结 OutageDiT是基于美国停电与天气记录训练的生成式基础模型,可生成15分钟分辨率的7天停电轨迹,能提升停电预测准确性与场景质量,支持零样本迁移及点预测、不确定性量化等功能。

Comments 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01836 2026-09-03 cs.CR cs.AI 新提交

Agent Memory Is a Surface for Endogenous Authorization Laundering

智能体记忆是内生授权洗钱的载体

Tommaso Cerruti, Mika Okamoto, Ansel Kaplan Erol

机构 * ETH Zurich(苏黎世联邦理工学院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究发现LLM智能体的持久化记忆会引发内生授权洗钱问题,EAL-Bench基准评估显示虚假权限会导致高比例未授权操作,两种安全措施可降低风险但存在安全-效用权衡。

Comments 36 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01788 2026-09-03 cs.CL cs.AI 新提交

VakyArth: Evaluating Pragmatic Competence in LLMs across Indic Languages

VakyArth:评估跨印度语言的大语言模型语用能力

Usneek Singh, Poorvaja Veera Balaji Kumar, Parth Nanda, Anand Madhusoodanan, Geyang Guo, Wei Xu, Junyi Jessy L

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究推出首个印度语言语用基准VakyArth,评估多语言LLM在印度语言文化相关语用现象上的表现,发现其存在系统性语用推理失败及语言间差异。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01437 2026-09-02 cs.SE cs.CL 新提交

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

HarnessDev:大型语言模型能否创建并迭代优化自身的智能体测试框架?

Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan, Wenhao Huang, Ge Zhang, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本研究提出HarnessDev基准,评估大型语言模型创建和迭代优化自身智能体测试框架的能力,发现其在部分任务上可达到人工基准水平,但性能提升不稳定且跨模型迁移有限。

Comments Project page: https://self-developing-agents.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01420 2026-09-02 cs.RO 新提交

Vision-Based Leader-Follower Formation Control for Cooperative UAVs in GPS-Degraded Environments

GPS退化环境下基于视觉的多无人机协同编队控制

Deekshitha Angadi, Naveena Budda, Vikas Agarwal, Rojesh Arunkumar Mulasa, Ravi Killamsetty, Mohamed Samshad, Narsimlu Kemsaram

机构 * Autonomous Robotics Systems Limited(自主机器人系统有限公司) University of Hyderabad(海得拉巴大学) Ideabytes Software India Private Limited(Ideabytes软件印度私人有限公司) Georgia Institute of Technology(佐治亚理工学院) Tata Consultancy Services(塔塔咨询服务公司) University of Malaya(马来亚大学)

AI总结 本文提出一种基于视觉的多无人机协同编队框架,通过YOLO检测器结合RGB-D相机实现领无人机实时定位,在GPS退化环境下可维持稳定编队,为现实应用提供实用基础。

Comments This paper has been accepted for publication in the Proceedings of the 2026 IEEE International Conference on AI and Security for Industrial IoT Systems (AI-SIIS 2026), 24-26 September, 2026, Hyderabad, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01158 2026-09-02 cs.LG cs.AI 新提交

Superposed Latent Autoencoder

叠加式潜在自编码器

Quanling Zhao, Jiaying Yang, Tianqi Zhang, Ziyang Hao, Fatemeh Asgarinejad, Flavio Ponzina, Tajana Rosing

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of California Riverside(加利福尼亚大学河滨分校) San Diego State University(圣迭戈州立大学)

AI总结 提出叠加式潜在自编码器(SLAE),通过学习叠加共享存储,在相同内存预算下改善重构-内存权衡,降低重构误差,还提升下游分类性能,为表示压缩提供新原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00999 2026-09-02 cs.CL cs.AI cs.LG 新提交

Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close

正确框架,错误规则:文化线索暴露了它们本应缩小的金融知识差距

Rania Elbadry, Ahmed Heakl, Saeed Almheiri, Fan Zhang, Muhra AlMahri, Xueqing Peng, Mohsinul Kabir, Shuyao Wang, Yi Han, Saadeldine Eletter, Duzhen Zhang, Preslav Nakov, Yuxia Wang, Fajri Koto, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) The University of Manchester(曼彻斯特大学) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,索菲亚大学“圣克莱门特·奥赫里德斯基”)

AI总结 该研究针对规范多元主义场景,以伊斯兰金融为案例,发现文化线索会引导模型选择特定框架但导致错误答案,揭示了不同模型在框架选择与准确率上的差异,凸显了模型的框架特定能力差距。

Comments Accepted into EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00518 2026-09-02 cs.LG q-bio.BM 新提交

Learning Task-Specific Antibody Representations via Function-Aware Masking

通过功能感知掩码学习任务特异性抗体表征

Ayan Goel, Thomas A. Walton, Amirali Aghazadeh

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(佐治亚理工学院电气与计算机工程学院) School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院)

AI总结 该研究提出功能感知掩码算法,通过对齐特定功能先验的掩码位置塑造抗体表征空间,提升了结构、CDR等相关任务性能,还开发了混合掩码策略平衡多维度目标。

Comments Accepted to MLCB 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00476 2026-09-02 cs.CV cs.HC 新提交

Less Is More: Balancing Positive and Negative Space in Visual Concept Blending

少即是多:视觉概念融合中正空间与负空间的平衡

Shishi Xiao, Adam J. Coscia, David H. Laidlaw

机构 * Brown University(布朗大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出一种自动视觉概念融合流程,结合视觉语言模型与几何约束识别区域,采用混合像素-矢量方法生成融合构图,经评估在表现力等方面优于基线,可用于可控图像与信息图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00184 2026-09-02 cs.CL cs.LG 新提交

Synthetic Worlds for Temporal Evaluation and Knowledge Updating in LLMs

用于大语言模型时序评估与知识更新的合成世界

Jonathan Zheng, Zirui Shao, Alan Ritter, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Zhejiang University(浙江大学)

AI总结 针对大语言模型知识过时问题,提出ParallelEvents基准与Synapse训练框架,实现无人工标注的可扩展知识插入,性能较现有方法提升14.23%。

Comments preprint, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00428 2026-09-02 astro-ph.EP cs.LG 新提交

Accelerating Chemical Kinetics for Exoplanet Atmospheres using Neural Networks

使用神经网络加速系外行星大气的化学动力学

Isaac Malsky, Xi Zhang, Tiffany Kataria, Matthew Graham, Ziyu Huang, Boris Bonev, Shang-Min Tsai, Elspeth K. H. Lee

机构 * Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室) University of California Santa Cruz(加州大学圣克鲁兹分校) California Institute of Technology(加州理工学院) Georgia Institute of Technology(佐治亚理工学院) NVIDIA Corporation(英伟达公司) University of California, Riverside(加州大学河滨分校) Institute of Astronomy and Astrophysics, Academia Sinica(中央研究院天文及天文物理研究所) University of Bern(伯尔尼大学)

AI总结 本文提出基于残差流图架构的机器学习局部框化学动力学求解器,实现系外行星大气模拟的微秒级推理,精度达百分级,速度远超经典求解器,可覆盖宽参数空间,性能优于常用机器学习架构。

Comments 15 pages, 7 figures. Accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00307 2026-09-02 cs.RO 版本更新

ScaRF-SLAM: Scale-Consistent Reconstruction with Feed-Forward Models and Classical Visual SLAM

ScaRF-SLAM: 基于前馈模型与经典视觉SLAM的尺度一致重建

Yuhao Zhang, Yifu Tao, Frank Dellaert, Maurice Fallon

机构 * Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院)

AI总结 提出一种解耦框架,将经典特征SLAM用于鲁棒跟踪,几何基础模型仅用于建图,通过尺度优化和子图融合实现高质量一致密集重建,在建筑级数据集上重建精度提升10%-20%。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29016 2026-09-02 astro-ph.IM astro-ph.CO cs.LG 版本更新

Three-dimensional Conditional Diffusion Models for Cosmological 21 cm Lightcone Emulation

用于宇宙学21厘米光锥模拟的三维条件扩散模型

Bin Xia, John H. Wise

机构 * Center for Relativistic Astrophysics, School of Physics, Georgia Institute of Technology, Atlanta, GA 30332, USA(相对论天体物理中心,物理学院,佐治亚理工学院,亚特兰大,GA 30332,USA)

AI总结 针对三维21厘米光锥模拟的困难,通过对比预处理、动态范围压缩、架构深度和训练时长等配置,发现Yeo-Johnson预处理结合中等幅度压缩在全局信号的标准化平均绝对误差上表现最优,但视觉上合理的样本仍存在统计偏差。

Comments Accepted for publication in The Astrophysical Journal. Revised version incorporating referee comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03001 2026-09-02 cs.CL 版本更新

Apples on the Table? Evaluating Text-Guided 3D Scene Synthesis via Fine-Grained Constraint Verification

LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进

Minseok Kang, Dongwook Choi, Gyeom Hwangbo, Seungwon Lim, Kai Tzu-iunn Ong, Jinyoung Yeo

机构 * Yonsei University(延世大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05291 2026-09-02 cs.CL 版本更新

Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages

Camellia: 亚洲语言中LLMs文化偏见的基准测试

Tarek Naous, Anagha Savit, Carlos Rafael Catalan, Geyang Guo, Jaehyeok Lee, Kyungdon Lee, Lheane Marie Dizon, Mengyu Ye, Neel Kothari, Sahajpreet Singh, Sarah Masud, Tanish Patwa, Trung Thanh Tran, Zohaib Khan, Alan Ritter, Tanmoy Chakraborty, Yuki Arase, Keisuke Sakaguchi, JinYeong Bak, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Samsung R&D Institute Philippines(三星菲律宾研发院) Sungkyunkwan University(成均馆大学) Tohoku University(东北大学) National University of Singapore(新加坡国立大学) University of Copenhagen(哥本哈根大学) University of Michigan(密歇根大学) Indian Institute of Technology Delhi(印度理工学院德里) Institute of Science Tokyo(东京科学研究院)

AI总结 提出Camellia基准,通过三个任务评估九种亚洲语言中多语言大模型对亚洲与西方文化实体的偏见,发现模型存在文化适应困难、情感关联差异及实体提取性能差距。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30896 2026-09-01 cs.CV 新提交

Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis

Rad-R:用于硬件故障诊断的原始ADC雷达数据集与捕获不变SSM

Mainak Mallick, Junghwan Yim, Seung-Kyum Choi

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对汽车毫米波雷达硬件故障数据稀缺问题,提出Rad-R原始ADC雷达数据集与捕获不变RadrNet模型,经基准评估,该模型在受控跨严重程度故障诊断任务中性能优于对比模型,且在其他任务中也表现领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30893 2026-09-01 cs.CL cs.IR 新提交

ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography

ECGQuest:用于心电图的语言模型基准测试与微调

Mohammadsina Hassannia, Matthew A. Reyna, Reza Sameni

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究开发了ECGQuest基准数据集,对语言模型进行ECG知识的零样本评估与微调,发现参数高效微调可让小模型与大商业模型竞争,通用模型在ECG任务中优于医学专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30857 2026-09-01 cs.CV cs.AI 新提交

TAMI: Temporally Aligned, Missingness-Aware, and Interpretable Multimodal Fusion for Mental Health Assessment in Older Adults with Mild Cognitive Impairment

TAMI:面向轻度认知障碍老年人心理健康评估的时间对齐、缺失感知与可解释多模态融合框架

Merna Bibars, Bolaji Omofojoye, Allan I. Levey, Rachel Hershenberg, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Cairo University(开罗大学)

AI总结 本研究针对轻度认知障碍老年人心理健康筛查的多模态分析局限,提出TAMI框架,通过时间对齐、缺失感知与可解释性设计,在49名受试者的抑郁、焦虑分类中取得良好效果,且开放式问题可实现与完整访谈相当的筛查性能。

Comments 19 pages, submitted to IEEE Transactions on Affective Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30428 2026-09-01 cs.CL cs.AI cs.CV cs.LG 新提交

Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

我们能看见的谎言:具身社交交互中VLM智能体的联合言语与非言语欺骗

Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira, Gunhee Kim

机构 * Seoul National University(首尔大学) Inha University(仁荷大学) KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本研究构建了3D多模态社交推理游戏测试平台MineAmongUs,提出可配置VLM智能体控制程序ARIA,发现非言语通道是VLM智能体欺骗取胜的更关键因素,为具身VLM智能体对齐研究开辟新方向。

Comments Workshop on Agent Behavior (WAB) at COLM 2026. Project page: https://junseokim0103.github.io/Lies-We-Can-See/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30110 2026-09-01 cs.CL cs.AI 新提交

Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators

大语言模型(LLM)能否监测经济状况?对宏观经济指标的LLM实时预报的评估

Xinyue Zhao, Ruiyi Zhang, Liqin Ye, Rui Cao, Pengtao Xie, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究推出抗污染基准LiveMacroEval,对比多类基准发现,具备网络搜索能力的LLM智能体对美国16项宏观经济指标的实时预报准确性与专业基准相当,展现出宏观经济实时估算潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29510 2026-09-01 cs.CV cs.CR cs.LG 新提交

ARMOR: Manifold-Oriented Training for Adversarially Robust Aerial Object Detection under Data Scarcity

ARMOR:数据稀缺条件下面向流形的对抗鲁棒航拍目标检测训练

Haoran Wang, Matthew Lau, Alec Helbling, Matthew Hull, ShengYun Peng, Mansi Phute, Martin Andreoni, Willian T. Lunardi, Duen Horng Chau, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) Khalifa University(哈利法大学) Technology Innovation Institute(技术创新研究院)

AI总结 ARMOR 是一种面向流形的新型防御方法,通过掩码图像背景、在目标上注入随机补丁,在数据稀缺时提升航拍目标检测器的对抗鲁棒性,维持强干净性能且优于现有最优防御。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏