# Google 推出 LiteRT.js:高性能 Web AI 推理运行时
- 来源:Google Developers Blog(RSS)
- 发布时间:2026-07-10 05:21
- AIHOT 分数:62
- AIHOT 标记:精选
- AIHOT 链接:https://aihot.virxact.com/items/cmre0j0vj002sihwk71qvktk7
- 原文链接:https://developers.googleblog.com/litertjs-googles-high-performance-web-ai-inference
## 精选理由
Google 将 LiteRT 扩展到了浏览器端,让 Web 开发者可以直接在客户端跑 AI 推理,但发布缺少性能数据和对比,实质价值还要看后续的 benchmark。
## AI 摘要
Google 发布 LiteRT.js,这是 LiteRT 跨平台边缘 AI 运行时的最新成员,专为 JavaScript 开发者设计,可直接在浏览器中运行机器学习模型。LiteRT.js 基于 WebGPU 和即将推出的 WebNN 实现 SOTA 推理性能,同时支持回退到 WebAssembly CPU 方案。
## 正文
我们很高兴地宣布推出 LiteRT.js,这是 LiteRT 的 JavaScript 绑定,用于直接在网页浏览器中运行 AI。通过将值得信赖的端侧推理库 LiteRT 引入 Web 端,Web 开发者现在可以完全在本地以最高性能运行机器学习和 AI 模型。这意味着用户隐私得到增强、服务器成本为零,并且实时体验的延迟极低。对于拥有现有 `.tflite` 模型的开发者来说,LiteRT.js 使得向移动端和桌面端网页浏览器的部署比以往任何时候都更加顺畅,它是 TensorFlow.js 在执行 `.tflite` 模型方面的一次强大演进。
虽然之前的 Web AI 解决方案(如 TensorFlow.js)依赖于性能较低的基于 JavaScript 的内核,但现在我们通过 WebAssembly 将我们原生的、跨平台运行时及其所有优化直接提供给 Web 开发者。LiteRT.js 通过在浏览器中直接运行您的 `.tflite` 模型,并利用 LiteRT 最先进的硬件加速能力(包括用于 CPU 的 XNNPACK、用于 GPU 的 ML Drift,以及即将推出的用于 NPU 的 WebNN),释放出令人瞩目的性能。
我们的初始版本提供了所有必要的工具,包括新的 LiteRT.js npm 包以及一系列展示实际应用场景的演示。
LiteRT.js 如何为 Web 开发者带来益处
借助 LiteRT.js,Web 开发者可以将模型集成到他们用 JavaScript 或 TypeScript 编写的应用中,完全在客户端处理诸如文本生成、目标检测和音频处理等复杂任务。由于 LiteRT.js 与 LiteRT 共享统一的跨平台技术栈,您的 Web 应用将自动受益于为 Android、iOS 和桌面端开发的最新性能升级、量化改进和硬件优化。
通过利用 LiteRT 的降级流程和运行时,您可以轻松地将来自多种 Python 机器学习框架的模型进行转换,并在所有主流加速器(CPU / GPU / NPU)上获得原生硬件加速。为了帮助您轻松解锁这些 AI 能力,以下是 LiteRT.js 的主要亮点:
1. PyTorch 转换与定制化量化
借助 LiteRT Torch,PyTorch 模型只需一步即可完成转换,立即可用于利用先进的浏览器端硬件加速。请立即按照 LiteRT Torch 指南开始使用。
为了进一步优化,AI Edge Quantizer 允许您在不同模型层配置定制化的量化方案。这能在保持整体模型质量的同时,实现显著的体积缩减和性能提升。探索量化 Colab 笔记本,查看实际效果。
2. 跨 CPU、GPU 和 NPU 的原生硬件加速
LiteRT.js 为多种多样的硬件后端实现了高性能的 AI 推理。
CPU:利用 XNNPACK,这是谷歌高度优化的设备端 CPU 加速库,提供强大的多线程支持以及用于增强性能的宽松 SIMD 构建。
GPU:由 ML Drift 驱动,这是谷歌领先的设备端 GPU 加速解决方案。LiteRT.js 利用 WebGPU 在 Web 上实现最先进的 GPU 加速。
NPU:利用新兴的 WebNN API(目前在 Chrome 和 Edge 中处于实验阶段)来调用专用 NPU,实现高能效、超低延迟的推理。
准备好加速您的 Web 应用了吗?深入了解 LiteRT.js 文档,立即开始。
LiteRT.js 架构概览
性能与实际影响
为了展示统一运行时和硬件加速后端的实际影响,我们针对现有的 Web 解决方案对 LiteRT.js 进行了评估。在经典的计算机视觉和音频处理模型中,LiteRT.js 实现了显著的加速——在 CPU 和 GPU 推理上,性能均优于其他 Web 运行时高达 3 倍。
注意:性能基准测试在受控的浏览器环境中,于 2024 年款搭载 M4 Apple Silicon 的 Apple MacBook Pro 上进行。个人用户的实际性能可能因本地 GPU 能力、热节流和浏览器驱动优化而异。
为了将这些宣称建立在真实世界的效率基础上,我们使用 LiteRT.js 在三种不同的 Web 执行后端上对主流 AI 模型进行了基准测试:CPU(通过 XNNPACK)、WebGPU 和 WebNN(通过 Apple CoreML)。对于目标追踪、音频转录或图像处理等要求严苛的实时应用,通过 WebGPU 或 WebNN 利用 GPU 或 NPU,相比标准 CPU 执行可带来 5 到 60 倍的加速,从而在保证性能的同时降低延迟。
注意:性能基准测试是在受控的浏览器环境中,于一台搭载 M4 Apple Silicon 的 2024 款 Apple MacBook Pro 上进行的。个人用户的性能可能因本地 GPU 能力、热降频和浏览器驱动优化而有所不同。
现场演示
要查看 LiteRT.js 的实际效果,请探索我们的实时实现。LiteRT.js 演示源代码可在 LiteRT GitHub 仓库和 Ultralytics 处获取。
LiteRT Ultralytics YOLO 集成
Ultralytics 是一家专注于构建计算机视觉工具和模型的人工智能公司。它最为人熟知的身份是 YOLO(You Only Look Once)框架及其系列实时目标检测与图像分割模型的创建者。
我们很高兴地宣布,Ultralytics Python 包中现已内置对官方 LiteRT 导出的支持。只需几行代码,即可轻松地将 Ultralytics YOLO 模型部署到移动端、边缘设备和浏览器——从编译到运行一气呵成。
演示:YOLO26,实时视觉模型系列
深度估计
Depth Anything——单目深度估计,展示了如何将标准网络摄像头实时画面转换为交互式 3D 点云。该演示由 LiteRT.js 通过 WebGPU 驱动,使用 Depth-Anything-V2 模型即时计算深度数据,并将视频像素映射到响应式 3D 空间中。
演示:使用 DepthAnything 和 WebGPU 进行单目深度估计。
图像放大
在浏览器中使用 LiteRT.js 和 Real-ESRGAN 模型将图像放大 4 倍,其工作原理是将 128x128 像素的图块放大至 512x512,然后再将它们重新组合成最终图像。
开始使用 LiteRT.js
将 LiteRT.js 集成到您的开发工作流程中非常简单,无论您是启动全新实现,还是将现有应用迁移到我们的高性能运行时。LiteRT.js 抽象了硬件级优化的复杂性,使您能够提供响应迅速、注重隐私的体验,而无需手动进行平台调优。
以下代码片段展示了使用 GPU 加速初始化、编译和运行 .tflite 模型的简化流程。通过简洁的现代 JavaScript,您可以加载模型、输入张量,并实时捕获高速推理结果。如需更详细的说明、演示和指导,请参阅我们的文档。
import { loadLiteRt, loadAndCompile, Tensor } from '@litertjs/core';
await loadLiteRt('path/to/wasm/directory/');
const model = await loadAndCompile('path/to/your/model.tflite',{ accelerator: webgpu });
const inputTypedArray = new Float32Array(1 * 3 * 244 * 244);
const inputTensor = new Tensor(inputTypedArray, [1, 3, 244, 244]);
const results = await model.run(inputTensor);
// results is a Tensor stored on GPU. To move it to CPU & convert to a typedArray we use const resultArray = (await results[0].moveTo('wasm')).toTypedArray();
JavaScript
下一步计划
我们致力于持续扩展 LiteRT.js 的性能、模型覆盖范围和开发者工具。展望未来,我们的发展路线图侧重于推进 WebNN 集成以实现原生 NPU 性能,并为设备端生成式 AI 提供高度优化的支持。
模型:在 Kaggle 或 LiteRT Hugging Face 社区中查找预训练的 .tflite 模型。
开始构建:探索 LiteRT.js 文档。
获取软件包:在 npm 上下载 @litertjs/core。
贡献:在我们的 GitHub Issues 页面分享反馈、报告错误或贡献代码。
大语言模型支持:LiteRT-LM.js 通过我们的 JavaScript API 为浏览器添加了对大语言模型的支持。
TensorFlow.js 用户:请参阅此处了解如何在现有 TensorFlow.js 流程中利用 LiteRT.js 进行模型推理。
致谢
感谢 Ultralytics 提供 YOLO26 媒体和性能数据。感谢 Jason Mayes 提供 LiteRT.js 演示。
Web
AI
公告
学习
影响力
WebAI