WebLLM
github.com原文 ↗
WebLLM 在浏览器内用 WebGPU 跑模型,不依赖服务器,并提供 OpenAI-compatible 的流式、JSON mode、seed 和部分 function calling 接口。内置 Llama、Phi、Gemma、Mistral、Qwen,可加载自定义 MLC 模型;Web Worker/Service Worker 和 Chrome 扩展支持把推理从主 UI 线程移开。它把离线隐私、硬件加速和 npm/CDN 集成组合起来,代价是模型下载、浏览器兼容性和本地显存都由应用自己承担。
–浏览
评论 · Comments