NoFOMO
搜索 中EN 登录 注册

最高第 2 名 现在第 2 名

AirLLM低显存跑大模型

AirLLM 用逐层推理让 4GB 显卡跑 70B、8GB 跑 405B,支持 Llama/Qwen/Mistral,已开源。

要点

  • AirLLM 采用"Layer-wise Inference",一次只加载、计算并清除一层,而不是加载整个模型。
  • 它能在单张 4GB GPU 上运行 70B 模型,在 8GB VRAM 上可扩展到 Llama 3.1 405B。
  • 默认无需量化,支持 Llama、Qwen 和 Mistral,可在 Linux、Windows 和 macOS 上运行。
  • 它 100% 开源。

要点和反应摘要由 AI 依据本页推文整理,请以原推为准。 我们怎么用 AI

原推

Oliver Prompts @oliviscusAI 2.2万 粉丝

"I don't have a GPU" is officially dead 🤯 You can now run 70B model on a single 4GB GPU and it even scales up to the colossal Llama 3.1 405B on just 8GB of VRAM. AirLLM uses "Layer-wise Inference." Instead of loading the whole model, it loads, computes, and flushes one layer at a time → No quantization needed by default → Supports Llama, Qwen, and Mistral → Works on Linux, Windows, and macOS 100% Open Source.
推文配图
6,158点赞 539转发 213回复 31.9万浏览

在 X 上查看 收藏

X 上的热门回复

X 上的反应: 回复基本是调侃,集中吐槽速度极慢——有人开玩笑说每 10 分钟才出 1 个 token,还有人拿 SSD 损耗、龟速和用 CPU 跑说事。也有回复承认这原本不可能,若不考虑能耗和时间,仍有潜在用途。原推作者没有回应。

登录后查看 X 上的 5 条热门回复

来自 @iainsnotes, @rgbman1776, @trailformer 等,已过滤广告,附中英文翻译。

免费注册 已有账号?登录

讨论 0

还没有人讨论,来说第一句。

推荐信源

觉得我们漏了哪个一手信源,或者该关注什么话题?告诉我们。审核通过后,所有人的榜单都会覆盖到它。

@用户名,或者主页链接