AirLLM单卡4G跑70B大模型推理平台Python源码工具

AirLLM单卡4G跑70B大模型推理平台Python源码工具

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁
资源下载
免费资源
立即下载

AirLLM 单卡4G跑巨兽 项目封面

AirLLM 是一套 Python 大模型推理优化方案,把 70B 参数模型压到单张 4GB 显存显卡上跑起来,不需要量化、蒸馏或剪枝,原生权重直接推理。

源码系统概览

文章正文

AirLLM 是一套面向大模型推理的 Python 工具,核心目标是把原本需要多张高端显卡才能跑起来的百亿、千亿参数模型,压到单张消费级显卡上运行。

它的做法是把模型逐层搬到显存里按需计算,其余权重留在内存或磁盘,显存占用靠逐层调度压下来,让一张 4GB 显存的入门显卡也能跑起 70B 模型。

本资源提供完整 AirLLM 源码免费下载,开发者可以对照代码学习分层推理、权重持久化与预取加速的实现思路。

源码简介

AirLLM 由开发者 lyogavin(Gavin Li)与 Anima 团队开源维护,采用 Apache 2.0 许可,源码托管在 GitHub,是目前知名度最高的低显存大模型推理方案之一。

代码主体在 air_llm 目录下,核心是一个 AutoModel 自动识别类,能根据模型架构(ChatGLM、QWen、Baichuan、InternLM、KimiK3 等)选择对应的分层加载子类,其余标准模型由通用基类按层流式加载。

权重持久化模块支持 safetensors 与 Apple MLX 两套方案,Windows、Linux、macOS 都能跑,模型权重按需写入本地,避免重复解包。

仓库还附带 Anima 系列研究代码(100K 长上下文、QLoRA 训练、DPO 强化学习),但推理核心保持在 air_llm 主包,结构清晰,便于二次开发。

依赖集中在 requirements.txt,锁定 bitsandbytes 0.39、transformers 与 peft 的指定版本,确保分层推理行为稳定可复现。

适用场景

个人开发者想在本机用 4GB 显卡体验 70B 级别大模型对话与推理。

小团队在有限算力下做模型效果验证、私有化部署原型,不想采购 A100 或 H100 集群。

教学与二次开发:学习大模型分层 offload、显存优化与推理加速的工程实现。

需要本地离线跑大模型、对数据隐私敏感的企业内网环境。

功能亮点

极低显存门槛:单卡 4GB 跑 70B,8GB 跑 405B Llama 3.1,约 12GB 跑 DeepSeek-V3 671B,不到 4GB 跑 Kimi K3 2.8T。

原生权重推理:不做量化蒸馏剪枝,输出与原模型一致,结果可复现。

自动架构适配:AutoModel 一行代码自动识别 Qwen3、Llama 3.x/4、DeepSeek V2/V3、Phi-4、Gemma、Mistral、ChatGLM、Kimi K3 等。

分层压缩与预取:官方称最高 3 倍推理加速,计算与权重搬运重叠进行。

多量化与跨平台:支持 8bit 与 4bit 量化、FP8,以及 MacOS MLX 与 CPU 推理。

方案 70B 显存要求 是否改精度 适合场景
整机多卡加载 约 140GB 高吞吐在线服务
量化推理 约 20 至 40GB 是,有损 中等算力部署
AirLLM 分层 约 4GB 否,原生 单卡体验与离线验证

By the numbers

4GB:单卡可跑 70B 模型的最低显存。

671B:DeepSeek-V3 在约 12GB 显存下运行。

3 倍:分层压缩与预取带来的推理加速上限。

Apache 2.0:项目采用的开源许可证。

技术架构与部署指南

技术栈与运行环境

开发语言:Python 3.8+。
核心框架:HuggingFace Transformers 加 Accelerate 加 PEFT 分层推理引擎。
数据库:无,模型权重以 safetensors 本地持久化,无需外部数据库。
运行环境:NVIDIA CUDA 显卡或 Apple Silicon,单卡 4GB 显存可跑 70B 模型,671B 约 12GB。
其他依赖:torch、bitsandbytes 0.39、accelerate、peft、einops、sentencepiece,Windows、Linux、macOS 均支持。

安装与部署提示

pip install airllm 之后,from airllm import AutoModel 即可调用。

首次运行会自动从 HuggingFace 拉取模型权重并分层写入本地磁盘,需保证磁盘空间充足,70B 约 130GB 以上。

requirements 锁定 bitsandbytes 0.39 与 transformers、peft 的指定版本,新显卡如 CUDA 13 需自行适配 flash-attn。

推理速度取决于显存与磁盘 IO,分层搬运会带来额外延迟,适合离线低频调用而非高并发服务。

截图与演示说明

以下图片来自 GitHub 原版 lyogavin/airllm 仓库 assets 目录,均为无水印原图。

AirLLM 推理耗时对比图 单卡4G跑70B

推理耗时对比图来自 airllm2_time_improvement.png,展示了不同模型在 4GB 显存单卡下的耗时表现,可以直观看到分层推理方案的吞吐与延迟水平。

AirLLM Anima 问答示例图

Anima 问答示例图来自 bloome.png,展示项目在问答场景下的实际输出效果,回答内容组织完整、可读性高。

AirLLM 项目 logo

项目 logo 来自 airllm_logo_sm.png,体现把 70B 巨兽模型装进小显存显卡的分层推理理念。

AirLLM GitHub star 历史图

star 历史图来自 star-history.png,可以看到 lyogavin/airllm 在开源社区的关注度变化轨迹。

推理入口在 air_llm/inference_example.py,核心调用 AutoModel.from_pretrained 逐层加载权重并计算,代码注释清晰,便于对照调试。

测试文件 air_llm/tests/test_automodel.py 列出了 Platypus2-7B、Qwen-7B、chatglm3-6b、Baichuan2-7B、Mistral-7B、Mixtral-8x7B 等模型的自动识别映射,可作为接入参考。

权重持久化模块 air_llm/airllm/persist 下包含 safetensor_model_persister 与 mlx_model_persister,分别对应显卡与 Mac 端的本地落盘逻辑。

常见问题

问:4GB 显存真的能跑 70B 模型吗。

能,AirLLM 通过逐层 offload 把权重在显存、内存、磁盘之间调度,单卡 4GB 即可加载并推理 70B 模型,代价是推理速度较慢。

问:需要把模型量化吗。

不需要,AirLLM 使用原生权重直接推理,不做量化蒸馏剪枝,输出结果与原模型一致。

问:支持哪些模型架构。

覆盖 Qwen3、Llama 3.x/4、DeepSeek V2/V3、Phi-4、Gemma、Mistral、Mixtral、ChatGLM、Baichuan、InternLM、Kimi K3 等主流开源模型。

问:Mac 电脑能跑吗。

可以,AirLLM 提供 MLX 后端,在 Apple Silicon 上通过 mlx_model_persister 做权重映射与本地持久化。

问:推理速度为什么比整机加载慢。

分层搬运权重会在 CPU、GPU、磁盘之间频繁读写,吞吐低于整机加载,更适合离线验证与低频调用。

安全风险提示

项目核心代码干净,未检出 eval、base64_decode、shell_exec 等后门类风险,README 内嵌的第三方统计与外链建议下载后手动清理。

特别提示:本源码未做完整安全审计,下载后请务必自行检查依赖与脚本,确认无恶意代码再部署使用。

下载说明

本资源仅用于学习研究,请在 24 小时内删除,不得用于商业用途或非法传播。

AirLLM 采用 Apache 2.0 开源许可,可自由学习、修改与再分发,但需保留版权声明。

模型权重体积庞大,请确认本地磁盘空间充足后再拉取运行。

GitHub项目开源地址:https://github.com/lyogavin/airllm

资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei14311.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码