国内大模型下载指导书(2026 版)

本文摘要国内大模型下载指导书(2026 版,重构优化版)面向中国大陆网络环境,系统讲解:① 大模型分类与国内外分布及国内限制;② 主流部署/应用工具及其下载方式;③ 对大模型下载有优化的下载工具;④ 逐个工具的详细下载说明、典型问题与规避方案。结论先行:下载慢的本质是跨境链路 + HF CDN 受限 + 运营商"大象流"限速;免费首选 HF_ENDPOINT=https://hf-mirror.com 镜...

国内大模型下载指导书(2026 版,重构优化版)

面向中国大陆网络环境,系统讲解:① 大模型分类与国内外分布及国内限制;② 主流部署/应用工具及其下载方式;③ 对大模型下载有优化的下载工具;④ 逐个工具的详细下载说明、典型问题与规避方案。
结论先行:下载慢的本质是跨境链路 + HF CDN 受限 + 运营商"大象流"限速;免费首选 HF_ENDPOINT=https://hf-mirror.com 镜像,超大模型用 hfd + aria2 多线程,GGUF 类用 Gopeed/迅雷下直链,Ollama 用 GGUF 导入法绕过其内置 registry 最稳。

第一章 大模型分类、国内外分布与国内限制

1.1 大模型怎么分类

分类维度类别代表下载特点
按模态大语言模型(LLM)Llama、Qwen、DeepSeek、ChatGLM权重文件大(GB~百GB级),主流是 safetensors / GGUF
多模态(视觉-语言)Qwen-VL、InternVL、GLM-4V在 LLM 基础上加视觉塔,体积更大
文生图 / 文生视频Stable Diffusion、FLUX、WAN权重在 Civitai / HF,常带 VAE、CLIP 等多个分片
语音 / 代码 / 推理Whisper、Qwen-Coder、DeepSeek-R1同 LLM 体系
按开放度开源可商用Llama(限定)、Qwen、DeepSeek、Mistral可直接下载
Gated(需申请)Llama-2/3 全量、某些研究模型需 HF 官网申请许可 + Token
闭源 API 仅GPT-4、Claude、Gemini不提供权重,无法本地下载
按参数规模小(≤7B)、中(7–34B)、大(70B+)、超大(MoE 数百B)越大越依赖多线程/断点续传/大显存

1.2 国外情况

  • 模型来源:美国为主——Meta(Llama)、Google(Gemma)、Mistral、Microsoft、Anthropic(仅 API)、OpenAI(仅 API)。
  • 分发平台Hugging Face(huggingface.co)是全球绝对主导的模型/数据集托管平台,几乎所有开源权重都先发在这里;权重用 Git LFS 存储,单文件可达数十 GB。
  • 下载痛点根源:HF 服务器与 Cloudflare CDN 节点主要在欧美,中国大陆没有或极少 CDN 节点,直连走拥堵国际出口。

1.3 国内情况

  • 模型来源:阿里通义 Qwen、深度求索 DeepSeek、智谱 ChatGLM/GLM、百川、阶跃星辰、Kimi(月之暗面)、讯飞星火、百度文心、书生·浦语 InternLM 等。
  • 国内托管/镜像平台

    • 魔搭 ModelScope(modelscope.cn):阿里达摩院,国内原生 CDN,Qwen/ChatGLM/Llama 等全面同步。
    • 始智 AI Wisemodel(wisemodel.cn):国产开源社区。
    • OpenXLab 浦源(openxlab.org.cn):上海 AI 实验室。
    • OpenDataLab(opendatalab.com):数据集为主。
    • 飞桨 AI Studio(aistudio.baidu.com):百度系。
    • 智源 BAAI / FlagOpen(flagopen.baai.ac.cn):智源开源(Aquila、Emu 等)。
    • hf-mirror.com / hf-mirror.net:HF 国内镜像(文件下载反代,最广用)。

1.4 国内的详细限制(重点)

  1. 跨境链路瓶颈:数据从欧美传到中国需经拥堵国际出口,TCP 高丢包下自动降速,文件越大越严重。
  2. CDN 反效果:HF 使用的 Cloudflare 等在国内节点受限,请求可能被路由到遥远 POP,延迟反而更高。
  3. 运营商"大象流"限速:几十 GB 的长时间大流量连接会被 QoS 降优先级,单线程下载基本卡死。
  4. Gated / 私有模型门槛:Llama 等需到 HF 官网登录、提交申请、获准后拿 Access Token 才能下,镜像站不存账号无法代登录。
  5. 同步延迟:镜像站比官方滞后数小时到一天,最新发布模型可能镜像里还没有。
  6. 合规约束:需遵守模型 License(部分仅限研究/非商用)、不得用于违规用途,参照《生成式人工智能服务管理暂行办法》。
  7. LFS 大文件断流:直连 git lfs clone 一旦中断往往从头开始,且易 3KB/s"伪死"。

第二章 大模型部署 / 应用工具总览

本章只做"工具是什么 + 它怎么下载模型 + 国内限制 + 解决思路简介"。每个工具的完整下载步骤与排错见后续对应章节。
工具定位模型来源 / 下载方式国内限制解决思路(详见章节)
Ollama命令行一键部署、API内置 registry(registry.ollama.ai)拉清单+权重分片该域名国内直连成功率极低GGUF 导入法 / 代理直连 / 社区镜像(第 4 章)
LM Studio图形化客户端(GGUF)Hugging Face(GGUF 格式)默认走 HF 官方慢/卡HF_ENDPOINT 镜像 / 改域名 / 手动下 GGUF(第 5 章)
Unsloth训练 / 微调框架Hugging Face(from_pretrained同 HF 限制HF_ENDPOINT 镜像 / Studio 本地代理(第 6 章)
vLLM高性能推理服务Hugging Face同 HF 限制HF_ENDPOINT 镜像(第 7 章)
Text Generation WebUIWeb 推理前端Hugging Face同 HF 限制HF_ENDPOINT 镜像(第 7 章)
ComfyUI文生图/视频工作流Hugging Face + CivitaiHF 受限、Civitai 易被墙HF_ENDPOINT + 代理/镜像(第 7 章)
AnythingLLM / Open WebUI应用前端依赖上述后端模型取决于后端后端搞定即可(第 7 章)

通用解法一句话:凡是底层走 Hugging Face 的工具,几乎都能靠 export HF_ENDPOINT=https://hf-mirror.com 解决;凡是走自有 registry 的(Ollama),优先用 GGUF 导入法绕过。


第三章 好用的下载工具(对大模型下载有优化)

这些工具负责"把文件真正搬下来",可与上面任意部署工具配合(如下好 GGUF 再喂给 Ollama/LM Studio)。
工具协议/特点对大模型优化的点适用场景
Gopeed(够快)HTTP/HTTPS/BT/磁力,开源跨平台多线程 HTTP(8–32 线程)、断点续传、内置 HuggingFace 扩展(自动解析+校验)、REST API下 HF 镜像直链 GGUF 最顺手
迅雷(Xunlei)HTTP/P2P,会员加速大文件直链多线程、P2P 辅助拿到 HF 镜像直链后用它拖,速度快
aria2 / aria2c命令行多线程,极轻量hfd 底层引擎,-x 16 -s 16 -c 断点续传脚本化、服务器/无 GUI 环境
hfdHF 镜像专用脚本(封装 aria2)自动处理 LFS、多线程、断点续传70B+ 超大模型一键拉
Motrixaria2 的图形前端多线程、可视化想要 GUI 又用 aria2
IDM / FDM传统 HTTP 多线程浏览器接管、分段下载普通直链大文件
百度网盘/阿里云盘/夸克网盘社区分享整包镜像都失败时找分享(注意版权+校验)

HF 镜像直链模板(Gopeed / 迅雷 / aria2 直接粘贴即可):

https://hf-mirror.com/{仓库名}/resolve/main/{文件名}?download=true
# 例:Qwen2.5-7B GGUF
https://hf-mirror.com/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf?download=true

第四章 Ollama 详细下载说明

4.1 推荐方案:GGUF 导入法(最稳,绕过内置 registry)

Ollama 默认从 registry.ollama.ai 拉取,国内直连成功率低且难加速。最可靠做法是自己下 GGUF,再用 Modelfile 导入

# 1. 用镜像下 GGUF(任一方式)
#    - Gopeed/迅雷 粘贴直链:https://hf-mirror.com/{repo}/resolve/main/{file}.gguf?download=true
#    - 或命令行
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download Qwen/Qwen2.5-7B-Instruct-GGUF qwen2.5-7b-instruct-q4_k_m.gguf --local-dir ./qwen_gguf

# 2. 写 Modelfile
echo 'FROM ./qwen_gguf/qwen2.5-7b-instruct-q4_k_m.gguf' > Modelfile

# 3. 导入并运行
ollama create qwen25-7b -f Modelfile
ollama run qwen25-7b

4.2 备选方案 A:代理直连(让 registry 可达)

export HTTPS_PROXY=http://127.0.0.1:7890   # 你的代理
ollama pull qwen2.5:7b

4.3 备选方案 B:社区镜像(可用性需自行验证)

社区有把 OLLAMA_MODELS 指向镜像 URL 的黑科技(注意:该变量官方语义是"模型存储目录",非下载源,此法非官方、时灵时不灵,不推荐作主方案)。更稳的是用前面 4.1 的 GGUF 法。已知社区镜像域名(仅作线索,需实测):清华 TUNA、中科大 USTC 的 ollama 镜像、ghproxy 类转发。

4.4 存储路径重定向(Windows C 盘空间紧张)

OLLAMA_MODELS正确用法是改存储目录

# 管理员 PowerShell
mklink /J "%USERPROFILE%\.ollama\models" "D:\ollama_models"

然后正常 ollama pull,模型会落到 D 盘。

4.5 典型问题与规避

问题原因规避/解决
ollama pull 卡在 0% / 超时registry.ollama.ai 国内直连失败改用 4.1 GGUF 导入法,或 4.2 代理
速度仅 10KB/s跨境链路 + 限速走镜像 GGUF 直链,速度可到 8MB/s+
C 盘爆满默认存系统盘用 4.4 软链接改到非系统盘
断点后续拉从头开始非官方客户端中断GGUF 法 + 下载工具断点续传,避免 Ollama 自带拉取中断
OLLAMA_HOST 设了还是慢该变量只改监听地址,不加速下载加速靠 4.1/4.2,不是 OLLAMA_HOST

第五章 LM Studio 详细下载说明

LM Studio 基于 llama.cpp,使用 GGUF 格式,默认从 Hugging Face 下载。三种下载方式任选。

5.1 方式一:HF_ENDPOINT 镜像(最简单,推荐先试)

# Windows PowerShell:先设变量,再用同一终端启动 LM Studio
$env:HF_ENDPOINT = "https://hf-mirror.com"
Start-Process "C:\Users\$env:USERNAME\AppData\Local\Programs\LM Studio\LM Studio.exe"

启动后在软件内搜索模型点 Download,进度条 5 秒内应动起来。

5.2 方式二:改程序文件域名(彻底替换)

关闭 LM Studio,备份后修改(以 Windows 为例):

C:\Users\admin\AppData\Local\Programs\LM Studio\resources\app\.webpack\main\index.js

把其中所有 huggingface.co 替换为 hf-mirror.com,保存重启。注意用 VS Code/Notepad++(UTF-8),别用记事本破坏 BOM。

5.3 方式三:手动下 GGUF 再导入(最可控)

  1. 打开镜像筛选页:https://hf-mirror.com/models?apps=lmstudio (Libraries 选 GGUF / MLX,Apps 选 LM Studio)
  2. 下载 .gguf 文件(推荐 q4_k_m 平衡版)。
  3. 在 LM Studio 的 Models Directory 下,按要求建两层文件夹 发布者/仓库名/,把 .gguf 放进去:

    D:\LM Studio Models\unsloth\Qwen2.5-7B-Instruct-GGUF\qwen2.5-7b-instruct-q4_k_m.gguf
  4. 回 LM Studio 本地模型界面点"Scan"即可识别。

5.4 典型问题与规避

问题原因规避/解决
"Could not find model" 但仓库存在网络/CDN 被墙,并非真找不到HF_ENDPOINT=hf-mirror.com 或改 index.js
大文件(>10GB)校验失败/中断传输中分块损坏用 aria2c -c 断点续传,或手动下 GGUF
下载到一半失败网络波动LM Studio 内置断点续传,重点点下载;仍不稳就用手动 GGUF 法
速度几百 K高峰期镜像拥堵换时段,或换 AI 快站/魔搭拿直链
显存不足加载失败量化版本太大换更小量化(Q3_K_M / Q2_K),或调低 GPU 卸载层数

第六章 Unsloth 详细下载说明

Unsloth 是训练/微调框架,下载基座模型走 Hugging Face(from_pretrained)。

6.1 标准方案:HF 镜像环境变量

export HF_ENDPOINT=https://hf-mirror.com
pip install unsloth
python -c "from unsloth import FastModel; m,t = FastModel.from_pretrained('unsloth/Qwen3-8B')"

或在代码最开头 import os; os.environ['HF_ENDPOINT']='https://hf-mirror.com'

6.2 方案二:Unsloth Studio 本地代理通道(本机已在用)

Unsloth Studio 内置一条把流量转发到 hf-mirror.com本地代理,Studio 把完整 os.environ 传给 llama-server 子进程,因此只需在 Studio 环境里设好镜像即可,无需改代码。本机(ROG Flow Z13 / Strix Halo)已验证此路径可正常拉取并训练。

6.3 Gated / 私有模型

from huggingface_hub import login
login("hf_xxxx")   # 先在 HF 官网申请许可再拿 token
# 然后正常 from_pretrained

6.4 典型问题与规避

问题原因规避/解决
下载从官方地址走、很慢环境变量设置晚于 import写到 ~/.bashrc 或在代码最前 import os 设置
镜像里没有最新模型同步延迟等几小时,或 Studio 代理/直连原站
Gated 模型 401未申请/未登录HF 官网申请 + login(token)
ROCm/Windows 下 import 崩溃gfx1151 缺 distr/torchvision 等用 Studio 打包环境或独立 py3.12 venv,避开 torchvision/torchao
磁盘/显存不足大模型 + 训练副本优先 4-bit/QLoRA,或选小模型

第七章 vLLM / TG WebUI / ComfyUI 等详细下载说明

7.1 vLLM(推理服务)

export HF_ENDPOINT=https://hf-mirror.com
pip install vllm
vllm serve Qwen/Qwen2.5-7B-Instruct      # 启动时自动从镜像拉权重

典型问题:git lfs clone 中断→改用 HF_ENDPOINT + huggingface-cli download --resume-download;大模型用 hfd + aria2(见下)。

7.2 Text Generation WebUI(oobabooga)

export HF_ENDPOINT=https://hf-mirror.com
# 启动器内下载模型时自动走镜像;或手动下 safetensors 放到 models/ 目录

注意:该前端默认也依赖 transformers,镜像变量同样生效。

7.3 ComfyUI(文生图/视频)

  • HF 托管的权重(checkpoint、VAE、CLIP):设 HF_ENDPOINT=https://hf-mirror.com,或用 huggingface-cli 预下到 ComfyUI/models/ 对应子目录。
  • Civitai 资源:国内常被墙,需用合规代理;或到魔搭/社区镜像找同源文件。
  • ComfyUI-Manager:其节点下载可在设置里配置镜像源,优先用国内可达的。

典型问题:模型放错子目录(checkpoint 放 models/checkpoints/、VAE 放 models/vae/、LoRA 放 models/loras/)→ 严格按类型入座;Civitai 拉取失败→换代理或手动下。

7.4 AnythingLLM / Open WebUI(应用前端)

这类本身不存权重,只连后端(Ollama / vLLM / LM Studio API)。后端模型按前面章节下好即可,前端只需填后端地址(如 http://localhost:11434 或 LM Studio 的 API URL)。


第八章 下载工具实战(Gopeed / 迅雷 / aria2+hfd)

8.1 Gopeed 实战

  1. 官网 https://gopeed.com 下载对应平台版(Win/macOS/Linux/移动端/Docker)。
  2. 安装 HuggingFace 扩展(扩展商店搜 HuggingFace),支持自动解析+校验+断点续传。
  3. 直接粘贴 HF 镜像直链(见第三章模板),设 8–32 线程。
  4. 适合:把 GGUF 下到本地后喂给 Ollama/LM Studio。
# 命令行也能用
gopeed https://hf-mirror.com/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf?download=true

8.2 迅雷实战

  1. 复制 HF 镜像直链(同上模板,注意带 ?download=true)。
  2. 新建任务粘贴,迅雷对大文件直链多线程+会员加速效果好。
  3. 注意:HF 的 LFS 文件要先用镜像拿到直链,不能直接丢 huggingface.co 原页面 URL。

8.3 aria2 + hfd 实战(服务器/超大模型)

sudo apt-get install aria2 git-lfs
wget https://hf-mirror.com/hfd/hfd.sh && chmod +x hfd.sh
export HF_ENDPOINT=https://hf-mirror.com

# 超大模型多线程(-x 并行连接)
./hfd.sh meta-llama/Llama-2-70b-hf --tool aria2c -x 16

# 纯 aria2 直链续传
aria2c -x 16 -s 16 -c "https://hf-mirror.com/.../model.safetensors?download=true"

8.4 性能与选型的最后提醒

  • 家庭宽带 8–16 线程、千兆 32 线程是平衡点;开 64 线程反而易被服务器防刷挂起。
  • 公益镜像高峰期会拥堵,可换 AI 快站(aifasthub.com)、OpenXLab、魔搭拿直链。
  • 任何方式下完都做哈希校验(见下),避免加载时报错。
sha256sum ./qwen2.5-7b/model-00001-of-00004.safetensors
# 与仓库 README / 官方公布的 SHA256 比对,不一致即损坏需重下

附:推荐默认配置(复制即用)

# ~/.bashrc 追加(Linux/macOS)
export HF_ENDPOINT=https://hf-mirror.com
export HF_HUB_ENABLE_HF_TRANSFER=1
export HF_HOME=~/.cache/huggingface
# Windows PowerShell $PROFILE 追加
$env:HF_ENDPOINT = "https://hf-mirror.com"
$env:HF_HUB_ENABLE_HF_TRANSFER = "1"
合规提示:仅下载你有权获取的模型;遵守 License 与 Gated 申请流程;不用于违规用途。

觉得内容不错?我要

打赏杯咖啡或蜜雪冰城吧
微信扫一扫
微信赞赏码
支付宝扫一扫
支付宝赞赏码
评论 暂无评论
请登录后参与评论