大模型长什么样

经过前边的文章,大概是已经知道大模型是什么了,但它到底存在哪里?怎么拿到手?理论已经了解了,但没有真正跑过一个本地模型,会觉得这东西很”虚”,这篇文章解决这个问题。


一、大模型存在哪里

大模型的本体是一堆权重文件(.safetensors / .bin / .gguf),就像 Java 的 .jar 包,只不过体积从几 MB 变成了几 GB 到几百 GB。

这些文件托管在两个主要平台:

平台 定位 访问
Hugging Face 全球最大模型社区,学术 + 开源主战场 huggingface.co
魔塔社区(ModelScope) 阿里云旗下,国内访问快,中文模型多 modelscope.cn

国内网络访问 Hugging Face 不稳定,建议先用 ModelScope 上手,两个平台的模型大部分是互通的。


二、逛 Hugging Face

主页导航

打开 huggingface.co,顶部导航最重要的三个:

1
2
3
Models    → 找模型(核心)
Datasets → 找数据集(训练用)
Spaces → 在线体验模型(不用本地部署)

模型搜索与筛选

点击 Models,左侧筛选栏:

1
2
3
4
5
6
7
8
9
10
11
Tasks(任务类型):
Text Generation → 文字生成,就是我们要用的 LLM
Sentence Similarity → 语义相似度(Embedding 模型在这里)
Text-to-Image → 文生图
Automatic Speech Recognition → 语音转文字

Libraries(框架):
GGUF → 量化版,可以在普通电脑上跑

Languages(语言):
zh → 筛选支持中文的模型

读懂模型名字

Qwen/Qwen2.5-7B-Instruct 为例:

1
2
3
4
5
Qwen/Qwen2.5-7B-Instruct
│ │ │ └── Instruct:经过指令微调,能对话
│ │ └──── 7B:70亿参数
│ └──────────── Qwen2.5:第几代,越大越新
└───────────────── Qwen:阿里巴巴团队(发布者)

img

模型主页关键信息

1
2
3
4
📊 Downloads/month   → 每月下载量,越高越主流
⭐ Likes → 社区热度
📄 Model Card → 模型说明书,最重要!
📁 Files and versions → 实际的模型文件

Model Card 一定要读,里面包含:能做什么、支持多长上下文、怎么用(示例代码)、在各基准测试上的分数、模型不擅长什么。


三、逛 ModelScope(国内推荐)

打开 modelscope.cn,界面和 Hugging Face 类似。

常用搜索技巧:

1
2
3
4
搜索 "qwen"       → 找通义千问系列
搜索 "deepseek" → 找 DeepSeek 系列
搜索 "embedding" → 找向量模型
搜索 "7B GGUF" → 找可以本地跑的量化版

国内 CDN 加速,下载速度远快于 Hugging Face,而且很多国内公司优先在这里发布模型。


四、理解模型的”规格参数”

参数量(B = Billion)

1
2
3
4
5
0.5B   →  5亿参数,很小,手机都能跑
1.5B → 15亿参数,轻量级
7B → 70亿参数,性价比之王,笔记本可跑
13B → 130亿参数,效果更好,需要好点的显卡
70B → 700亿参数,接近 GPT-4 级别,需要多张 A100

参数量越大不一定越好,同等参数下训练质量更重要——DeepSeek-V3 就是靠算法效率超越了更大的模型。

量化版本(Q4、Q8、GGUF)

原始模型每个参数用 16 位或 32 位浮点数存储,体积巨大。量化是把精度降低(比如用 4 位存),体积缩小 4-8 倍,性能损失约 1-5%。

1
2
3
4
5
模型名中常见的标识:
Q4_K_M → 4位量化,平衡版(推荐)
Q8_0 → 8位量化,质量更好但更大
F16 → 16位,原始精度,最大最好
GGUF → llama.cpp/Ollama 支持的格式

Base vs Instruct vs Chat

1
2
3
Qwen2.5-7B           → Base 基础模型,只会"续写",不会"对话"
Qwen2.5-7B-Instruct → 指令微调版,能理解"请帮我…"的指令
Qwen2.5-7B-Chat → 对话优化版(和 Instruct 类似,不同团队的叫法)

做应用开发,一定要用 Instruct 或 Chat 版。 有人用 Base 版然后问为什么模型不回答问题,就是这个原因。


五、亲手跑一个模型(Ollama)

不需要懂 Python,不需要 GPU,Ollama 搞定一切。

安装 Ollama

1
2
3
4
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows:到 ollama.com 下载安装包

安装完验证:

1
2
ollama --version
# 输出:ollama version 0.x.x 说明安装成功

下载并运行模型

1
2
3
4
5
6
7
8
# 下载并运行 Qwen2.5 1.5B(小模型,约 1GB,适合体验)
ollama run qwen2.5:1.5b

# 下载并运行 DeepSeek-R1 1.5B
ollama run deepseek-r1:1.5b

# 下载并运行 Llama3.2 3B
ollama run llama3.2:3b

第一次运行会先下载,下载完直接进入对话:

1
2
3
4
>>> 你好,你是谁?
我是通义千问,阿里巴巴开发的AI助手...

>>> /bye

常用命令

1
2
3
4
5
ollama list          # 查看已下载的模型
ollama pull <模型> # 下载模型
ollama rm <模型> # 删除模型
ollama run <模型> # 在终端运行对话
ollama serve # 启动 API 服务(默认端口 11434)

用 API 调用(Java 开发者最关心的)

Ollama 启动后会在本地暴露一个 HTTP API,格式和 OpenAI 完全兼容:

1
2
3
4
5
curl http://localhost:11434/api/chat -d '{
"model": "qwen2.5:1.5b",
"messages": [{"role": "user", "content": "用一句话解释什么是 Spring Boot"}],
"stream": false
}'

在后面,会用 Java 的 HttpClient 调用这个接口; Spring AI 会通过 OllamaChatModel 自动集成它。


六、Hugging Face Spaces:不想下载直接体验

如果只是想感受某个模型,不想下载,可以用 Spaces

打开 huggingface.co/spaces,搜索模型名,很多模型都有免费的在线 Demo。比如搜索 Qwen2.5,找到官方 Demo,直接在浏览器对话。

适合在买 API 额度或下载模型之前,先感受一下效果。


七、模型文件长什么样

打开任意模型的 “Files and versions” 标签,会看到:

1
2
3
4
5
6
7
8
config.json           → 模型结构配置(层数、维度等)
tokenizer.json → 分词器(把文字切成 Token 的规则)
model.safetensors → 实际的权重文件(最大,几 GB)
或拆分为:
model-00001-of-00004.safetensors
model-00002-of-00004.safetensors
……
README.md → 就是 Model Card

.safetensors.bin 文件就是模型的”大脑”,Ollama 下载的 .gguf 是它的量化压缩版。


Hugging Face 和 Ollama 有什么区别?

现在对 Ollama 已经有感觉了,解释一个常见问题:Hugging Face 上也能找到 Qwen、DeepSeek 这些模型,和 Ollama 上的有什么区别?

Hugging Face 是模型仓库,Ollama 是运行工具。 两者不是竞争关系,而是上下游:

1
2
3
Hugging Face    →    存放原始模型文件(.safetensors / .bin)
↓ 转换 + 量化
Ollama 的模型库 → 存放处理过的、可以直接在本地跑的版本(.gguf)
Hugging Face Ollama
定位 全球最大模型托管平台 本地模型运行工具
模型数量 几十万个(全) 几百个(精选主流)
文件格式 .safetensors .bin(原始精度) .gguf(量化压缩版)
使用门槛 需要 Python 环境加载 一条命令直接跑
7B 模型大小 原始约 14GB 量化版约 4-5GB

Qwen2.5-7B-Instruct 为例:Hugging Face 上是 14GB+ 的原始文件,需要用 Python 的 transformers 库加载;Ollama 上是 4.7GB 的量化版,ollama pull 一条命令搞定。

同一个模型,不同形态。