善忘技术夹 Logo
善忘技术夹
善用佳软 开源/免费

下载一个 7GB 的模型,跑起来卡成 PPT?先查查你的电脑适合什么

一、你下载过”跑不动”的模型吗?

上周我在 Ollama 上看到一个 13B 的模型,心动了。7GB 的下载量,我在公司午休时间挂着下载,下班回家满心期待地打开终端,输入提示词,然后——

等了三秒,一个字都没出来。

又等了五秒,终于开始一个字一个字地往外蹦,间隔大概两秒一个。我算了一下,这速度大概 0.5 tok/s,比我手写还慢。

这不是我第一次踩坑。Ollama 里几百个模型,每个还分 Q4、Q8、FP16 好几种量化版本。我根本不知道自己的 16GB 内存 MacBook 能跑什么,不能跑什么。每次都是下载一个试试,跑不动就删,再下另一个。一个模型 3 到 7GB,下载半天,跑起来卡成 PPT,再删掉。反复几次,时间全浪费了。

后来我发现了 llmfit。它解决的就是这个问题:不用下载模型,就能知道你的电脑适合跑哪些模型。

二、llmfit:你的本地模型选型军师

llmfit TUI 界面演示 图:llmfit 终端 TUI 界面,展示硬件检测后模型评分排序(来源:GitHub 官方仓库)

llmfit 是一个开源的终端工具,GitHub 上已有 33.5k Star,用 Rust 写的,MIT 协议。

项目地址:https://github.com/AlexsJones/llmfit

它的工作方式很直接:检测你的硬件配置,然后扫描模型库里的几百个模型,给你的电脑打分。哪些模型能跑、跑多快、质量如何、上下文多长,全部排好序给你看。

工作原理

自动检测你的 RAM、CPU、GPU、VRAM,然后每个模型在四个维度上打分,从最适配到最不适配排列。

llmfit 的评分不是简单的”能跑/不能跑”,四个维度各有侧重:

维度说明意义
内存适配模型大小加量化档位 vs 你的可用内存会不会爆内存
预计速度基于内存带宽模型加社区实测数据跑起来快不快
质量模型本身的性能基准生成效果好不好
上下文能支持多长的上下文窗口能不能处理长文档

速度估算这块挺有意思。它不靠猜,而是基于内存带宽模型,结合社区用户在你相似硬件上的实测数据。每个估算结果都标注了假设条件,用 llmfit info 命令可以查看具体是怎么算出来的。

三、上手实测:一条命令找到你的最佳模型

安装

llmfit 的安装方式很全,挑一个顺手的:

# macOS 用户(推荐)
brew install llmfit

# Windows 用户
scoop install llmfit

# 快速安装(全平台)
curl -fsSL https://llmfit.axjns.dev/install.sh | sh

# 或者用 pip
uv tool install -U llmfit

最常用的命令

装好之后,打开终端,一行命令:

llmfit

这就是核心命令,默认进入交互式 TUI 界面。它会自动检测你的硬件,然后从模型库中拉取所有模型,按适配度排名展示给你看。

llmfit 推荐命令执行效果 图:llmfit 的模型适配打分界面,展示每个模型在内存、速度、质量、上下文四个维度的评分(来源:GitHub 官方仓库)

想要更简洁的输出,可以试这几个:

# 只显示适配度最高的模型
llmfit fit

# 输出 JSON 格式,供脚本或 AI 工具调用
llmfit recommend --json

# 查看某个模型在你电脑上的详细分析
llmfit info "qwen2.5:7b"

我实际试了一下。在我的 M1 MacBook Pro 16GB 上跑 llmfit,大概 2 秒就检测完了硬件,然后展示了一个长长的模型列表。排在前面的是 7B 参数的 Q4 量化版本,预计速度 30 到 40 tok/s,内存占用约 5 到 6GB。14B 模型的排名靠后,预计速度降到 10 到 15 tok/s。30B+ 的大模型直接标红——内存不够。

以前我可能要下载三四个模型才能试出来哪个适合,现在一条命令、两秒钟就知道答案了。

四、不止是估算:实测加社区基准

自己跑一次基准测试

llmfit 的估算毕竟是估算。如果你想知道自己电脑上跑某个模型到底有多快,可以用:

llmfit bench

这条命令会在你正在运行的推理服务(Ollama、llama.cpp、MLX 等)上实测 tok/s(每秒生成 token 数)和 TTFT(首 token 延迟)。数据是真实的,不是估算。

把数据贡献给社区

更有意思的是,你测出来的数据可以直接从 TUI 界面提交 PR 回项目。不需要装 gh 命令行工具,不需要第三方账号,在终端里点几下就能完成。下一次发布时,这些数据就会进入社区基准库。以后和你硬件一样的人,就能直接看到你的实测数据,不用自己再跑一遍 benchmark。

支持多种本地推理框架

llmfit 不是只适配 Ollama 的。它支持的运行时包括:

  • Ollama:最常见的本地推理框架
  • llama.cpp:轻量级 C++ 推理引擎
  • MLX:Apple Silicon 专属优化框架
  • Docker Model Runner:Docker 容器化推理
  • LM Studio:图形化本地推理客户端

不管你用哪个,llmfit 都能识别并给出适配建议。

五、适合谁?不适合谁?

适合你,如果:

  • 你在本地部署过大模型,但不知道选哪个量化版本合适
  • 你的电脑配置不算顶配(16GB 或 32GB 内存),想知道自己的极限在哪
  • 你在 Ollama 上翻来翻去,几百个模型不知道从哪个开始试
  • 你经常在不同电脑上跑模型,想快速了解每台电脑的能力上限

可能不适合你,如果:

  • 你只用云 API(OpenAI、Claude 等),从不碰本地模型
  • 你没有命令行使用经验,看到终端就头疼
  • 你的电脑配置很低(8GB 以下内存),能跑的模型非常有限,llmfit 扫完可能直接告诉你没有推荐的模型

六、写在最后

选模型这件事,不应该靠下载试错。几百个模型,每个 3 到 14GB 的下载量,如果全靠试,时间成本太高了。llmfit 把试错变成了计算——检测你的硬件,计算每个模型的适配度,排好序给你看。整个过程只需要一条命令,几秒钟出结果。

如果你已经在本地玩大模型,或者正准备入坑,不妨先装一个 llmfit,跑一下 llmfit 命令,看看你的电脑到底能跑什么,然后再去下载。这样至少不会浪费几个小时下载一个跑不动的模型。


项目信息

  • 项目名称:llmfit
  • GitHub:https://github.com/AlexsJones/llmfit
  • 协议:MIT
  • 当前 Star:33.5k+
  • 技术栈:Rust
  • 安装命令:brew install llmfit / scoop install llmfit
  • 支持系统:Windows / macOS / Linux
  • 姐妹项目:llmserve(本地模型服务 TUI)、llama-panel(macOS 本地模型管理)

互动时间:你电脑上跑过最大的模型是哪个?参数多大?跑起来卡不卡?评论区聊聊你的配置和体验。

喜欢这款工具?关注「善忘技术夹」全媒体

扫描二维码关注微信公众号与小程序,获取更多高品质开源软件推荐与效率工具测试。

善忘技术夹 微信公众号宣传图
微信公众号 (扫码关注)
善忘技术夹 微信小程序宣传图
微信小程序 (扫码即用)