跳到内容
·作者: AI Resource Hub Team

使用 Ollama 运行本地大语言模型:完整指南

学习如何安装、配置和使用 Ollama 在本地运行开源大语言模型,实现隐私、速度和零 API 成本。

为什么在本地运行 LLM?

  • 隐私:数据永远不会离开你的机器。
  • 成本:设置后零 token 费用。
  • 速度:推理无网络延迟。
  • 离线:无需互联网连接即可工作。

安装 Ollama

  • 从 [ollama.com](https://ollama.com) 下载——支持 macOS、Linux 和 Windows。
  • 运行 `ollama pull llama3` 下载模型。
  • 运行 `ollama run llama3` 开始对话。

热门模型

  • Llama 3 8B:通用模型,8GB 内存可运行。
  • Llama 3 70B:更智能,需 48GB+ 内存。
  • Qwen 2.5:中文和多语言任务表现出色。
  • Mistral 7B:编程任务快速高效。
  • Phi-3 Mini:微软的小型但能力强的模型。

API 使用

Ollama 在 `http://localhost:11434` 提供本地 REST API。

  • 可通过覆盖 base URL 兼容 OpenAI SDK。

性能预期

  • M2 MacBook 上 7B 模型:约 30 tokens/秒。
  • RTX 4090 上 7B 模型:约 60 tokens/秒。
教程本地LLM