Chạy mô hình AI cục bộ với Ollama: Hướng dẫn từng bước cho người mới

✍️ Trần Minh Trí (Chuyên gia AI & Lập trình)
⏱️ 7 phút đọcBeginner
#ollama #ai cuc bo #llm #chay ai offline #bao mat du lieu
Chạy mô hình AI cục bộ với Ollama: Hướng dẫn từng bước cho người mới

1. Ollama là gì và vì sao nên chạy AI cục bộ?

Ollama là công cụ mã nguồn mở giúp tải và chạy các mô hình ngôn ngữ lớn (LLM) ngay trên máy tính cá nhân, không cần gửi dữ liệu lên đám mây. Chỉ với vài lệnh trong terminal, bạn có thể chạy Llama 3.1, Mistral, Phi 3 hoặc Gemma như một trợ lý AI riêng của mình.

Khác với ChatGPT hay Gemini chạy trên máy chủ của công ty, AI cục bộ chạy hoàn toàn trên phần cứng của bạn. Điều này mang lại quyền riêng tư tuyệt đối, không tốn phí thuê bao và hoạt động tốt cả khi mất internet.

  • Riêng tư tuyệt đối: dữ liệu không bao giờ rời khỏi máy.
  • Miễn phí: không trả phí theo lượt hay theo tháng.
  • Hoạt động offline: dùng được ngay cả khi mất mạng.
  • Tùy biến sâu: thay đổi mô hình, system prompt và tham số tự do.
📝NOTE
Ollama không phải là một mô hình AI mà là trình quản lý và chạy mô hình. Bạn dùng nó để tải, lưu trữ và chạy nhiều mô hình khác nhau trên cùng một máy.

2. Yêu cầu phần cứng: Chọn mô hình phù hợp với máy

Mô hình càng lớn càng thông minh nhưng càng tốn bộ nhớ. Yếu tố quyết định là RAM và VRAM (bộ nhớ card đồ họa), không phải CPU.

  • Mô hình 3B-8B (Llama 3.1 8B, Phi 3 Mini): cần khoảng 4-8GB RAM, chạy được trên laptop phổ thông với tốc độ chấp nhận được.
  • Mô hình 13B-14B (Mistral, Llama 3 8B bản lượng tử): cần 8-16GB RAM, nên có card đồ họa 8GB VRAM để chạy mượt.
  • Mô hình 70B (Llama 3 70B): cần ít nhất 32-48GB RAM hoặc nhiều card đồ họa, thường chỉ dành cho máy trạm.

Máy Mac chip Apple Silicon (M1 trở lên) chạy Ollama rất tốt nhờ bộ nhớ hợp nhất. Laptop Windows nên ưu tiên máy có card NVIDIA để dùng CUDA tăng tốc xử lý.

💡TIP
Chưa biết máy của mình mạnh tới đâu, hãy bắt đầu với mô hình 7B-8B. Nó chạy được trên hầu hết máy tính và đủ dùng cho việc soạn email, tóm tắt văn bản và hỏi đáp thông thường.

3. Cài đặt Ollama trên Windows, macOS và Linux

Cách cài đặt phụ thuộc vào hệ điều hành, nhưng quy trình đều đơn giản và mất chưa đầy 5 phút.

  • Windows: tải file cài đặt từ trang chủ ollama.com, chạy và làm theo hướng dẫn. Sau khi cài, mở Command Prompt hoặc PowerShell và gõ ollama --version.
  • macOS: tải file .dmg từ trang chủ, kéo biểu tượng vào thư mục Applications, sau đó mở Terminal và kiểm tra bằng ollama --version.
  • Linux: chạy lệnh curl -fsSL https://ollama.com/install.sh | sh trong terminal. Script tự cài đặt và cấu hình dịch vụ chạy nền.

Sau khi cài đặt, Ollama chạy như một dịch vụ nền (background service) trên cổng 11434. Bạn không cần làm gì thêm, chỉ cần mở terminal mới để sử dụng lệnh.

⚠️WARNING
Trên Windows, nếu lệnh ollama không được nhận diện, hãy đóng và mở lại terminal, hoặc đăng xuất rồi đăng nhập lại để biến môi trường được cập nhật.

4. Tải và chạy mô hình đầu tiên

Mở terminal và chạy lệnh ollama run llama3.1. Lần đầu tiên, Ollama tự tải mô hình khoảng 4-5GB, sau đó mở giao diện trò chuyện ngay trong terminal.

(1) Gõ ollama run llama3.1 và chờ quá trình tải hoàn tất.

(2) Nhập câu hỏi đầu tiên, ví dụ: "Giới thiệu về Việt Nam bằng 3 câu".

(3) Gõ /bye để thoát phiên trò chuyện.

Bạn có thể tải trước mô hình mà không chạy ngay bằng lệnh ollama pull llama3.1. Lệnh ollama list hiển thị các mô hình đã tải, ollama rm llama3.1 xóa mô hình khi không cần dùng.

📝NOTE
Tên mô hình có thể khác nhau tùy phiên bản, ví dụ llama3.1, mistral, phi3, gemma2. Gõ ollama list hoặc truy cập thư viện mô hình trên trang chủ Ollama để xem danh sách đầy đủ.

5. Các lệnh Ollama hữu ích cho người dùng hàng ngày

  • ollama run : mở phiên trò chuyện với mô hình.
  • ollama pull : tải mô hình về máy.
  • ollama list: xem danh sách mô hình đã tải.
  • ollama ps: xem mô hình đang chạy và dung lượng bộ nhớ đang dùng.
  • ollama stop : dừng mô hình đang chạy để giải phóng RAM.
  • ollama rm : xóa mô hình khỏi máy.

Khi không dùng, Ollama tự động dỡ mô hình khỏi bộ nhớ sau vài phút để máy không bị chậm. Nếu muốn giải phóng RAM ngay, dùng lệnh ollama stop.

💡TIP
/help trong phiên trò chuyện để xem các lệnh nội bộ như /set temperature, /set system để thay đổi tính cách trợ lý, hoặc /save để lưu phiên làm việc.

6. Tùy chỉnh mô hình và mở rộng với công cụ bên ngoài

Ollama cung cấp API tương thích OpenAI ngay tại http://localhost:11434, nghĩa là nhiều ứng dụng viết cho ChatGPT có thể trỏ về Ollama mà không cần sửa code nhiều.

  • Open WebUI: giao diện web đẹp mắt giống ChatGPT, chạy bằng Docker và kết nối trực tiếp với Ollama.
  • VS Code + Continue: trợ lý lập trình cục bộ, gợi ý code mà không gửi mã nguồn lên mạng.
  • Python: thư viện ollama cho phép gọi mô hình trong script xử lý văn bản, tóm tắt tài liệu hàng loạt.
  • Modelfile: file cấu hình để tạo mô hình tùy chỉnh với system prompt và tham số riêng.
IMPORTANT
Dữ liệu của bạn có thể vẫn bị gửi ra ngoài nếu dùng mô hình qua API đám mây của bên thứ ba. Với Ollama cục bộ, toàn bộ quá trình xử lý nằm trong máy, rất phù hợp với tài liệu nhạy cảm.

7. Khi nào nên dùng AI cục bộ và khi nào dùng đám mây

AI cục bộ phù hợp với tác vụ cần bảo mật, chi phí cố định và làm việc offline. AI đám mây vượt trội về độ thông minh của mô hình lớn nhất, tốc độ xử lý và khả năng đa phương thức như nhận diện ảnh, video.

Chiến lược hiệu quả nhất là kết hợp cả hai: dùng Ollama cho công việc hàng ngày như soạn thảo, tóm tắt, hỏi đáp kiến thức; dùng dịch vụ đám mây cho những tác vụ phức tạp cần mô hình mạnh nhất.

💡TIP
Bắt đầu bằng việc thay thế một tác vụ nhỏ hàng ngày, ví dụ soạn email hoặc tóm tắt bài viết, bằng Ollama. Sau một tuần dùng quen, bạn sẽ biết chính xác tác vụ nào nên chạy cục bộ và tác vụ nào nên dùng đám mây.

🙋 Câu hỏi thường gặp

Chạy AI cục bộ có tốn điện và làm chậm máy không?

Khi chạy mô hình, CPU và GPU hoạt động ở mức cao nên máy tiêu thụ nhiều điện hơn và quạt có thể ồn hơn. Tuy nhiên Ollama tự động dỡ mô hình khỏi bộ nhớ khi không dùng, nên máy trở lại bình thường ngay sau đó. Nếu máy cấu hình thấp, hãy chọn mô hình 3B-7B để cân bằng giữa chất lượng và hiệu năng.

Ollama có hỗ trợ tiếng Việt không?

Có. Các mô hình như Llama 3.1, Mistral và Gemma 2 xử lý tiếng Việt khá tốt cho nhu cầu hỏi đáp, soạn thảo và tóm tắt. Chất lượng không bằng các dịch vụ đám mây lớn nhưng đủ dùng cho công việc hàng ngày. Bạn có thể cải thiện thêm bằng cách yêu cầu mô hình trả lời bằng tiếng Việt ngay trong system prompt.

Máy không có card đồ họa rời có chạy được Ollama không?

Hoàn toàn được. Ollama chạy trên CPU, chỉ là tốc độ chậm hơn. Với mô hình 7B-8B chạy trên CPU, thời gian phản hồi khoảng 5-15 giây cho mỗi câu trả lời, chấp nhận được cho nhu cầu soạn thảo và hỏi đáp. Máy Mac Apple Silicon chạy đặc biệt tốt nhờ bộ nhớ hợp nhất.


Kiến thức liên quan