1. Chuẩn bị trước khi cài đặt
Trước khi bắt đầu, hãy đảm bảo Cloud GPU Server của bạn đã đáp ứng các yêu cầu cơ bản sau: Hệ điều hành: Ubuntu 20.04 LTS hoặc 22.04 LTS (Khuyên dùng vì tính ổn định). Quyền truy cập: Quyền Root hoặc Sudo qua SSH. Driver NVIDIA: Đã được cài đặt bản mới nhất phù hợp với phần cứng. Lưu ý tại Adtech: Khi thuê GPU Server tại Adtech, bạn có thể yêu cầu kỹ thuật viên cài đặt sẵn Driver và CUDA để tiết kiệm thời gian, hoặc tự cài đặt theo các bước dưới đây để tùy chỉnh sâu hơn.
2. Bước 1: Cài đặt NVIDIA Driver và CUDA Toolkit
Đây là bước quan trọng nhất. Nếu không có Driver và CUDA, các Framework AI sẽ không thể giao tiếp với lõi GPU.2.1. Cài đặt NVIDIA Driver
Cập nhật hệ thống và kiểm tra các Driver khả dụng: Bash sudo apt update && sudo apt upgrade -y ubuntu-drivers devices Chọn phiên bản Driver phù hợp (ví dụ bản 535) và cài đặt: Bash sudo apt install nvidia-driver-535 -y Sau khi cài đặt, hãy khởi động lại máy chủ và kiểm tra bằng lệnh: nvidia-smi. Nếu hiện ra bảng thông số GPU, bạn đã thành công.
2.2. Cài đặt CUDA Toolkit
Truy cập trang chủ NVIDIA để lấy link tải bản CUDA phù hợp (thường là CUDA 11.8 hoặc 12.x cho các dòng GPU mới). Bash wget https://developer.download.nvidia.com/compute/cuda/12.1.0/local_installers/cuda_12.1.0_530.30.02_linux.run sudo sh cuda_12.1.0_530.30.02_linux.run Đừng quên cấu hình biến môi trường trong file .bashrc: Bash export PATH=/usr/local/cuda-12.1/bin${PATH:+:${PATH}} export LD_LIBRARY_PATH=/usr/local/cuda-12.1/lib64${LD_LIBRARY_PATH:+:${LD_LIBRARY_PATH}}
3. Bước 2: Quản lý môi trường với Anaconda/Miniconda
Trong giới làm AI, việc cài đặt trực tiếp mọi thứ vào Python hệ thống là một sai lầm lớn dễ dẫn đến xung đột thư viện. Chúng ta nên sử dụng Conda để tạo các môi trường ảo (Virtual Environments) riêng biệt cho PyTorch và TensorFlow. Cài đặt Miniconda: Bash wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh bash Miniconda3-latest-Linux-x86_64.sh4. Bước 3: Thiết lập môi trường PyTorch
PyTorch được yêu thích bởi tính linh hoạt và dễ debug. Để cài đặt bản tối ưu cho server GPU: Tạo môi trường mới: Bash conda create -n pytorch_env python=3.10 conda activate pytorch_env Cài đặt PyTorch với hỗ trợ CUDA: Truy cập trang chủ PyTorch để lấy câu lệnh chính xác nhất cho phiên bản CUDA của bạn. Ví dụ: Bash pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121 Kiểm tra kết nối GPU: Mở Python và chạy dòng lệnh sau: Python import torch print(torch.cuda.is_available()) # Kết quả True là thành công print(torch.cuda.get_device_name(0))
5. Bước 4: Thiết lập môi trường TensorFlow
TensorFlow thường khắt khe hơn về phiên bản CUDA và cuDNN. Tạo môi trường mới: Bash conda create -n tf_env python=3.9 conda activate tf_env Cài đặt TensorFlow: Từ bản 2.x, TensorFlow đã gộp chung bản CPU và GPU vào một gói cài đặt: Bash pip install tensorflow[and-cuda] Kiểm tra kết nối GPU: Python import tensorflow as tf print(tf.config.list_physical_devices('GPU'))
6. Bước 5: Cài đặt cuDNN (Deep Neural Network Library)
cuDNN là thư viện của NVIDIA giúp tăng tốc các phép tính tích chập (Convolutional) trong Deep Learning. Để cài đặt: Tải file cuDNN từ NVIDIA Developer Program. Giải nén và copy các file header/library vào thư mục CUDA tương ứng. Việc này cực kỳ quan trọng để đạt được mức FPS cao nhất khi training model ảnh (Computer Vision).7. Sử dụng Docker - Giải pháp thay thế nhanh chóng
Nếu bạn không muốn mất thời gian cài đặt từng bước, Docker là giải pháp tuyệt vời. NVIDIA cung cấp các bản Image có sẵn (NVIDIA Container Toolkit) đã được tối ưu hóa toàn bộ Driver và Framework. Tại Adtech, chúng tôi hỗ trợ khách hàng triển khai Docker cực nhanh, bạn chỉ cần kéo Image từ Docker Hub về và chạy: Bash docker pull pytorch/pytorch:latest-cuda12.1-cudnn8-runtime Cách này giúp môi trường của bạn luôn "sạch" và dễ dàng di chuyển giữa các server khác nhau.


