SocX AI¶
Cài đặt Local AI cho NetGuardX¶
Mô hình SOCX - AI¶

Kết nối trực tiếp¶
Để đạt hiệu suất cao nhất, hạn chế độ trễ giữa SOCX mà AI thì hai máy chủ cần nằm trong cùng dải mạng (local)
Kết nối qua VPN¶
Nếu SOCX và AI Server không cùng dải local cần kết nối hai máy chủ này trong cùng một dải mạng riêng (VPN), nên sử dụng Wireguard để hạn chế độ trễ
Cài đặt ứng dụng¶
Cài đặt LMS Studio¶
# tải và cài đặt ứng dụng lms cli
curl -fsSL https://lmstudio.ai/install.sh | bash
# sửa profile
nano ~/.profile
# thêm dòng sau vào file profile
export PATH="$PATH:/root/.lmstudio/bin"
# load profile
source ~/.profile
Download Model¶
Tham khảo cách tính VRAM để lựa chọn Model phù hợp: https://apxml.com/tools/vram-calculator. Với cấu hình VRAM 24Gb chỉ có thể sử dụng những model có size nhỏ hơn 20Gb (từ 10 tới 18 Gb là tốt nhất). Đề xuất 2 model:
- openai/gpt-oss-20b
- qwen/qwen3-30b-a3b-2507
Để tìm model tham khảo trang: https://huggingface.co/models
Tìm kiếm bằng lms cli:
# command
lms get gpt-oss-20b
# gõ Enter để download
Load Model¶
Để sử dụng tối ưu VRAM có sẵn cần điều chỉnh param context
Ví dụ với openai/gpt-oss-20b có thể chỉnh tới 120k context
lms load openai/gpt-oss-20b --gpu max -c 120000
Với qwen/qwen3-30b-a3b-2507 chỉ có thể load với 48k context
lms load qwen/qwen3-30b-a3b-2507 --gpu max -c 48000
VRAM sử dụng sẽ lên tới trên 95%, kiểm tra với lệnh nvtop

Sử dụng lệnh: lms unload -a để hủy model đang được load
Sau khi load model thành công có thể Chat trực tiếp trên terminal sử dụng lệnh sau
# chat và kiểm tra tốc độ
lms chat --stats
Với model qwen/qwen3-30b-a3b-2507 sẽ đạt 75 tok/s

Mở API server¶
LMS cho phép mở API server để các công cụ có thể kết nối tới
Chạy command sau:
lms server start --bind 0.0.0.0
Lms sẽ mở một máy chủ tại port 1234, có thể kết nối từ bất kỳ máy tính nào cùng dải địa chỉ ip
Sử dụng command sau để kiểm tra:
curl http://localhost:1234/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: TOKEN_XXX" \
-d '{
"model": "qwen/qwen3-30b-a3b-2507",
"max_tokens": 256,
"messages": [
{"role": "user", "content": "hello"}
]
}'
Thay đổi localhost bằng địa chỉ ip của AI Server, để gọi từ máy tính khác trong dải Chú ý: Vì hệ thống từ local và cấu hình mặc định nên không cần sử dụng Token đúng.
Cài đặt GUI cho AI¶
Cài đặt OpenWebUI¶
LMS Studio CLI không hỗ trợ xác thực API và giao diện Web nên cần thông qua một ứng dụng khác để làm WEB UI cho AI. Sử dụng OpenWebUI, xem hướng dẫn chi tiết cài đặt tại đây: https://github.com/open-webui/open-webui
Sử dụng docker:
docker run -d --network=host -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Sau khi docker khởi chạy (chờ khoảng 5' để app khởi động hoàn mới có thể truy cập) Truy cập web theo địa chỉ: http://<ai_server_ip>:8080 để thiết lập admin

Cấu hình kết nối tới AI local¶
Truy cập địa chỉ http://localhost:8080/admin/settings/connections để cấu hình kết nối tới AI local lms đã thiết lập ở mục 2
- Tắt và xóa các loại API khác chỉ để lại OpenAI như trong hình

Thêm cấu hình API kết nối tới LMS

Thay đúng địa chỉ của AI Server, lưu và trở lại trang chủ để test

Truy cập link sau để tạo người dùng: http://localhost:8080/admin/users/overview

Thiết lập SOCX kết nối AI¶
Sau khi thiết lập AI, có thể tương tác được. Để có thể kết nối SOCX và AI, hai máy chủ này cần trong cùng một dải mạng Local hoặc VPN
Trên SOCX Portal cấu hình trong file .env
OLLAMA_API_URL="http://IP_AI_SERVER:1234/v1/chat/completions" OLLAMA_API_KEY="TOKEN_XXX" AI_MODEL_NAME="MODEL_NAME"