Bỏ qua

SocX AI

Cài đặt Local AI cho NetGuardX

Mô hình SOCX - AI

Kết nối trực tiếp

Để đạt hiệu suất cao nhất, hạn chế độ trễ giữa SOCX mà AI thì hai máy chủ cần nằm trong cùng dải mạng (local)

Kết nối qua VPN

Nếu SOCX và AI Server không cùng dải local cần kết nối hai máy chủ này trong cùng một dải mạng riêng (VPN), nên sử dụng Wireguard để hạn chế độ trễ

Cài đặt ứng dụng

Cài đặt LMS Studio

# tải và cài đặt  ứng dụng lms cli
curl -fsSL https://lmstudio.ai/install.sh | bash

# sửa profile
nano ~/.profile 
# thêm dòng sau vào file profile
export PATH="$PATH:/root/.lmstudio/bin"

# load profile
source ~/.profile

Download Model

Tham khảo cách tính VRAM để lựa chọn Model phù hợp: https://apxml.com/tools/vram-calculator. Với cấu hình VRAM 24Gb chỉ có thể sử dụng những model có size nhỏ hơn 20Gb (từ 10 tới 18 Gb là tốt nhất). Đề xuất 2 model:

  • openai/gpt-oss-20b
  • qwen/qwen3-30b-a3b-2507

Để tìm model tham khảo trang: https://huggingface.co/models

Tìm kiếm bằng lms cli:

# command
lms get gpt-oss-20b

# gõ Enter để download

Load Model

Để sử dụng tối ưu VRAM có sẵn cần điều chỉnh param context

Ví dụ với openai/gpt-oss-20b có thể chỉnh tới 120k context

lms load openai/gpt-oss-20b --gpu max -c 120000

Với qwen/qwen3-30b-a3b-2507 chỉ có thể load với 48k context

lms load qwen/qwen3-30b-a3b-2507 --gpu max -c 48000

VRAM sử dụng sẽ lên tới trên 95%, kiểm tra với lệnh nvtop

Sử dụng lệnh: lms unload -a để hủy model đang được load

Sau khi load model thành công có thể Chat trực tiếp trên terminal sử dụng lệnh sau

 # chat và kiểm tra tốc độ
lms chat --stats

Với model qwen/qwen3-30b-a3b-2507 sẽ đạt 75 tok/s

Mở API server

LMS cho phép mở API server để các công cụ có thể kết nối tới

Chạy command sau:

lms server start --bind 0.0.0.0

Lms sẽ mở một máy chủ tại port 1234, có thể kết nối từ bất kỳ máy tính nào cùng dải địa chỉ ip

Sử dụng command sau để kiểm tra:

curl http://localhost:1234/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: TOKEN_XXX" \
  -d '{
    "model": "qwen/qwen3-30b-a3b-2507",
    "max_tokens": 256,
    "messages": [
      {"role": "user", "content": "hello"}
    ]
}'

Thay đổi localhost bằng địa chỉ ip của AI Server, để gọi từ máy tính khác trong dải Chú ý: Vì hệ thống từ local và cấu hình mặc định nên không cần sử dụng Token đúng.

Cài đặt GUI cho AI

Cài đặt OpenWebUI

LMS Studio CLI không hỗ trợ xác thực API và giao diện Web nên cần thông qua một ứng dụng khác để làm WEB UI cho AI. Sử dụng OpenWebUI, xem hướng dẫn chi tiết cài đặt tại đây: https://github.com/open-webui/open-webui

Sử dụng docker:

docker run -d --network=host -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Sau khi docker khởi chạy (chờ khoảng 5' để app khởi động hoàn mới có thể truy cập) Truy cập web theo địa chỉ: http://<ai_server_ip>:8080 để thiết lập admin

Cấu hình kết nối tới AI local

Truy cập địa chỉ http://localhost:8080/admin/settings/connections để cấu hình kết nối tới AI local lms đã thiết lập ở mục 2

  • Tắt và xóa các loại API khác chỉ để lại OpenAI như trong hình

Thêm cấu hình API kết nối tới LMS

Thay đúng địa chỉ của AI Server, lưu và trở lại trang chủ để test

Truy cập link sau để tạo người dùng: http://localhost:8080/admin/users/overview

Thiết lập SOCX kết nối AI

Sau khi thiết lập AI, có thể tương tác được. Để có thể kết nối SOCX và AI, hai máy chủ này cần trong cùng một dải mạng Local hoặc VPN

Trên SOCX Portal cấu hình trong file .env

OLLAMA_API_URL="http://IP_AI_SERVER:1234/v1/chat/completions" OLLAMA_API_KEY="TOKEN_XXX" AI_MODEL_NAME="MODEL_NAME"