Senior Edge AI Engineer

Mô hình nhỏ.
Cỗ máy lớn.

Mình là Ho Thinh Hung, kỹ sư Edge AI xây dựng các mô hình Vision-Language-Action nhỏ gọn và hệ thống inference giúp chúng hoạt động hiệu quả trong thế giới vật lý.

HO THINH HUNG

EDGE AIVLAMODEL OPT
100K+lượt tải mô hình
4bản sửa NVIDIA runtime
2.11×tăng tốc VLA policy

01 / GÓC NHÌN CỦA MÌNH

AI thú vị nhất là AI có thể nhìn, suy luận và hành động.

Mình thích khoảnh khắc một mô hình rời phòng lab và gặp các ràng buộc thật: bộ nhớ hạn chế, latency nghiêm ngặt, cảm biến nhiễu và một cỗ máy phải đưa ra hành động đúng.

Đó là nơi mình làm việc—giữa kiến trúc mô hình và phần cứng, biến những ý tưởng đa phương thức tham vọng thành hệ thống edge đáng tin cậy.

02 / MÌNH LÀM GÌ

Đi sâu,
xuyên suốt hệ thống.

Ba lĩnh vực mình dành nhiều thời gian nhất.

01

Vision-Language-Action

Xây dựng VLA nhỏ gọn kết nối thị giác, hiểu ngôn ngữ và hành động vật lý.

  • Kiến trúc Small VLA
  • Embodied intelligence
  • Multimodal policies
02

Tối ưu mô hình

Đưa mô hình mạnh vào ngân sách bộ nhớ, điện năng và latency thực tế mà vẫn giữ được chất lượng cần thiết.

  • Quantization & compression
  • TensorRT & ONNX
  • Tối ưu CUDA

03 / DỰ ÁN TIÊU BIỂU

Những thứ mình đã
xây dựng và khám phá.

Tất cả repository ↗

04 / PRECISION LAB

Chọn đúng
điểm đánh đổi.

Số đo thật từ ModelOpt recipes của mình—BF16, FP8, NVFP4, INT8 SmoothQuant và INT4 AWQ.

RECIPE ĐANG CHỌNFP8

Cân bằng thông lượng và dung lượng mô hình với thay đổi WER nhỏ.

Bộ nhớ2.55 GB
Latency · RTF ↓0.0152
Thông lượng ↑19.37 req/s
Độ chính xác · WER ↓7.60%
Qwen3-ASR-1.7B · vLLM · RTX 5090Nguồn benchmark ↗

05 / HỌC CÔNG KHAI

Học và
chia sẻ.

Xem tất cả bài viết

Ghi chú paper và thí nghiệm kỹ thuật trực tiếp, được viết lại bằng tiếng Việt theo hướng thực hành cho edge AI nhanh và đáng tin cậy.

06 / TOOLKIT

Công cụ là lựa chọn.
Kết quả mới là mục tiêu.

Nền tảng

Python · C++ · CUDA

Inference

TensorRT · Triton · vLLM · ONNX

Vision

DeepStream · YOLO · OpenCV · VLMs

Hệ thống

Docker · Kafka · Redis · WebRTC