Vision-Language-Action
Xây dựng VLA nhỏ gọn kết nối thị giác, hiểu ngôn ngữ và hành động vật lý.
- Kiến trúc Small VLA
- Embodied intelligence
- Multimodal policies
Senior Edge AI Engineer
Mình là Ho Thinh Hung, kỹ sư Edge AI xây dựng các mô hình Vision-Language-Action nhỏ gọn và hệ thống inference giúp chúng hoạt động hiệu quả trong thế giới vật lý.
HO THINH HUNG
01 / GÓC NHÌN CỦA MÌNH
Mình thích khoảnh khắc một mô hình rời phòng lab và gặp các ràng buộc thật: bộ nhớ hạn chế, latency nghiêm ngặt, cảm biến nhiễu và một cỗ máy phải đưa ra hành động đúng.
Đó là nơi mình làm việc—giữa kiến trúc mô hình và phần cứng, biến những ý tưởng đa phương thức tham vọng thành hệ thống edge đáng tin cậy.
02 / MÌNH LÀM GÌ
Ba lĩnh vực mình dành nhiều thời gian nhất.
Xây dựng VLA nhỏ gọn kết nối thị giác, hiểu ngôn ngữ và hành động vật lý.
Đưa mô hình mạnh vào ngân sách bộ nhớ, điện năng và latency thực tế mà vẫn giữ được chất lượng cần thiết.
Thiết kế hệ thống đáng tin cậy và quan sát được cho computer vision thời gian thực và inference thông lượng cao.
03 / DỰ ÁN TIÊU BIỂU
Các workflow FP8, NVFP4, AWQ và TensorRT có thể tái lập cho LLM và speech model, từ chuẩn bị đến kiểm chứng hướng triển khai.
Ghi chú thực hành và benchmark cho X-VLA, SmolVLA, quantization, pruning và triển khai edge.
FP16 → INT8 → INT4Thí nghiệm có kiểm soát tách lỗi fusion Myelin/CASK khỏi AWQ repacking mất mát và lỗi exporter InternVL3 âm thầm.
04 / PRECISION LAB
Số đo thật từ ModelOpt recipes của mình—BF16, FP8, NVFP4, INT8 SmoothQuant và INT4 AWQ.
Cân bằng thông lượng và dung lượng mô hình với thay đổi WER nhỏ.
05 / HỌC CÔNG KHAI
Ghi chú paper và thí nghiệm kỹ thuật trực tiếp, được viết lại bằng tiếng Việt theo hướng thực hành cho edge AI nhanh và đáng tin cậy.
Các thí nghiệm tách bốn lỗi generation ở FP16, NVFP4, AWQ và InternVL3, kèm xác nhận từ NVIDIA maintainer.
Hiệu năng inference trên H100, RTX và Jetson: bottleneck, cách chia deployment và chiến lược sinh action.
Activation-aware weight quantization, salient channels và vì sao runtime thực sự quyết định tốc độ.
Đọc bài viết ↗Chuyển độ khó của activation sang weight để PTQ mô hình lớn hiệu quả và chính xác.
Đọc bài viết ↗06 / TOOLKIT
Python · C++ · CUDA
TensorRT · Triton · vLLM · ONNX
DeepStream · YOLO · OpenCV · VLMs
Docker · Kafka · Redis · WebRTC