Mô-đun chức năng: Thứ nhất, điều khiển giọng nói, nhận dạng giọng nói ngoại tuyến, phản hồi <0,3 giây, hỗ trợ phương ngữ và nhiều lệnh; Thứ hai, nhận dạng cử chỉ, tầm nhìn AI nhận dạng cử chỉ vẫy tay, nắm tay và lên xuống để điều khiển lựa chọn cửa và sàn; Thứ ba, khuôn mặt 3D, camera hai mắt hồng ngoại, phát hiện sống, tỷ lệ nhận dạng 95% + với mặt nạ và mũ; Thứ tư, hợp nhất đa phương thức, tự động chuyển sang chế độ tối ưu, hoạt động ổn định trong điều kiện ánh sáng yếu và đèn nền; Thứ năm, bảo vệ, xử lý thuật toán cục bộ, không tải lên dữ liệu khuôn mặt, trong tuân thủ Luật bảo mật dữ liệu.