Nén Prompt LLMLingua-2 Native
Nén prompt hiệu năng cao được biên dịch bằng Rust và ONNX Runtime C API. Tối ưu hóa dành riêng cho môi trường chạy độc lập trên kiến trúc macOS Intel. Không cần Python thực thi.
2026-08-13 11:41:39.378722 [W:onnxruntime:llmlingua2-native, cpuid_info.cc:95 LogEarlyWarning] Unknown CPU vendor. cpuinfo_vendor value: 0
ONNX Runtime: 1.24.2
đoạn văn bản dài nén token
Bộ Mô Phỏng Nén Prompt Trực Tiếp
Trải nghiệm thuật toán tính xác suất giữ từ (word keep score), phân bổ trọng số cl100k token và loại bỏ từ dư thừa của LLMLingua-2 theo thời gian thực.
Hướng Dẫn Cài Đặt & Biên Dịch
Thực thi script biên dịch native, tải các tài nguyên model và chạy quá trình nén token trong vài phút trên macOS Intel.
Chuẩn bị Model & Tệp Tài Nguyên cl100k
Môi trường Python 3.12 chỉ được dùng tại thời điểm build để export model ONNX và tải tài nguyên tiktoken.
Biên Dịch File Nhị Phân Standalone x86_64
Biên dịch lớp đệm C shim native và liên kết trực tiếp mã nguồn Rust bằng rustc cho target x86_64-apple-darwin.
Kiến Trúc Hệ Thống
Lớp công nghệ native hiệu năng cao kết hợp bộ tách từ (tokenizer) Rust tùy chỉnh, lớp liên kết C FFI và thực thi ONNX Runtime.
BERT / WordPiece
Tokenizer Rust native hỗ trợ đầy đủ Tiếng Việt, CJK và Emoji.
Bộ Đếm cl100k
Bộ đếm tiktoken native để tính toán phân bổ trọng số xác suất.
Logic LLMLingua-2
Lọc phân ngưỡng percentile và gom xác suất từ cấp subword.
ONNX Runtime C API
Thực thi mô hình qua thư viện động libonnxruntime.dylib.
Cấu Trúc Gói Phát Hành Độc Lập (`dist/`)
├── llmlingua2 (File nhị phân x86_64 Mach-O)
├── lib/
│ └── libonnxruntime.dylib (Thư viện ONNX Runtime C API)
└── model/
├── model.onnx (Mô hình BERT Classification)
├── vocab.txt (Từ điển BERT Vocab)
└── cl100k_base.tiktoken (Bảng mã Tiktoken)
x86_64@rpath/libonnxruntime.dylib@executable_path/libMa Trận Kiểm Định Parity
Toàn bộ các module triển khai bằng Rust native đều phải trải qua bộ kiểm thử đối chiếu chức năng nghiêm ngặt so với bản chuẩn Python, Hugging Face và Tiktoken.
Xác minh khớp hoàn toàn với BertTokenizerFast của Hugging Face trên Tiếng Anh, tiếng có dấu và ký tự đặc biệt.
Bộ đếm tiktoken bằng Rust native khớp kết quả từng token so với thư viện tiktoken trong Python.
Xác minh khớp tuyệt đối xác suất nén end-to-end so với mô hình tham chiếu LLMLingua-2.
Xử lý chính xác ranh giới chunk quanh giới hạn 512 token BERT, dấu câu và chữ CJK.
Kiểm tra end-to-end đối với các đoạn prompt văn bản dài vượt quá 1,020+ WordPiece.
Tính chính xác của việc gọi hàm C API binding native được kiểm chứng so với ONNX Runtime Python.
Kết Quả Benchmark Tham Chiếu
Thông số đo lường thực tế trên cấu hình macOS 15.7.7, Intel Core i7-1068NG7 @ 2.30 GHz với phiên bản ONNX Runtime 1.24.2.
Thông Số Đăng Ký Kiểm Thử Benchmark
Mức Độ Tựu Bộ Nhớ Cold-Start
Công Cụ Tạo Cú Pháp Lệnh CLI
Tùy chỉnh các tham số cờ truyền vào để tạo ra câu lệnh nhị phân hoàn chỉnh sẵn sàng đưa vào các script tự động hóa.
--debug-scores để kiểm tra chi tiết xác suất giữ từng từ được mô hình phân bổ trên luồng báo lỗi stderr.
Danh Mục Kiểm Định Bản Phát Hành
Các điều kiện bắt buộc cần phải xác minh trước khi đóng gói phân phối bản cài đặt cho hệ điều hành macOS Intel.
| HẠNG MỤC KIỂM TRA | CÂU LỆNH XÁC MINH | KẾT QUẢ KỲ VỌNG | TRẠNG THÁI |
|---|---|---|---|
| Kiến trúc File Nhị Phân | file dist/llmlingua2 | Chứa thông tin x86_64 | ĐẠT |
| Kiến trúc Dylib ONNX | file dist/lib/libonnxruntime.dylib | Chứa thông tin x86_64 | ĐẠT |
| Liên Kết Động Dylib | otool -L dist/llmlingua2 | @rpath/libonnxruntime.dylib | ĐẠT |
| Đường Dẫn Tim Runtime | otool -l dist/llmlingua2 | Chứa @executable_path/lib | ĐẠT |
| Parity Tokenizer | ./scripts/test_tokenizer_parity.sh | 12/12 trường hợp pass | ĐẠT |
| Parity cl100k | ./scripts/test_cl100k_parity.sh | 14/14 trường hợp pass | ĐẠT |