webAI Phát Hành TwIL LM3 Pro: Mô Hình 3,66 Tỷ Tham Số Chuyên Về Lô-gích Hình Thức
webAI đã phát hành TwIL LM3 Pro, một mô hình 3,66 tỷ tham số được xây dựng trên nền IBM Granite 4.2 3B và tinh chỉnh chuyên biệt cho các tác vụ lô-gích hình thức bằng học tăng cường với bộ xác thực lập trình (programmatic verifiers). Trên các bộ kiểm thử lô-gích hình thức, mô hình đạt điểm tổng hợp 55.4 và điểm lô-gích BBH đạt 95,4%, ngang ngửa hoặc vượt qua các mô hình lớn hơn như Qwen3-8B. Sự kiện này chứng minh rằng các mô hình ngôn ngữ nhỏ có thể sánh ngang khả năng suy luận hình thức của các mô hình gấp đôi kích thước khi được huấn luyện bằng phương pháp học tăng cường với bộ xác thực lập trình (RLVR). Mô hình cung cấp giải pháp gọn nhẹ (chỉ từ 2,09 GiB ở định dạng Q4 GGUF) có thể chạy trên phần cứng cá nhân để làm bộ kiểm tra lô-gích cho quy tắc hợp đồng, xác thực chính sách hoặc thẩm định các bước của tác tử AI. Mô hình được huấn luyện bằng phương pháp tinh chỉnh LoRA SFT, hợp nhất checkpoint và học tăng cường với bộ kiểm tra lập trình, dù phải đánh đổi bằng hiệu năng giảm nhẹ trên các bộ kiểm thử chung (trung bình 79,0). Mô hình tạo ra chuỗi suy luận dài trung bình khoảng 1.900 token cho mỗi câu trả lời, với khoảng 25% câu trả lời bị chạm trần giới hạn độ dài ngữ cảnh, và được phát hành theo giấy phép phi thương mại.
## KIẾN THỨC NỀN
Học tăng cường với bộ xác thực lập trình (RLVR) huấn luyện các mô hình ngôn ngữ bằng cách cung cấp phản hồi chính xác, có thể kiểm tra được từ mã thực thi hoặc các bộ chứng minh định lý tự động như Lean, giúp loại bỏ sự phụ thuộc vào đánh giá của con người hay LLM khác. Các bộ kiểm thử như BIG-Bench Hard (BBH) được thiết kế để đánh giá khả năng diễn dịch lô-gích nhiều bước và suy luận phức tạp mà các mô hình ngôn ngữ thông thường hay gặp khó khăn.