~/LARGE LANGUA/smaller-llms-use-massive-test-time-compute-to-compete-with-frontier-models

Các mô hình LLM nhỏ sử dụng lượng tính toán suy luận khổng lồ để cạnh tranh với mô hình lớn

Một cuộc thảo luận trong cộng đồng làm nổi bật cách các mô hình mã nguồn mở nhỏ hơn, chẳng hạn như Qwen 3.8 27B, tạo ra lượng lớn token suy luận ("suy nghĩ quá mức") để sánh ngang với hiệu suất của các mô hình lớn hàng đầu có hàng nghìn tỷ tham số. Xu hướng này được củng cố bởi dữ liệu từ SWE-Rebench, cho thấy các mô hình thiên về suy luận yêu cầu hàng triệu token cho mỗi vấn đề để giải quyết các tác vụ phức tạp. Điều này làm nổi bật sự chuyển dịch trong việc mở rộng quy mô AI, nơi việc tăng lượng tính toán khi suy luận (test-time compute) cho phép các mô hình nhỏ hơn, có thể chạy cục bộ, cạnh tranh được với các mô hình độc quyền khổng lồ. Mặc dù sự đánh đổi này làm tăng độ trễ và mức tiêu thụ token, nó giúp phổ cập hóa khả năng suy luận cấp cao cho người dùng sở hữu phần cứng phổ thông. Hệ thống đánh giá SWE-Rebench lưu ý rằng các mô hình như Qwen Next trung bình cần khoảng 8,12 triệu token cho mỗi vấn đề để giải quyết các tác vụ kỹ thuật phần mềm. Người dùng chạy các mô hình này cục bộ trên phần cứng như GPU VRAM 16GB có thể chọn giới hạn cứng các token suy luận bằng các khung làm việc như llama.cpp hoặc vLLM để quản lý thời gian tạo phản hồi.

## KIẾN THỨC NỀN

Tính toán khi suy luận (test-time compute - TTC) đề cập đến việc phân bổ thêm tài nguyên tính toán trong giai đoạn suy luận để cho phép mô hình "suy nghĩ lâu hơn" và thực hiện suy luận sâu hơn trước khi đưa ra câu trả lời cuối cùng. SWE-Rebench là một hệ thống đánh giá (benchmark) kỹ thuật phần mềm nhằm kiểm tra khả năng giải quyết các sự cố thực tế trên GitHub của các mô hình ngôn ngữ lớn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Large Language Models#AI Reasoning#Test-Time Compute#Qwen

$ subscribe --daily

Các mô hình LLM nhỏ sử dụng lượng tính toán suy luận khổng lồ để cạnh tranh với mô hình lớn | Daily News