Xây dựng tính năng blog bằng giọng nói với chế độ ChatGPT Codex
Nhà phát triển Simon Willison đã minh họa cách xây dựng một trang chỉ mục bản tin hoàn chỉnh cho blog Django của mình hầu như hoàn toàn bằng lệnh giọng nói qua chế độ Codex của ứng dụng ChatGPT trên máy tính trong khi nấu ăn. Mô hình AI đã xử lý giọng nói đối thoại tự nhiên—bao gồm cả các từ ấp úng và quãng ngắt nghỉ—để viết Django model, chuyển đổi cơ sở dữ liệu (migration), giao diện (template) và các hàm nhập dữ liệu. Thử nghiệm thực tế này cho thấy cách các giao diện giọng nói đa phương thức trong công cụ phát triển AI có thể hỗ trợ lập trình không cần dùng tay và thiết kế kiến trúc phần mềm qua đối thoại. Điều này nhấn mạnh sự chuyển dịch hướng tới tương tác người - máy tự nhiên hơn trong phát triển phần mềm, nơi các nhà phát triển có thể đọc yêu cầu và tinh chỉnh tính năng mà không cần gõ phím. Khi kết nối với máy chủ phát triển cục bộ, mô hình AI (GPT-6 Astra High) đã tạo các migration cơ sở dữ liệu Django, cấu hình quản trị admin, và trình thu thập dữ liệu từ RSS feed lẫn API không chính thức của Substack trong một phiên trò chuyện bằng giọng nói kéo dài 30 phút. Mặc dù bản ghi hội thoại chứa nhiều đoạn nói ngập ngừng tự nhiên, mô hình vẫn triển khai chính xác các quy tắc hiển thị lưu trữ theo ngày và tích hợp tìm kiếm.
## KIẾN THỨC NỀN
OpenAI đã tích hợp các công cụ phát triển của Codex trực tiếp vào ứng dụng ChatGPT trên máy tính, cho phép người dùng chạy mã nguồn và kết nối với các máy chủ phát triển cục bộ ngay trên giao diện ứng dụng. Blog của Simon Willison được xây dựng bằng Django, một web framework phổ biến của Python sử dụng cấu trúc model, view và template để tổ chức mã nguồn. Chế độ giọng nói trong các ứng dụng LLM chuyển đổi âm thanh nói trực tiếp thành prompt văn bản, cho phép tinh chỉnh các bộ mã nguồn mà không cần thao tác gõ bàn phím.