OpenAI và Anthropic Gặp Sự Cố Gián Đoạn Đồng Thời Khơi Mào Thảo Luận Về Độ Tin Cậy
Báo chí đã phản ánh các sự cố gián đoạn dịch vụ diễn ra đồng thời tại các nhà cung cấp AI hàng đầu là OpenAI và Anthropic, làm dấy lên nghi vấn về sự cố hạ tầng dùng chung hoặc lưu lượng truy cập tăng đột biến theo dây chuyền. Tuy nhiên, một chỉ huy xử lý sự cố của OpenAI sau đó đã làm rõ rằng sự cố của họ là do lỗi định tuyến hạ tầng nội bộ độc lập. Khi các nhà cung cấp LLM lớn trở thành hạ tầng thiết yếu cho các ứng dụng hiện đại, những sự cố gián đoạn đồng thời đã làm bộc lộ các rủi ro hệ thống về độ tin cậy đám mây. Sự việc cho thấy việc chuyển đổi lưu lượng truy cập trong khi một dịch vụ lớn gặp sự cố có thể nhanh chóng gây áp lực lên các nhà cung cấp thay thế, nhấn mạnh tầm quan trọng của việc quy hoạch kiến trúc đa đám mây mạnh mẽ. Anthropic báo cáo sự cố gián đoạn một phần bắt đầu lúc 6:23 sáng PT, trong khi OpenAI gặp sự cố muộn hơn lúc 7:43 sáng PT ảnh hưởng đến ChatGPT và Codex do lỗi định tuyến nội bộ. Các kỹ sư hệ thống lưu ý rằng thời gian gián đoạn trùng hợp giữa các nền tảng độc lập thường có thể trông giống như sự cố hạ tầng dùng chung do hiện tượng người dùng nhanh chóng chuyển sang các dịch vụ thay thế.
## KIẾN THỨC NỀN
Sự cố dây chuyền (cascading failure) trong hệ thống phân tán xảy ra khi sự cố ở một thành phần kích hoạt các thất bại thứ cấp trên các dịch vụ kết nối hoặc lân cận do tái phân phối tải đột ngột. Khi một API AI chính bị ngừng hoạt động, cơ chế thử lại tự động và việc người dùng chuyển sang các nhà cung cấp thay thế có thể tạo ra các đợt tăng lưu lượng truy cập đột biến đủ để làm suy giảm các hệ thống dự phòng.