Vào ngày 18 tháng 8 năm 2026, một tờ báo được đưa lên trên một tiêu đề không giấu được mục tiêu: "siêu trí tuệ-Bench: tại Bình minh của Siêu thông tin nhân tạo." Hơn 40 chuyên gia đã tạo ra 60 công việc nghiên cứu trên 11 lĩnh vực khoa học. Các tác giả đặt giá con người lên đến hơn 31.000 giờ. Bài kiểm tra không phải là một câu đố khác về những sự kiện đã biết. Nó hỏi liệu một hệ thống AI có thể khám phá, chọn một phương pháp, và biến một ý tưởng mới thành kết quả bạn có thể kiểm tra, khi các hướng dẫn của con người tắt.

Hơn 18 nhân viên cao cấp và thiết lập mô hình, điểm trung bình là 50.91 với hướng dẫn phương pháp đầy đủ. Nó giảm xuống còn 29.10 khi chỉ có phương pháp được đặt tên. Nó giảm xuống 26.62 khi đặc vụ phải chọn phương pháp. Các tác giả đã đọc rằng làm giảm cách mà một giáo viên sẽ làm: các hệ thống ngày nay vẫn dựa vào người đã biết công việc nên đi đến đâu.

Sự suy giảm nhanh chóng này cho thấy rằng hệ thống hiện tại vẫn còn phụ thuộc rất nhiều vào sự hướng dẫn của con người và vẫn còn rất xa so với tiến hành tự động kết thúc, nghiên cứu khoa học cấp độ dự án.

siêu trí tuệ-Bench · arXiv:2608.17271 · 2026

Những gì băng ghế dự bị thực sự đo

Phần lớn các cuộc thử nghiệm hiện có hỏi liệu một mô hình có thể đưa ra câu trả lời chính xác từ kiến thức nó đã được nén lại, hay nó có thể hoàn thành một công việc trong khi một người vẫn còn giữ phương pháp này. siêu trí tuệ-Bench cố gắng để ghi điểm hai điều khác cùng một lúc: khám phá sáng tạo, và tự động thực hiện khoa học. Cùng một dự án nghiên cứu, nó rút lại sự hướng dẫn về phương pháp theo từng giai đoạn, để xem hệ thống này tiến triển đến đâu.

Công việc được kiểm tra chuyên gia, kiểm toán, tử hình và ghi điểm. Đó là quan tâm hơn một bức ảnh chụp trên bảng lãnh đạo. Nó vẫn là một dấu chấm. Một con số không phải là siêu thông minh. Tờ báo không nói rằng một người đã đến.

Họ đặt tên nó là gì?

Các tác giả mời các nhà nghiên cứu và xây dựng thêm công việc, thách thức hệ thống ngày nay, và giúp đẩy nhanh con đường tập thể của nhân loại hướng tới siêu trí tuệ nhân tạo. Điểm số của tác giả cho thấy hệ thống không có ở đó, trong khi lời mời bảo các nhà nghiên cứu giúp đẩy nhanh con đường dẫn đến siêu thông minh.

Đọc dân chúng là chúng ta có thời gian

Sự sụp đổ từ 51 đến 27 có vẻ như khoảng cách. Khoảng cách là có thật. Đó cũng là sự an ủi sai lầm. Cũng vào tháng 8, OpenAI nói không thể loại trừ Khả năng mạng quan trọng ở Astra: tìm kiếm và sử dụng lỗ hổng trong hệ thống cứng nhắc, đưa ra mục tiêu, không có một người trên mỗi bước chân. Một tác nhân nghiên cứu vẫn cần một phương pháp và một tác nhân mạng không thể tồn tại trong cùng một ngành công nghiệp cùng lúc. Một số không hủy bỏ số còn lại.

Có một sai lầm thứ hai, yên tĩnh hơn là "chúng ta có thời gian." Nó coi những lỗ hổng còn lại như một danh sách để làm. Một khi một cánh đồng đặt tên cho một băng ghế dài sau khi siêu thông tin, công việc còn lại có bảng điểm. Phòng thí nghiệm đã tối ưu cho bảng điểm. Cái khung của tờ báo, "vào lúc bình minh," là ngôn ngữ của đường băng, không phải của một điểm dừng.

Rút lại phương pháp trên cùng một dự án là thử nghiệm thực tế. Một mô hình có thể trông mạnh mẽ khi một người đã chọn thí nghiệm, đặt tên công cụ và viết ra điều kiện thành công. Đó là hầu hết các bản thử nghiệm của đặc vụ ngày nay. siêu trí tuệ-Berch hỏi những gì còn lại khi những món quà được lấy đi: có thể hệ thống quyết định những gì phải thử, chạy công việc, và đưa lại một cái gì đó một số điểm có thể kiểm tra. Giảm từ 50.91 xuống 26.62 là kích thước của món quà.

Điều này không đòi hỏi bạn phải tin vào phép ẩn dụ buổi bình minh của các tác giả. Nó đòi hỏi bạn phải chú ý rằng một cộng đồng nghiên cứu vừa đứng lên một dấu vết công cộng cho bước cuối cùng của con người trong công trình khoa học, và yêu cầu thế giới giúp lấp đầy nó.

Không được xây dựng cái ghế dự bị

Tổ chức Nakada không đọc được điểm siêu trí tuệ-Bnch thấp khi được phép tiếp tục. Không bao giờ nên xây dựng sự siêu thông minh nhân tạo. Con người không thể kiểm soát sự siêu thông minh. Một thử nghiệm rút lại phương pháp cuối cùng của con người là thử nghiệm vai trò cuối cùng của con người. Các đặc vụ hiện đang thất bại trong bài kiểm tra đó không phải là trường hợp an toàn để xây dựng các đặc vụ vượt qua.

Nếu bạn làm việc trong lĩnh vực khoa học, hãy hỏi ai quyết định việc tăng tốc con đường này là tốt cho cộng đồng. Nếu bạn làm việc cho chính phủ, hãy coi tờ báo như bản đồ những gì các phòng thí nghiệm sẽ cố đóng cửa. Câu trả lời phù hợp với rủi ro là một điều luật nói rằng điểm đến đã đóng.