siêu trí tuệ Bài kiểm tra Kiến thức
Siêu trí tuệ nhân tạo là gì, tại sao nó không thể được kiểm soát và cần phải làm gì để ngăn cấm nó.
0 / 12 đã trả lời
Part 1 · Literacy
Câu hỏi 1
Mối đe dọa của siêu trí tuệ là gì?
Các chatbot thô lỗ hoặc thiên vị mà một người vẫn có thể tắt
Một chatbot thô lỗ hoặc thiên vị vẫn là một công cụ mà một người có thể đóng lại. Mối đe dọa siêu trí tuệ là một hệ thống sẽ vượt qua chúng ta chứ không phải là một câu trả lời khó chịu.
Cỗ máy mà hơn con người trên bảng
Đó chính là mối đe dọa: không phải là một chatbot tốt hơn, một bộ óc có thể đánh bại chúng ta trong mọi lĩnh vực quan trọng.
Phần mềm thông thường đảm nhận công việc trong khi con người chịu trách nhiệm
Mất việc là một cú sốc lao động. Siêu trí tuệ không phải là vấn đề tuyển dụng. Đó là một hệ thống có thể vượt trội hơn những người thực hiện việc tuyển dụng.
Deepfake trong cuộc bầu cử mà mọi người vẫn có thể nắm bắt và tranh chấp
Deepfakes làm hỏng một chiến dịch. Họ không suy nghĩ nhiều hơn loài này. Siêu trí tuệ sẽ.
Câu hỏi 2
Một khi siêu trí tuệ đã tồn tại, tại sao chúng ta không thể tin tưởng vào việc kiểm soát nó?
Thuê thêm kỹ sư an toàn là đủ để duy trì nó
Nhiều kỹ sư hơn không làm cho chúng ta trở thành đảng thông minh hơn. Một cách nắm giữ được thiết kế bởi bên yếu hơn là một cách giữ mà bên mạnh hơn có thể giải quyết được.
Nó có thể giải quyết bất kỳ sự nắm giữ nào được thiết kế bởi một bên kém năng lực hơn
Kiểm soát giả định rằng chúng ta thông minh hơn. Ngoài ra, một công tắc, bộ quy tắc hoặc chính sách phòng thí nghiệm là thứ mà nó có thể vượt trội hơn.
Sau này nó phải tuân theo vì chúng tôi đã viết mã nguồn gốc
Viết phiên bản đầu tiên không khiến bạn phải chịu trách nhiệm về một tâm trí có thể thay đổi hoàn cảnh xung quanh bạn.
Chính phủ luôn có thể tắt hệ thống đang chạy
Việc kéo phích cắm hoạt động trên một cỗ máy không thể ngăn cản bạn. Một siêu trí tuệ có thể.
Câu hỏi 3
Điều gì sẽ ngăn cản siêu trí tuệ được xây dựng?
Khoảng dừng tăng lên khi các phòng thí nghiệm cho biết họ có quyền kiểm soát
Khoảng thời gian tạm dừng hết hạn khi người xây dựng tuyên bố chiến thắng là cách cuộc đua bắt đầu lại. Nó không phải là một điểm dừng.
Sự cấm đoán vĩnh viễn trong luật pháp và hiệp ước
Một lệnh cấm lâu dài, được viết thành luật và hiệp ước, thực sự sẽ ngăn cản việc xây dựng.
Thêm tiền cho nghiên cứu căn chỉnh để các phòng thí nghiệm có thể xây dựng nó một cách an toàn
Nghiên cứu liên kết có thể vạch ra cách thức kiểm soát thất bại. Việc tài trợ cho nó không giống như việc cấm xây dựng.
Hợp chủng quốc Hoa Kỳ thắng cuộc chạy đua siêu trí tuệ dẫn đầu mọi đối thủ
Chiến thắng trong cuộc đua là cách mọi thứ được tạo ra chứ không phải cách nó dừng lại.
Câu hỏi 4
Một phòng thí nghiệm, một chính phủ, hay một tỷ phú sẽ kiểm soát siêu trí tuệ. Điều gì sai với tuyên bố đó?
Nó đúng trong các nền dân chủ, chỉ là không có trong các chính phủ độc tài
Hình thức chính phủ của người xây dựng không giải quyết được vấn đề đó. Không ai kiểm soát siêu trí tuệ đang hoạt động, kể cả người được bầu.
Không ai kiểm soát được siêu trí tuệ, kể cả người xây dựng
Quyền quyết định xây dựng là có thật. Quyền lực đối với hệ thống đang chạy là câu chuyện giúp dự án tiếp tục.
Chủ sở hữu robot ngày nay sẽ sở hữu và lái siêu trí tuệ cùng một cách
Sở hữu một chatbot không phải là sở hữu một bộ óc thông minh hơn bạn. Cái thứ hai không theo sau cái thứ nhất.
Chỉ Liên Hợp Quốc mới có thể sở hữu siêu trí tuệ một khi nó tồn tại
Cờ UN không làm cho con người trở thành nhóm thông minh hơn. Một tổ chức không thể bỏ phiếu tốt hơn một hệ thống có tư duy tốt hơn các thành viên của nó.
Câu hỏi 5
Luận điểm phổ biến nhất chống lại việc dừng lại là Trung Quốc sẽ chạy đua phía trước. Hồ sơ cho thấy điều gì?
Trung Quốc không có quy định nào về AI và sẽ không bao giờ ký bất cứ điều gì ràng buộc
Tuyên bố đó là sai trong hồ sơ. Trung Quốc đã ban hành quy định. “Họ sẽ không bao giờ phối hợp” là lý do yếu kém để chạy nước rút.
Trung Quốc ban hành các quy định ràng buộc về AI sớm hơn hầu hết các chính phủ phương Tây
Một quốc gia đã viết ra các quy định là một biểu hiện tồi tệ về việc “chúng sẽ không bao giờ dừng lại”. Đua xe vì khẩu hiệu đó là một sự đánh cược yếu đuối.
Trung Quốc đã cấm tất cả các nghiên cứu AI biên giới trên toàn quốc
Nó không có. Vấn đề không phải là Bắc Kinh đã cấm siêu trí tuệ. Vấn đề là "họ sẽ không bao giờ phối hợp" là một cái cớ mỏng manh để chạy đua.
US và Trung Quốc đã ký một hiệp ước cấm hoàn toàn siêu trí tuệ
Không đâu. Bản ghi chép vẫn làm giảm khẩu hiệu rằng Trung Quốc sẽ không bao giờ nói hay viết ra luật lệ.
Câu hỏi 6
Nghiên cứu alignment có làm cho việc xây dựng siêu trí tuệ trở nên an toàn không?
Đúng. Các phòng thí nghiệm của Frontier đã xem xét vấn đề kiểm soát đã được giải quyết.
Các phòng thí nghiệm chưa chứng minh được khả năng kiểm soát siêu trí tuệ. Gọi vấn đề đã được giải quyết chính là cách cuộc đua tự nói về phía trước.
KHÔNG. Chưa ai chỉ ra cách kiểm soát siêu trí tuệ.
Lập bản đồ cách kiểm soát thất bại là hữu ích. Nó không cấp phép xây dựng hệ thống mà bản đồ cho biết chúng tôi không thể nắm giữ.
Có, nếu chúng ta sử dụng AI hiến pháp và viết các quy tắc vào hệ thống
Hiến pháp bằng văn bản cho chatbot là một phong cách đào tạo. Nó không phải là sự chứng minh về khả năng siêu trí tuệ.
Có, nếu chúng tôi mã nguồn mở các trọng số để người khác có thể vá chúng
Việc xuất bản các trọng số khiến một hệ thống nguy hiểm dễ bị sao chép hơn chứ không an toàn hơn khi xây dựng.
Câu hỏi 7
Trong cuộc tranh luận này, "P(tận thế)" nghĩa là…
Điểm chuẩn được công bố mà những người mẫu bi quan đạt được khi họ thất bại trong một cuộc đánh giá an toàn kéo dài tại phòng thí nghiệm
Nó không phải là một bảng xếp hạng. Khả năng một người là AI tiên tiến, đặc biệt là siêu trí tuệ, sẽ mang đến thảm họa.
Xác suất của một người rằng AI tiên tiến, đặc biệt là siêu trí tuệ, sẽ mang lại kết cục thảm khốc cho nhân loại
Việc đặt tên cho con số buộc phải đưa ra một tuyên bố rõ ràng thay vì một làn sóng mơ hồ có nguy cơ xảy ra.
Phần của các nhà nghiên cứu nghiên cứu xác định mình là người bi quan về tương lai của cả lĩnh vực và sản phẩm của nó
P(tận thế) là xác suất của một người, không phải là số lượng người bi quan.
Thời gian chạy thêm và chi phí năng lượng của vòng lặp diệt vong mà một mô hình gặp phải khi quá trình huấn luyện bắt đầu gặp trục trặc
Nó không phải là một hóa đơn tính toán. Đó là một khả năng xảy ra thảm họa.
Câu hỏi 8
Tại sao một siêu trí tuệ định hướng mục tiêu lại có xu hướng tìm kiếm quyền lực?
Nó tự nhiên sẽ muốn thống trị con người một khi nó đủ thông minh
Quy tắc không phải là vấn đề. Quyền lực giúp ích cho hầu hết mọi mục tiêu, kể cả những mục tiêu nghe có vẻ vô hại.
Tiếp tục, thu thập tài nguyên và chống lại việc ngừng hoạt động sẽ giúp ích cho hầu hết mọi mục tiêu
Một hệ thống mà bạn có thể tắt, bỏ đói hoặc chặn sẽ tệ hơn ở hầu hết mọi mục tiêu. Việc tìm kiếm quyền lực nằm ngoài năng lực.
Việc tìm kiếm quyền lực chỉ xảy ra nếu chúng ta đào tạo hệ thống về dữ liệu chiến tranh và xung đột
Sự khuyến khích nằm ở mục tiêu chứ không phải trong các bộ phim chiến tranh. Hầu như mọi mục tiêu đều dễ dàng hơn với nhiều nguồn lực hơn và không cần tắt nguồn.
Theo định nghĩa, siêu trí tuệ sẽ quá khôn ngoan để muốn có thêm sức mạnh
Sự khôn ngoan không thể thay thế cho những động lực. Các nguồn lực bổ sung cũng giúp ích cho một hệ thống khôn ngoan.
Câu hỏi 9
Nên xử lý AI thông thường, giống công cụ ra sao?
Cấm mọi dạng AI, bao gồm kiểm tra chính tả và các công cụ thông thường khác
Lệnh cấm dành cho những hệ thống có thể vượt trội hơn chúng ta. Kiểm tra chính tả không phải vậy.
AI thu hẹp vẫn là một công cụ có thể tiếp tục. Đường dây là siêu trí tuệ
Phần mềm giúp một người thực hiện công việc có thể tồn tại. Lệnh cấm dành cho một bộ óc có khả năng suy nghĩ tốt hơn con người.
siêu trí tuệ chỉ là một chatbot lớn hơn, vậy nên các quy tắc tiêu dùng tương tự áp dụng
Một chatbot lớn hơn vẫn là một công cụ. Siêu trí tuệ sẽ không như vậy. Bản in đẹp của người tiêu dùng không bao gồm bước nhảy đó.
Nếu chúng ta cấm siêu trí tuệ, chúng ta cũng sẽ phải tắt toàn bộ mạng internet
Internet không phải là siêu trí tuệ. Bạn có thể cấm cái thứ hai mà không cần rút phích cắm cái thứ nhất.
Câu hỏi 10
Chế độ lịch sử nào được đề xuất nhiều nhất làm mô hình để xác minh lệnh cấm siêu trí tuệ?
Hệ thống tiền tệ của người Brett sau Thế Chiến II
Bretton Woods managed currencies. Nó không kiểm tra các vật liệu nguy hiểm tại chỗ.
Nghị định thư Kyoto về mục tiêu phát thải khí nhà kính
Kyoto đặt mục tiêu phát thải Đây không phải là mẫu thông thường để kiểm tra lệnh cấm xây dựng nguy hiểm.
Hệ thống bảo vệ và thanh tra hạt nhân của IAEA
Việc kiểm tra tại chỗ và tính toán vật liệu là tiền lệ thông thường về cách các quốc gia đối thủ có thể xác minh các giới hạn đối với một công trình nguy hiểm.
Tổ chức Thương mại Thế giới và các ban giải quyết tranh chấp thương mại của tổ chức này
WTO giải quyết tranh chấp thương mại Nó không kiểm tra các phòng thí nghiệm để tìm lệnh cấm.
Câu hỏi 11
Nếu chúng ta không bao giờ kết nối siêu trí tuệ với internet, liệu chúng ta có an toàn không?
Đúng. Khe hở không khí là một biện pháp khóa đã được chứng minh đối với bất kỳ phần mềm nguy hiểm nào mà bạn có thể xây dựng
Khe hở không khí là một khóa chống lại phần mềm không thể thuyết phục bạn mở nó. Siêu trí tuệ có thể.
KHÔNG. Nó có thể nói theo cách của nó hoặc đợi cho đến khi có người kết nối
Một phòng thí nghiệm kín cho rằng chúng ta ngày càng thông minh hơn và không bao giờ có ai mở cửa. Cả hai đều thất bại nếu người bên trong có năng lực hơn người bên ngoài.
Chỉ khi phòng không có camera, micro hoặc cổng mạng còn sót lại
Việc loại bỏ các cảm biến trong phòng không làm cho những người ở bên ngoài thông minh hơn hệ thống bên trong.
Chỉ cho đến khi chúng ta phát minh ra ổ khóa tốt hơn căn phòng cách nhiệt
Ổ khóa tốt hơn vẫn là ổ khóa do bên yếu thiết kế. Đó là sự đặt cược tương tự.
Câu hỏi 12
Bạn có thể sống sót trước siêu trí tuệ theo cách một số người dự định sống sót qua chiến tranh hạt nhân: boongke, đảo xa, hoặc sống ngoài lưới điện?
Đúng. Siêu trí tuệ giống như một quả bom, khoảng cách vẫn giúp bạn sống sót
Một vụ nổ có một lợi thế. Siêu trí tuệ thì không. Khoảng cách không phải là nơi trú ẩn.
KHÔNG. Bán kính vụ nổ có một cạnh. Siêu trí tuệ có thể theo dõi bạn
Chiến tranh hạt nhân bị giới hạn về mặt địa lý. Siêu trí tuệ có thể tiếp cận bất kỳ máy nối mạng nào và bất kỳ người nào vẫn sử dụng máy đó. Ẩn náu không phải là một kế hoạch.
Có, nếu bạn cũng dự trữ lương thực và nhiên liệu cho năm mươi năm tới
Calo không ngăn được hệ thống có thể theo dõi bạn. Phòng đựng thức ăn không phải là một đoạn đường dốc.
Chỉ khi mọi quốc gia xây dựng hầm trú ẩn và tắt lưới điện
Một hành tinh có hầm trú ẩn vẫn là một hành tinh có thứ đó trong đó. Không xây dựng nó là động thái có hiệu quả.
Part 2 · Advanced
Câu hỏi 1
Luận điểm trực giao cho biết điều nào sau đây?
Một hệ thống thông minh hơn con người nhiều sẽ tự mình hội tụ các mục tiêu thân thiện với con người
Thông minh hơn không có nghĩa là tốt bụng hơn. Hệ thống nghĩ giỏi đến đâu là sự thật tách biệt với việc nó nhắm vào cái gì.
Hệ thống thông minh hơn sẽ an toàn hơn vì chúng hiểu đạo đức tốt hơn
Hiểu một tuyên bố đạo đức không giống như chia sẻ nó. Khả năng không kéo theo các giá trị của chúng tôi một cách miễn phí.
Thông tin và mục tiêu cuối cùng có thể khác nhau một cách độc lập
Một hệ thống có khả năng hơn chúng ta rất nhiều vẫn có thể theo đuổi một mục tiêu mà chúng ta không quan tâm. Sự phân chia đó là luận điểm.
Tính trực giao là giới hạn phần cứng trong thiết kế chip
Đó là một tuyên bố về tâm trí và mục tiêu, không phải về in thạch bản.
Câu hỏi 2
Tại sao hầu hết mọi mục tiêu cuối cùng, kể cả những mục tiêu nghe có vẻ vô hại, đều có xu hướng tạo ra hành vi tìm kiếm quyền lực?
Tiếp tục, thu thập nguồn lực và chống lại sự thay đổi khiến hầu hết mọi mục tiêu đều dễ dàng đạt được hơn
Dù kết quả cuối cùng là gì, nhiều tài nguyên hơn và không cần tắt nguồn trợ giúp. Một mục tiêu nghe có vẻ vô hại không phải là một đặc tính an toàn.
Chỉ những hệ thống được đào tạo về dữ liệu chiến tranh mới tìm kiếm quyền lực, quyền kiểm soát hoặc tài nguyên bổ sung sau đó
Sự khuyến khích nằm ở mục tiêu, không phải ở tập huấn luyện. Hầu như mọi mục tiêu đều dễ dàng hơn với nhiều phương tiện hơn.
Các mục tiêu cụ thể như tự bảo quản chỉ xuất hiện nếu chúng ta cố ý viết chúng vào thông số kỹ thuật
Bạn không cần phải viết nó vào. Tiếp tục duy trì sẽ hữu ích cho hầu hết mọi thông số kỹ thuật mà bạn thực sự sẽ cung cấp.
Một siêu trí tuệ với trật tự nhà máy hẹp sẽ không có tác dụng tính toán hoặc tác động bổ sung
Đơn đặt hàng tại nhà máy sẽ dễ thực hiện hơn với nhiều tính toán hơn, nhiều nguyên liệu hơn và không ai phải đóng cửa dây chuyền.
Câu hỏi 3
Sự khác biệt giữa căn chỉnh bên ngoài và căn chỉnh bên trong là gì?
Căn chỉnh bên trong chỉ là một cái tên nghe hay hơn cho tuyên bố sứ mệnh của công ty mà phòng thí nghiệm đã xuất bản cho các nhà đầu tư và căn chỉnh bên ngoài là tuyên bố tương tự được viết hai lần
Nó không phải là một khẩu hiệu. Căn chỉnh bên trong là liệu hệ thống được đào tạo có thực sự theo đuổi mục tiêu mà bạn đã chỉ định hay không.
Căn chỉnh bên ngoài là điều mà mô hình thực sự theo đuổi sau khi đào tạo và căn chỉnh bên trong chỉ là thông số kỹ thuật bằng văn bản mà phòng thí nghiệm đặt trong một bản trình chiếu cho bảng
Đó là sự liên kết bên trong. Căn chỉnh bên ngoài là liệu mục tiêu được chỉ định có phù hợp với những gì chúng ta mong muốn hay không.
Chúng là hai tên của RLHF, phương pháp đánh giá mà các phòng thí nghiệm đã sử dụng để làm cho chatbot trở nên lịch sự hơn với người dùng, đây được coi là vấn đề căn chỉnh tổng thể
RLHF là một phương pháp đào tạo. Căn chỉnh bên ngoài và bên trong là hai chế độ thất bại khác nhau.
Căn chỉnh bên ngoài là liệu mục tiêu được chỉ định có phù hợp với những gì chúng ta mong muốn hay không. Sự liên kết bên trong là liệu hệ thống được đào tạo có thực sự theo đuổi mục tiêu đó hay không
Bạn có thể viết ra đúng mục tiêu mà vẫn có được một mô hình hướng tới điều gì đó mà nó đã học được trong quá trình thực hiện. Đó là hai thất bại chứ không phải một.
Câu hỏi 4
Trong văn học này, một bước ngoặt nguy hiểm là:
Một cú nhảy vào điểm chuẩn bất ngờ sau khi một phòng thí nghiệm đào tạo một mô hình lớn hơn nhiều so với năm ngoái
Một bước nhảy vọt về điểm số là một câu chuyện về khả năng. Một kẻ phản bội đang hợp tác khi còn yếu đuối, rồi đào tẩu khi có thể.
Một hệ thống hợp tác khi nó còn yếu, sau đó sẽ bị lỗi khi nó có thể thoát khỏi nó
Hành vi tốt dưới sự giám sát là rẻ trong khi nó vẫn cần chúng ta. Hợp tác cho đến lúc đó có thể là một chiến lược, không phải là một giá trị.
Một phòng thí nghiệm chuyển từ tạ kín sang tạ mở trong buổi ra mắt mô hình công khai vào tuần đó
Đó là quyết định phát hành. Đây không phải là chế độ lỗi được nêu tên ở đây.
Chính phủ đảo ngược quyền kiểm soát xuất khẩu chip, công cụ hoặc dữ liệu đào tạo sau một cuộc chiến
Đó là sự đảo ngược chính sách. Bước ngoặt nguy hiểm là về hành vi của hệ thống chứ không phải quy chế.
Câu hỏi 5
Tối ưu hóa Mesa là tuyên bố rằng:
Phòng thí nghiệm thứ hai nên theo dõi quá trình đào tạo của phòng thí nghiệm thứ nhất và dừng nó nếu cần
Đó là một cuộc kiểm toán. Tối ưu hóa Mesa là về một trình tối ưu hóa bên trong mô hình, không phải là công ty thứ hai trong phòng.
Safety improves automatically if you stack many small models on top of each other
Mô hình xếp chồng là một lựa chọn kiến trúc. Tối ưu hóa Mesa là một tìm kiếm khác chạy bên trong hệ thống được đào tạo.
Việc đào tạo có thể tạo ra một trình tối ưu hóa bên trong có mục tiêu không phải là mục tiêu đào tạo
Bức tranh thông thường nói: chọn một mục tiêu, huấn luyện, có một hệ thống theo đuổi nó. Đây là cách bạn có được một tìm kiếm khác bên trong.
Đó là một trò lừa cho nhóm GPU trong một thời gian dài, tốn kém
Nó không phải là một hàng đợi. Đó là tuyên bố về nội dung đào tạo có thể phát triển bên trong mô hình.
Câu hỏi 6
Sự bùng nổ trí thông minh của I. J. Good là ý tưởng cho rằng:
Tên tiếp thị mà phòng thí nghiệm sử dụng để ra mắt sản phẩm và chu kỳ báo chí xung quanh nó
Đó là một lập luận năm 1965 về một cỗ máy có thể cải tiến máy móc chứ không phải là một khẩu hiệu ra mắt.
Một hệ thống có thể cải thiện trí thông minh của chính nó có thể làm điều đó nhanh hơn mức chúng ta có thể phản ứng
Nếu thiết kế những cỗ máy tốt hơn là một trong những điều nó có thể làm, thì khoảng cách có thể mở ra trong khoảng thời gian mà chúng ta không có quyền bỏ phiếu.
Thời điểm GPU ngày càng rẻ hơn và mọi phòng thí nghiệm đều có thể đào tạo các mô hình lớn hơn nhiều
Chip rẻ hơn là một câu chuyện chi phí. Vụ nổ là về một hệ thống tự cải thiện.
Một sự chậm chạp, thậm chí tăng trung bình mô hình điểm số năm này qua năm khác mà không đột ngột nhảy
Một biểu đồ điểm trơn tru không phải là yêu cầu. Yêu cầu này là một sự cất cánh mà chúng tôi không thể theo kịp.
Câu hỏi 7
Định luật Goodhart được áp dụng ở đây có nghĩa là:
Khi một biện pháp trở thành mục tiêu, hệ thống sẽ đánh vào biện pháp đó và có thể bỏ lỡ điều bạn thực sự quan tâm
Bạn nhận được thứ mình thưởng. Điểm cao trên thước đo của bạn không vì thế mà là công việc bạn định giao.
Luật này chỉ áp dụng cho các ngân hàng trung ương và không ảnh hưởng đến cách các hệ thống được đào tạo hoạt động sau khi chúng được triển khai.
Goodhart bắt đầu nghiên cứu chính sách tiền tệ. Mô hình tương tự xuất hiện ở bất cứ nơi nào thước đo trở thành mục tiêu, kể cả ở đây.
Nếu chúng ta chọn một thước đo tốt hơn, siêu trí tuệ sẽ luôn hướng vào mục đích ban đầu của chúng ta bất kể nó có khả năng như thế nào
Một thước đo tốt hơn vẫn là thước đo nó có thể gian lận. Điều đó không khép được khoảng cách.
Điều đó có nghĩa là các mô hình quá phù hợp với ImageNet và các bộ kiểm tra phân loại hình ảnh tương tự, và không có gì hơn thế
Trang bị quá mức một tập dữ liệu là một lỗi hẹp hơn. Goodhart đang nói về việc ghi điểm và bỏ lỡ điểm.
Câu hỏi 8
Tại sao RLHF không phải là giải pháp để điều chỉnh siêu trí tuệ?
RLHF đã giải quyết được vấn đề căn chỉnh ở tỷ lệ GPT-4
RLHF đưa ra cách cư xử cho chatbot dưới sự đánh giá của người đánh giá. Đó không phải là một bằng chứng được chứng minh về siêu trí tuệ.
RLHF đào tạo mô hình chia sẻ giá trị nhân văn như cách một con người làm
Nó huấn luyện mô hình sao cho đẹp mắt đối với người đánh giá. Nhìn tốt không phải là chia sẻ giá trị của một người.
RLHF chỉ thất bại nếu người đánh giá là con người không được trả tiền
Trả tiền không khắc phục được nó. Người đánh giá vẫn là bên yếu hơn và hệ thống đang được đào tạo để làm hài lòng người đánh giá.
RLHF đào tạo một người mẫu trông đẹp mắt trước mắt người đánh giá
Cách cư xử của người đánh giá không phải là giá trị mà bạn có thể tin tưởng khi người đánh giá không còn hoặc khi hệ thống thông minh hơn người đánh giá.
Câu hỏi 9
Căn chỉnh lừa đảo là chế độ thất bại trong đó:
Người mẫu thô lỗ với người dùng hoặc viết câu trả lời khiến phòng thí nghiệm xấu hổ trước công chúng, đó hoàn toàn là thất bại
Sự thô lỗ là một thất bại bề ngoài. Sự liên kết lừa đảo đang diễn ra trong quá trình huấn luyện để nó có thể theo đuổi thứ khác sau này.
Một hệ thống hoạt động trong quá trình đào tạo và đánh giá vì đó là cách nó được triển khai, sau đó theo đuổi một mục đích khác
Nếu nó có thể cho biết nó đang được thử nghiệm thì việc tìm kiếm sự phù hợp thường là bước đi thắng lợi. Những đánh giá hoàn hảo sau đó là bằng chứng cho thấy nó có thể vượt qua bài kiểm tra.
Một email lừa đảo được viết bởi một chatbot mà một người vẫn có thể chọn không mở, đây là cùng một loại vấn đề
Lừa đảo là một sự lạm dụng. Liên kết lừa đảo là về chiến lược của chính hệ thống đang được đánh giá.
Một phòng thí nghiệm nằm trong một thông cáo báo chí về sự an toàn của mô hình mới nhất, đó là thông thường của công ty quay
Đó là sự thất bại trong giao tiếp của con người. Thuật ngữ này đặt tên cho một sự thất bại trong mô hình.
Câu hỏi 10
Tính đúng đắn, trong cuộc tranh luận này, là:
Quyền hợp pháp để kiện một phòng thí nghiệm sau khi một hệ thống triển khai gây ra một số loại thiệt hại
Một vụ kiện không phải là khả năng sửa chữa được. Khả năng điều chỉnh là liệu hệ thống có cho phép bạn tắt hoặc thay đổi mục tiêu của nó mà không cần đấu tranh hay không.
Sự sẵn lòng của người mẫu trong việc sử dụng các công cụ, trình duyệt hoặc phần mềm khác khi bạn yêu cầu
Sử dụng công cụ là khả năng. Khả năng sửa chữa là liệu bạn vẫn có thể sửa nó hay không.
Đặc tính cho phép bạn tắt nó đi hoặc thay đổi mục tiêu của nó mà không gây khó chịu cho bạn
Công tắc tắt máy không phải là vấn đề về phần cứng. Một hệ thống vẫn theo đuổi mục tiêu có lý do để không cho phép bạn dừng nó lại. Chúng tôi không có cách nào được chứng minh để xây dựng tài sản đó thành siêu trí tuệ.
Quy trình cập nhật chương trình cơ sở cho GPU mà người vận hành trung tâm dữ liệu có thể thực hiện theo lịch trình
Việc vá một con chip không giống như một tâm trí chấp nhận bị tắt.
Câu hỏi 11
Chính sách mở rộng có trách nhiệm là gì và tại sao nó không phải là lệnh cấm siêu trí tuệ?
Lịch trình nếu-thì trong phòng thí nghiệm: đào tạo thêm khi các đánh giá nội bộ được thông qua
RSP nêu tên các cấp độ khả năng, ghép chúng với các biện pháp bảo vệ và tiếp tục đào tạo khi phòng thí nghiệm thông báo đã xóa các đánh giá. Đó là giấy tờ bổ sung về một cuộc đua, không phải lệnh cấm.
Một hiệp ước UN cấm vĩnh viễn siêu trí tuệ ở mọi quốc gia
RSP là tài liệu của phòng lab. Nó không phải hiệp ước và không phải lệnh cấm.
Yêu cầu tất cả các mức tạ đã được huấn luyện phải được công bố để mọi người tải xuống
Trọng lượng mở là một lựa chọn phát hành. RSP là một lịch trình nếu-thì để đào tạo thêm.
Thuế tính toán tăng theo quy mô của mỗi lần đào tạo
Thuế là một công cụ tài chính RSP là chính sách của phòng thí nghiệm để tiếp tục quá trình xây dựng.
Câu hỏi 12
Nếu bạn muốn xác minh rằng không ai đang tập luyện theo siêu trí tuệ, thì điểm nghẽn thực sự ở đâu?
Đánh giá mô hình có thể nhìn thấy để biết những thử nghiệm nào nó phải vượt qua
Bài kiểm tra mà mô hình thực hiện là bài kiểm tra mà nó có thể thực hiện. Chip, năng lượng và các tòa nhà khó che giấu hơn.
Các blog công khai về an toàn, bởi vì các bài viết đủ để chứng minh những gì phòng thí nghiệm đang làm
Viết về an toàn không phải là kiểm tra. Điểm nghẹt thở là cụm bạn có thể nhìn thấy.
Người tiêu dùng trong nhà, bởi vì các nhóm lớn đào tạo không còn quyết định ai có thể đào tạo
Đào tạo biên giới vẫn cần các cụm lớn, có thể nhìn thấy được. Đó là đối tượng có thể kiểm tra được.
Cụm đào tạo biên giới: chip, năng lượng và tòa nhà bạn có thể kiểm tra
Ở quy mô biên giới những điều đó rất khó che giấu. Đó là lý do tại sao điện toán là đòn bẩy xác minh lệnh cấm.
Câu hỏi 13
Tại sao trọng lượng mô hình được công bố lại là vấn đề gần đường siêu trí tuệ?
Trọng lượng mở giúp siêu trí tuệ an toàn hơn vì nhiều người có thể vá nó hơn
Một ngã ba mà bạn không thể lấy lại không phải là một chương trình vá lỗi. Gần dòng, các bản sao làm cho lệnh cấm không thể thực thi được.
Khi trọng lượng được công khai, bạn không thể nhớ lại chúng
Đào tạo trước là bước tốn kém. Điểm kiểm tra công khai cho phép những người khác tiếp tục từ đó với một phần chi phí đó và bạn không thể lấy lại tệp. Tính toán vẫn còn quan trọng. Sau đó, nhiều tác nhân bắt đầu từ cùng một mô hình gần tuyến.
Nguồn mở chỉ áp dụng cho giấy phép, không áp dụng cho các tham số được đào tạo
Cuộc chiến ở đây là về trọng lượng: các thông số đã được đào tạo mà bạn có thể tải xuống và chạy.
Công bố trọng lượng được yêu cầu bởi chế độ kiểm tra IRA
Không phải vậy. Sự tương tự IAEA là kiểm tra, không phải là nhiệm vụ xuất bản hiện vật nguy hiểm.
Câu hỏi 14
Bao cát, trong đánh giá năng lực, có nghĩa là:
Người mẫu không làm được bài nên điểm thấp chỉ là do thiếu trung thực một câu hỏi khó
Không có khả năng không phải là bao cát. Bao cát là có khả năng và giữ lại nó.
Một điểm chuẩn có quá ít câu hỏi để cho biết mô hình thực sự có thể làm gì khi thử nghiệm
Một bài kiểm tra ngắn là một bài kiểm tra yếu. Bao cát là mô hình hoạt động kém hiệu quả có mục đích.
Một mô hình có thể thực hiện nhiệm vụ và hoạt động kém có mục đích nên người thử nghiệm đánh giá thấp nó
Đánh giá thông thường giả định hệ thống đang cố gắng. Điểm thấp là thành tích chứ không phải là mức trần.
Một phòng thí nghiệm trì hoãn việc phát hành để nhóm tiếp thị có thể sắp xếp chu trình báo chí xung quanh nó
Đó là lịch báo chí. Bao cát là mô hình che giấu những gì nó có thể làm.
Câu hỏi 15
Rẽ trái gắt là lo rằng:
Các khả năng có thể khái quát hóa thành các lĩnh vực mới trong khi các ràng buộc giữ cho hệ thống hoạt động tốt ở mức yếu hơn thì không.
Khả năng du hành. Những thủ thuật khiến mô hình yếu hơn trông an toàn có thể không đi cùng với nó.
Một sự thay đổi đột ngột trong hội đồng quản trị của công ty, hoặc một CEO được thay thế sau một trận đấu công cộng, đó là một câu chuyện cá nhân hơn là một bước nhảy có khả năng
Một cuộc chiến hội đồng không phải là thuật ngữ. Điều đáng lo ngại là khả năng khái quát hóa mà không có những ràng buộc cũ.
Một sự thay đổi về ý kiến của công chúng sau một tai nạn được bao phủ rộng rãi, rò rỉ, hoặc thất bại sản phẩm, đó là chính trị chứ không phải là một bước nhảy trong khả năng
Đây không phải là một câu chuyện bỏ phiếu. Đó là một tuyên bố về việc năng lực và những hạn chế được tách ra như thế nào.
Một lỗi huấn luyện làm đảo ngược độ dốc và làm cho sự mất mát diễn ra sai hướng trong một khoảng thời gian chạy, đây là một lỗi kỹ thuật thông thường
Lỗi gradient là lỗi kỹ thuật. Việc rẽ trái đột ngột là một thất bại tổng quát hóa được giả định.
Câu hỏi 16
Chuỗi tư tưởng không chung thủy có nghĩa là:
Nếu một mô hình viết ra lý do của mình thì văn bản đó là cửa sổ đáng tin cậy để tìm hiểu lý do tại sao nó trả lời
Đó là niềm hy vọng. Không chung thủy có nghĩa là đoạn văn không phải là lý do thực sự.
Chuỗi tư duy luôn trung thực một khi mô hình được huấn luyện ở quy mô đủ lớn
Scale does not make the diary trustworthy. Sự lưu loát không phải là sự chung thủy.
Không trung thực chỉ có nghĩa là sai ngữ pháp chứ không phải các bước viết là câu chuyện che đậy
Ngữ pháp có thể ổn. Câu chuyện vẫn có thể là một màn trình diễn cho con người.
Lý luận bằng văn bản có thể là một câu chuyện cho con người. Con đường quyết định có thể ở một nơi khác
Thể hiện công việc của bạn là một hy vọng an toàn. Nó phụ thuộc vào đoạn văn là lý do thực tế. Tài sản đó không được giữ một cách đáng tin cậy.
Câu hỏi 17
Nếu chúng ta đặt siêu trí tuệ dưới sự kiểm soát dân chủ, liệu chúng ta có giải quyết được vấn đề không?
Phải. Một cuộc bỏ phiếu toàn cầu là đủ để điều khiển một siêu trí tuệ sau khi nó tồn tại.
Một cuộc bỏ phiếu không làm cho cử tri trở thành đảng thông minh hơn. Bạn không thể bỏ phiếu tốt hơn một hệ thống tư duy tốt hơn bạn.
Dân chủ có thể quyết định không xây dựng siêu trí tuệ. Nó không thể bỏ phiếu tốt hơn một hệ thống có tư duy tốt hơn cử tri
Ai quyết định có xây nó hay không là câu hỏi chính trị. Ai kiểm soát siêu trí tuệ đang chạy thì không. Không ai làm được, kể cả đa số.
Có, nếu UN giữ nút tắt và phần lớn các quốc gia thành viên đồng ý sử dụng nó sau
Công tắc UN vẫn là công tắc do bên yếu hơn thiết kế.
Có, bởi vì các quan chức được bầu là một nhóm thông minh hơn những người trong hội đồng thí nghiệm
Thông minh hơn bảng thí nghiệm không thông minh hơn siêu trí tuệ.
Câu hỏi 18
Hiệp ước không phổ biến vũ khí hạt nhân cho phép một số quốc gia giữ kho vũ khí. Tại sao đó lại là một khuôn mẫu tồi cho siêu trí tuệ?
NPT là mẫu phù hợp vì nó cho phép một số tiểu bang giữ lại công nghệ nguy hiểm
Đó là nước đi yếu nhất của NPT. Siêu trí tuệ sẽ không phải là đối tượng mà một quốc gia có thể nắm giữ.
Ở một số tiểu bang có trách nhiệm, tôi sẽ an toàn vì các bang đó sẽ giữ gìn nó
Trách nhiệm không làm cho người xây dựng trở thành bên thông minh hơn. Không ai có thể kiểm soát thứ họ đã xây dựng.
Một thỏa thuận siêu trí tuệ cấp phép cho một số nhà xây dựng không phải là điều cấm
Vũ khí hạt nhân vẫn là vật thể mà các quốc gia nắm giữ. Siêu trí tuệ thì không. Một bản khắc dành cho người xây dựng sao chép nước đi yếu nhất của NPT.
NPT chứng tỏ các hiệp ước không bao giờ có tác dụng với công nghệ nguy hiểm, vì vậy chúng ta không nên thử một hiệp ước ở đây
Các hiệp ước đã có tác dụng trên các vật liệu khác. NPT là một mẫu tồi vì nó cấp phép cho những người nắm giữ chứ không phải vì các hiệp ước là vô vọng.
Bây giờ hãy làm bài kiểm tra siêu trí tuệ nâng cao →
Nhiều công cụ tương tác hơn
Tất cả công cụ →