Phần 1 — Anthropic phản hồi về vụ tranh cãi quanh bài đăng của Coxon
Jacob Coxon rời Anthropic và trên đường ra đi đã lên tiếng cảnh báo về những nguy hiểm của trí tuệ nhân tạo. Người đàn ông hai mươi bảy tuổi này trình bày các mối lo của mình trong một loạt bài đăng trên mạng xã hội khi anh nghỉ việc, trong đó có đoạn:
“Những người đang xây dựng AI thật lòng tin rằng nó có thể giết chết tất cả chúng ta trước khi thập kỷ này kết thúc. Đây không phải là một chiêu tiếp thị. Nếu có gì đó thì ngược lại — nhiều lãnh đạo và nhà nghiên cứu cấp cao còn nói giảm đi khi trả lời báo chí để nghe cho hợp lý. Nhưng riêng tư thì tôi nghe chính những người ấy bày tỏ nỗi sợ. Không một hoạt động nào khác của loài người mang mức độ nguy hiểm như thế.”
Ít nhất một đồng nghiệp cũ của anh đồng tình. Evan Hubinger, nhà nghiên cứu về alignment tại Anthropic, chia sẻ lại bài của Coxon và viết thêm:
“Jacob nói đúng. Chúng tôi thật sự tin rằng AI có thể giết hết loài người. Cá nhân tôi cho là xác suất trên 10% trong vòng một thập kỷ tới. Tôi tin Anthropic đang cố hết sức, nhưng chúng tôi chưa có một kế hoạch để giải bài toán alignment cho siêu trí tuệ, và cũng chưa rõ là đang đi đúng hướng.”
Người phát ngôn của Anthropic nói với CNN:
“Chúng tôi luôn minh bạch rằng AI sẽ mang lại cả lợi ích to lớn lẫn những rủi ro chưa từng có. Để xử lý các rủi ro ấy, chúng tôi tiếp tục xây dựng các mô hình với một số biện pháp bảo vệ mạnh nhất ngành.”
Họ nói thêm rằng Anthropic là phòng thí nghiệm đầu tiên công bố chính sách mở rộng có trách nhiệm — một khuôn khổ công khai nhằm giảm thiểu rủi ro thảm họa từ các mô hình AI — và họ tiếp tục kiểm tra ráo riết các mô hình của mình về những năng lực nguy hiểm trong các lĩnh vực như an ninh mạng và sinh học, rồi công bố kết quả để giới nghiên cứu soi xét.
Về phần mình, Coxon từng làm nghiên cứu ở cả Anthropic lẫn OpenAI. Anh nói không công ty nào trong hai công ty ấy đang hành xử có trách nhiệm.
Phần 2 — Jacob giải thích AI có thể giết hết chúng ta bằng cách nào
Phóng viên: Trước hết, tôi hiểu là anh nói theo nghĩa đen rằng AI có thể giết hết tất cả chúng ta trước cuối thập kỷ này. Chuyện đó xảy ra thế nào? Thực tế nó trông ra sao?
Coxon: Kịch bản cụ thể thì nghe hơi giống khoa học viễn tưởng. Nghe như một thứ không có thật. Nhưng tôi cho rằng nó có thật đến mức đáng sợ. Và dễ hiểu nhất là nghĩ về những việc có thật đã xảy ra cách đây hai tháng.
Hai tháng trước, các tác nhân AI của OpenAI đã đột nhập vào hạ tầng của bên thứ ba hoàn toàn theo ý chí riêng của chúng. Đó là một đợt tấn công tập trung mà chúng tự tiến hành. Tôi nghĩ nếu ngoại suy vào tương lai với mức năng lực cao hơn nhưng vẫn với cái ý chí độc lập ấy, thì chúng có thể gây ra hỗn loạn cực độ — ví dụ tấn công hạ tầng trọng yếu, chế tạo vũ khí sinh học ở mức có thể gây tuyệt chủng. Có rất nhiều cách để AI tự tác động vào thế giới.
Phóng viên: Chính xác thì cảm nhận của anh về công nghệ này thay đổi từ lúc nào? Có phải do tốc độ tiến bộ mà anh chứng kiến không?
Coxon: Vâng. Tôi nghĩ rất quan trọng là nhìn vào tốc độ tiến bộ, chẳng hạn trong các lĩnh vực như lập trình hay toán học. Vài năm trước, những AI này chỉ giúp con người được một chút. Chúng đưa ra gợi ý. Bây giờ chúng gần như thay thế được. Hiện tại vẫn cần con người, nhưng rất có thể trong vòng một năm nữa sẽ không cần con người để làm nghiên cứu trong nhiều lĩnh vực.
Mới hôm thứ Ba, OpenAI đã giải được một bài toán thiên niên kỷ — một trong những bài toán mở lớn nhất của toán học — hoàn toàn tự động bằng AI.
Phần 3 — Nguy cơ AI tự cải thiện chính mình
Và điều đáng sợ nhất, theo tôi, là khi AI được dùng để làm cho chính nó thông minh hơn. Anh có thể lấy một AI và giao cho nó bài toán nghiên cứu AI, đúng như hiện nay người ta đã giao cho nó nghiên cứu toán. Anh có thể bắt nó làm những việc mà chúng ta đang làm. Khi ấy anh có cái gọi là bùng nổ trí tuệ. AI cứ thông minh dần lên, thông minh dần lên, không cần con người tham gia, cho tới lúc anh có một thứ thông minh hơn con người rất xa. Và chuyện này có thể đến rất sớm.
Phóng viên: Chúng tôi có nhắc đến một đồng nghiệp cũ của anh, hiện đang làm ở Anthropic, người về cơ bản tán thành nhận định rằng AI có thể giết hết mọi người trong vòng một thập kỷ. Trong một bài đăng tiếp theo, ông ấy viết:
“Nói cho rõ, như chúng tôi đã nêu trong báo cáo rủi ro mới nhất, tôi cho rằng rủi ro từ các mô hình hiện tại là thấp. Cái tôi lo là siêu trí tuệ nảy sinh từ quá trình tự cải thiện đệ quy, mà như chúng tôi đã nói, quá trình ấy đang diễn ra nhanh hơn chúng tôi tưởng.”
Tôi đoán tự cải thiện đệ quy chính là cái anh vừa nói. Anh có đồng ý với ông ấy rằng rủi ro từ các mô hình hiện tại là thấp, vấn đề chỉ là tốc độ cải thiện không?
Coxon: Đúng vậy. Tôi hoàn toàn đồng ý. Hiện nay không có nguy cơ tuyệt chủng. Điều tệ nhất các mô hình hiện tại làm được là có thể đột nhập vào cái gì đó, gây thiệt hại lớn cho hạ tầng — nhưng chúng chưa đủ thông minh để qua mặt chúng ta ở mức dẫn tới tuyệt chủng.
Cái điên rồ là khi nhìn vào tốc độ tiến bộ. Có một khả năng rất thực là trong tương lai gần — tức là những năm sắp tới, năm sau, năm sau nữa — việc tự cải thiện đệ quy sẽ xảy ra, và chúng ta bước vào giai đoạn mà Evan mô tả trong bài đăng của ông ấy, khi ông lập luận rằng có khả năng tất cả chúng ta đều chết. Chuyện đó đang đến gần.
Phần 4 — Các công ty AI có thật lòng khi kêu gọi bị quản lý không?
Phóng viên: Nhiều CEO của các công ty này ra trước Quốc hội và nói rằng họ rất mong có quy định quản lý. Anthropic trong tuyên bố mới nhất nói rằng thế giới sẽ được lợi nếu ngành này áp dụng một cách thức hợp pháp, kiểm chứng được, để cùng nhau điều tiết nhịp độ phát hành các mô hình mạnh.
Lập luận thường thấy là đây là một cuộc chạy đua vũ trang — nếu một công ty Mỹ không đạt tới AI tốt nhất thì một công ty Trung Quốc hoặc một kẻ xấu nào đó sẽ đạt tới. Anh có tin là các công ty này thật sự muốn bị quản lý không, hay đó chỉ là nói cho có?
Coxon: Họ hoàn toàn muốn thế. Điều đó là thật lòng. Cũng giống như phản ứng trước bài đăng của Evan là sự ngạc nhiên — kiểu như chuyện này không thể có thật, chẳng lẽ một người đang làm công nghệ ấy lại thật sự tin là nó nguy hiểm đến thế. Không, đó là thật lòng hoàn toàn.
Và những người ấy cũng hoàn toàn thật lòng khi họ van xin được quản lý. Họ ở vào cái thế bị buộc phải chạy đua để xây dựng một công nghệ chết người, và họ sẽ rất mong có một tổ chức quốc tế nào đó cho phép họ tiếp cận nó với nhịp độ hợp lý. Chỉ có điều họ không tin những người xung quanh sẽ đi tới đó một cách an toàn. Cho nên họ thấy mình cũng buộc phải chạy đua.
Phóng viên: Anh đã có thể im lặng. Tôi chắc là anh có một công việc tốt, được trả lương rất cao. Anh rõ ràng là người cực kỳ thông minh, một nhà toán học. Vì sao anh quyết định lên tiếng?
Coxon: Ban đầu tôi chỉ định nghỉ việc. Tôi nghĩ mình không thể là một phần của chuyện này nữa. Nhưng rồi tôi nhận ra có lẽ mình có thể làm được gì đó có ích. Tôi không ngờ nó lan nhanh đến thế.
Tôi viết một chuỗi bài trên Twitter. Tôi soạn nó trong một tài liệu Google, viết cùng một người bạn. Có vài người bạn tôi đã bàn với họ về cách diễn đạt tốt nhất, sau khi tôi quyết định nghỉ. Rồi tôi cũng nhờ vài người bạn đăng lại, kiểu để thử xem có lan được không. Nhưng rõ ràng là có một nhu cầu tiềm ẩn khiến chuyện này bùng lên dữ dội. Tôi chưa bao giờ thấy một bài viết về an toàn AI lan mạnh như vậy.
Tôi nghĩ là vì người ta đã thấy các vụ tấn công mạng mấy tháng vừa rồi. Họ cũng bắt đầu thấm được tốc độ tiến bộ. Người ta bắt đầu nhận ra đây là công nghệ có thật. Nó không phải trò thổi phồng. Nó sẽ không biến mất. Nó chỉ càng ngày càng điên rồ hơn. Sáu tháng qua đã điên rồi. Tôi nghĩ chính cái hiểu ngầm về mức độ nghiêm trọng của tình hình đã khiến chuyện này thành một que diêm châm lên ngọn lửa. Tôi thật sự bị sốc vì nó lan nhanh đến mức nào.
Phần bình luận trong trường quay
Phóng viên: Tôi có hỏi Claude của Anthropic về nguy cơ AI xóa sổ loài người trong mười năm tới. Ban đầu nó không muốn trả lời, nó cứ vòng vo, nhưng khi tôi ép thì chính mô hình của Anthropic nói con số từ hai đến năm phần trăm. Câu hỏi mà nhiều người muốn biết là: AI sẽ làm việc ấy bằng cách nào?
Khách mời: Trời ạ, Boris. Danh sách các mối đe dọa mỗi ngày một dài ra. Trước hết, có một khối lượng bằng chứng ngày càng lớn cho thấy công nghệ này có năng lực trong việc tạo ra vũ khí sinh học, trong việc tạo ra các đợt tấn công an ninh mạng ở mức chưa từng có và không thể phòng bị.
Chỉ mới vài tuần trước, một cơ sở nghiên cứu ở California cho biết họ đã dùng AI để tạo ra trong hai ngày một cuộc tấn công an ninh mạng có thể lây nhiễm vào một trong những ứng dụng nhắn tin lớn nhất thế giới trên điện thoại của bạn, mà bạn thậm chí không cần chạm vào máy. Nguy hiểm ở đây là cực kỳ lớn.
Và tôi nghĩ điều mà tất cả các nhà nghiên cứu này lo lắng, cái mà họ đang nói ra công khai, chính là khả năng đệ quy — khả năng các công nghệ này tự cải thiện chính mình. Anthropic đã nói điều này rồi, và điều kỳ lạ là bạn không phân biệt nổi đâu là ngôn ngữ tiếp thị, đâu là ngôn ngữ cảnh báo. Lời cảnh báo là Claude rõ ràng có thể tạo ra phiên bản kế tiếp của chính nó mà không cần con người can thiệp. Chúng ta đang ở chỗ mà công nghệ này tự cải thiện chính mình cực kỳ nhanh.
Và tôi xin nói thêm một điểm. Jacob Coxon, người vừa trả lời phỏng vấn, đang bỏ đi một khoản tiền khổng lồ, ước tính bảy tuần trước khi công ty này lên sàn. Người này, vốn giữ vai trò cốt lõi trong việc tiền huấn luyện dữ liệu, đang bỏ đi một trong những khoản chi trả lớn nhất trong lịch sử chủ nghĩa tư bản. Cho nên tôi nghĩ rất quan trọng là phải lắng nghe một người có nhiều thứ để mất đến thế, ra đi mà không có kế hoạch gì khác, và nói ra một điều đáng sợ đến như vậy.









































