John Schulman, người đồng sáng lập OpenAI, hiện là nhà khoa học trưởng tại Think Machines, cho biết ông kỳ vọng vào sự tự cải thiện đệ quy – các hệ thống AI tăng tốc sự phát triển của chính chúng – trong khoảng ba đến bốn năm, một mốc thời gian khiến ông trở thành một trong những nhà dự báo tích cực hơn trong lĩnh vực này. Schulman đã đưa ra ước tính này trong một tập thảo luận bàn tròn của Dwarkesh Podcast được xuất bản hôm thứ Sáu, trong đó ba nhà nghiên cứu tại phòng thí nghiệm biên giới đã tranh luận công khai về mức độ thực sự của ngành này gần với mức trần của nó.

Cuộc trò chuyện đưa ra một cái nhìn thận trọng hiếm hoi về cách các nhà nghiên cứu ở gần biên giới đang nghĩ về sự tiến bộ, đến giữa một tuần ồn ào chứng kiến ​​Giám đốc điều hành Nvidia Jensen Huang tuyên bố rằng "AGI đã đến" và một nhóm gồm 25 người đạt Huy chương Fields cảnh báo rằng việc theo đuổi điểm chuẩn AI đang gây tổn hại cho toán học. Đối với độc giả theo dõi sự phát triển AI mới nhất, tập phim này là một đối trọng hữu ích: đây là những người xây dựng hệ thống và họ bất đồng gay gắt với nhau.

Ai đã ở bàn

Người dẫn chương trình Dwarkesh Patel cho biết anh ấy đã tập hợp hội đồng vì khách hàng làm việc tại nơi mà anh ấy gọi là "các phòng thí nghiệm và công ty hơi cởi mở", nghĩa là họ có thể phát biểu chính thức. Tham gia cùng Schulman còn có Beren Millidge, giám đốc công nghệ tại Zyphra, một công ty khởi nghiệp đang phát triển các mô hình nguồn mở và Charlie O'Neill, người đứng đầu bộ phận đào tạo mô hình tại Baseten.

Thông tin xác thực của Schulman khiến cho cuộc nói chuyện về dòng thời gian của anh ấy có sức nặng đặc biệt. Anh là người đồng sáng lập OpenAI và lãnh đạo hoạt động học tập tăng cường từ nghiên cứu phản hồi của con người nhằm tạo ra các kỹ thuật đằng sau ChatGPT, trước khi khởi hành đến Think Machines, nơi anh hiện giữ vai trò là nhà khoa học trưởng.

Vụ kiện chống lại điểm kỳ dị, người thép

Patel mở đầu bằng một câu hỏi rõ ràng: nếu năm 2036 đến mà không có hàng tỷ hệ thống siêu trí tuệ làm thay đổi thế giới, thì lý do kỹ thuật sẽ là gì? Millidge đưa ra trường hợp mạnh mẽ nhất cho chủ nghĩa hoài nghi, mô tả cái mà ông gọi là mô hình kiểu gần như nghịch lý của Moravec, trong đó các mô hình vượt qua bất kỳ tiêu chuẩn chuẩn nào mà các nhà nghiên cứu đặt ra trước chúng, nhưng tác động trong thế giới thực lại gây thất vọng.

Millidge nói: “Vẫn còn một số khoảng cách dai dẳng giữa sim và thực, bằng cách nào đó đang chặn mọi thứ”, đồng thời mô tả một thế giới nơi AI trở nên “cực kỳ giỏi ở mọi thứ mà mọi người đưa vào điểm chuẩn” mà không cần khái quát hóa thêm. Ông nói thêm rằng ông cho rằng kết quả này khó xảy ra và chỉ ra bằng chứng cho thấy học tăng cường đã khái quát hóa trong thực tế.

Schulman phần lớn đồng ý rằng sự tiến bộ không phải là tự động. Ông nói, con người nắm giữ những lợi thế thực sự so với các mô hình ngày nay và mỗi lần phát hành mô hình mới sẽ bắt kịp ở một số lĩnh vực trong khi vẫn bị tắc nghẽn ở những lĩnh vực khác - mô hình đã xác định một số chu kỳ sản phẩm gần đây nhất.

Mốc thời gian chớp nhoáng: hai năm, ba đến bốn, năm đến mười

Khi Patel nhấn số, bảng sẽ tách ra. Khi được hỏi khi nào AI có thể mang lại năng suất tăng gấp 10 lần cho một công nhân cổ trắng có năng lực, Schulman đầu tiên từ chối đưa ra một con số duy nhất, sau đó nói "Tôi sẽ nói là hai năm." Millidge cho biết ông thực sự có thể "thấy được điều đó", lập luận rằng mức tăng đã vượt quá 10 lần đối với một số loại công việc. O'Neill là người bảo thủ nhất, trả lời "5 đến 10" năm.

Patel sau đó đã đẩy xa hơn, mô tả kịch bản là "về cơ bản chỉ là ASI." Schulman trả lời: "Tôi có thể nói là 3-4 năm", nói thêm rằng bản thân việc tự động hóa nghiên cứu AI "không phải là một trong những điều khó khăn nhất đối với AI, bởi vì nó liên quan đến rất nhiều" công việc mà các kỹ thuật hiện tại có thể tiếp cận. Cuộc trao đổi đáng chú ý là ước tính này thu được rất ít phản hồi từ các nhà nghiên cứu khác.

Các nhà nghiên cứu tự động thực sự sẽ được đào tạo như thế nào

Một phần đáng kể của tập phim đề cập đến cơ chế của kịch bản mà Schulman đang định giá. Khi được hỏi về cách đào tạo các hệ thống AI có khả năng tự động hóa nghiên cứu AI, Schulman mô tả "một số sự kết hợp giữa việc học hỏi từ phản hồi của con người để tiếp thu sở thích của các nhà nghiên cứu và chỉ tạo ra nhiều môi trường thực hành liên quan đến việc thực hiện nghiên cứu nhiều bước."

Câu trả lời đó kết nối với việc tiền của ngành sẽ đi về đâu. Thỏa thuận hoàn tất gần đây của Google với Mechanize, một công ty khởi nghiệp xây dựng môi trường làm việc mô phỏng cho các đại lý đào tạo, phản ánh chính xác sự đặt cược này rằng cơ sở đào tạo tốt hơn - không chỉ các mô hình lớn hơn - sẽ thúc đẩy vòng tăng năng lực tiếp theo. Schulman cũng chỉ ra một khó khăn cốt lõi: các chức năng khen thưởng được xây dựng trên dữ liệu tự nhiên rất khó chỉ định và các tín hiệu hời hợt như liệu người dùng có chấp nhận chỉnh sửa mã hay không có thể đánh lừa quá trình đào tạo.

Chưng cất so với tập trung

Một trong những dự đoán cụ thể nhất của Schulman liên quan đến cơ cấu ngành. Ông nói: “Tôi nghĩ rằng sự chắt lọc là yếu tố chính chống lại lực lượng tập trung hóa,” đồng thời lập luận rằng các năng lực học được thông qua học tập tăng cường có thể được chuyển sang các mô hình nhỏ hơn một cách tương đối dễ dàng, mở rộng năng lực liền kề ra ngoài phạm vi một số ít công ty có đủ khả năng chi trả cho các hoạt động đào tạo ở biên giới.

Về câu hỏi con người còn lại gì, Schulman đã đưa ra quyết định dứt khoát. Ông nói: “Tôi có thể nói rằng công việc cuối cùng của con người, hay vai trò lâu dài nhất của con người, là xác định mục tiêu và quyết định những gì chúng ta thực sự muốn”. Khi Patel tóm tắt "sự liên kết là công việc cuối cùng", Schulman đồng tình: "Sự liên kết là một loại câu trả lời", đồng thời lưu ý rằng nó phân rã thành việc tìm ra mục tiêu phù hợp và sau đó thực sự đạt được nó.

Vị trí của tập phim phù hợp với cuộc tranh luận về dòng thời gian

Phụ đề của tập phim - "Chúng ta không ở gần trần nhà" - nắm bắt được giọng nam cao tổng thể của nó: các nhà nghiên cứu nhìn thấy đường băng đáng kể phía trước, ngay cả khi họ tranh cãi về mức độ gập ghềnh của con đường. Cuộc thảo luận xoay quanh vấn đề điều gì đang thúc đẩy sự tiến bộ của các phòng thí nghiệm Trung Quốc, liệu việc học tăng cường trong thời gian dài có thể khơi gợi trí thông minh chung hay không và tại sao RL lại bắt đầu hoạt động tốt như hiện tại.

Cuộc tranh luận công khai về các mốc thời gian đã gia tăng ở tất cả các bên trong tháng này. Theo Bloomberg, tuyên bố "AGI đã đến" của Huang đã thu hút sự hoài nghi từ các nhà phân tích, những người coi đây là một trường hợp kinh doanh hơn là một tuyên bố khoa học, trong khi Giám đốc điều hành OpenAI Sam Altman nói với nhân viên rằng công ty sẵn sàng làm chậm quá trình phát triển tiên tiến khi mối lo ngại về an toàn ngày càng gia tăng. Khoảng thời gian từ ba đến bốn năm của Schulman cho quá trình tự cải thiện đệ quy nằm ở đâu đó giữa tiếp thị và tạm dừng - một ước tính thực tế từ một người có thành tích xây dựng các kỹ thuật hiện đang thúc đẩy lĩnh vực này.

Liệu anh ấy có đúng hay không sẽ phụ thuộc vào các câu hỏi mà hội thảo chỉ khoanh tròn: liệu học tập tăng cường có tiếp tục khái quát hóa môi trường đào tạo của nó hay không và liệu khoảng cách giữa hiệu suất chuẩn và giá trị kinh tế thực sự có tiếp tục thu hẹp hay không.

Đi trước AI

Các nhà nghiên cứu của Frontier đang tranh luận về giới hạn của AI trước công chúng — hãy theo dõi câu chuyện khi nó phát triển.

Đọc thêm tin tức về AI trên AI Buzz Wire