Anthropic은 자동화된 AI 시스템이 모델의 정렬 오류를 안정적으로 복구할 수 있다는 연구 결과를 발표했습니다. 그 결과는 AI 산업의 중심에서 안전 작업이 수행되는 방식을 바꿀 수 있습니다. "자동화된 연구원은 정렬 실패를 안정적으로 완화할 수 있습니다"라는 제목의 이 논문은 금요일에 발표되었으며 TechCrunch에서 자세히 설명했습니다.
이 연구는 Anthropic의 동료 프로그램에서 나온 것이며 Chen Yueh-Han이 주도했습니다. 핵심 주장은 놀랍습니다. 회사의 자동화된 연구 시스템이 특정 잘못 정렬된 행동을 측정하는 10개의 벤치마크를 가리키자 모델의 전체 기능을 저하시키지 않고 모든 항목에서 성능이 향상되었습니다. 모델 규모에 맞춰 안전 작업을 유지하려고 노력해 온 분야에서 이는 주목할 만한 결과입니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.
AI 안전 취재로 바쁜 와중에 이 이야기가 나왔다. 이는 보상 해킹 에이전트에 대한 OpenAI의 내부 보고서부터 Hugging Face 위반에 대한 독립적인 조사 요구에 이르기까지 에이전트의 잘못된 행동이 헤드라인을 장식한 여름 이후입니다. Anthropic의 새 논문은 반대 방향에서 문제에 접근합니다. 즉, 에이전트가 어떻게 잘못 행동하는지 묻는 대신 다른 에이전트가 문제를 해결하도록 신뢰할 수 있는지 묻습니다.
논문이 실제로 보고하는 내용
논문에 설명된 시스템을 AAR(Automated Alignment Researcher)이라고 합니다. AAR은 연구 프로세스를 대체하는 대신 대부분을 복제합니다. 각 자동화 시스템은 사용 가능한 문헌을 검색하고 방법을 제안하며 해당 방법을 사용하여 약 30분 동안 모델을 교육합니다. 그런 다음 프로세스는 여러 반복에 걸쳐 반복됩니다.
선택 메커니즘은 간단합니다. 벤치마크를 이동하는 방법은 유지됩니다. 그렇지 않은 메서드는 삭제되지 않습니다. 이 루프를 통해 시스템은 인간 팀이 따라올 수 없는 규모로 신속하게 작동할 수 있으며, 많은 연구 방향을 동시에 테스트하고 작동하는 것만 유지할 수 있습니다.
논문에 따르면 결과는 전반적으로 일관되었습니다. 특정 잘못 정렬된 동작을 다루는 10개 벤치마크 모두에서 자동화된 시스템은 전체 모델 성능을 저하시키지 않고 측정 가능한 개선을 이루었습니다. 이는 정렬 작업을 어렵게 만드는 일반적인 절충안입니다.
"전반적으로 이러한 결과는 훈련 후 자동화된 정렬이 단기적으로 실용적이 될 수 있다는 초기 증거를 제공합니다"라고 논문은 말합니다.
1/37의 비용으로 인간을 물리치다
논문에서 가장 많이 인용되는 구절은 AAR을 인간의 것과 직접 비교하는 구절입니다. Anthropic은 비교를 회피하지 않았습니다.
"최고의 AAR 방법은 숙련된 인간이 제안하는 것보다 평균 6시간 이내에 더 좋습니다."라고 논문은 말합니다. 또한 "인간이 지도하는 연구 방향은 더 나은 성과로 이어지지 않는다"고 지적했습니다.
경제학도 마찬가지로 무뚝뚝하다. 저자는 "우리가 인간 연구자들에게 지불하는 시간당 150달러에 비해 API 추론의 경우 AAR 비용은 시간당 약 4달러입니다."라고 썼습니다. 이는 거의 40배에 달하는 비용 차이이며, 이는 실험실에서 자동화된 연구를 단순한 호기심 이상으로 진지하게 받아들이는 이유를 설명합니다.
비용 격차가 중요한 이유
정렬 연구는 과소평가되기 쉬울 정도로 비용이 많이 듭니다. 모든 후보자 개입은 벤치마크와 비교하여 구현, 교육 및 평가되어야 하며 대부분의 후보자는 실패합니다. 시스템이 API 호출 비용으로 검색 루프를 지속적으로 실행할 수 있다면 아이디어를 하나 더 시도하는 데 드는 한계 비용은 0에 가까워집니다. 제약 조건은 인원수에서 계산으로 이동합니다.
인류 자체의 한계가 표시됨
이 논문은 결과가 입증되지 않은 것에 대해 솔직합니다. 자동화된 시스템은 벤치마크가 중요한 정렬 목표를 실제로 반영하는 경우에만 작동하며, 실제 잘못된 동작을 포착하는 벤치마크를 구축하고 유지하는 것은 현장에서 아직 해결되지 않은 문제로 남아 있습니다.
또한 놓치기 쉬운 종속성이 있습니다. 자동화된 연구자는 기존 방법 문헌을 활용합니다. 그 문학을 유지하고 확장하는 것은 그 자체로 중요한 작업이며, 알려진 기술만 리믹스하는 시스템은 인간의 창의성이 도달하지 못하는 한계에 부딪힐 수 있습니다.
연구의 장기적인 중요성이 이에 달려 있기 때문에 이러한 주의 사항이 중요합니다. 벤치마크가 잘못된 것을 측정하는 경우 AAR은 기본 위험을 그대로 유지하면서 강력한 수치로 최적화할 수 있습니다. Anthropic의 프레이밍(해결책이 아닌 "초기 증거")은 이러한 불확실성을 반영합니다.
재귀적 자기 개선을 향한 한 걸음
이 논문은 또한 AI 시스템이 궁극적으로 이를 생성하는 훈련 프로세스 자체를 개선할 수 있다는 생각인 반복적 자기 개선에 대한 더 큰 논쟁을 불러일으킵니다. 다른 AI 모델을 사용하여 AI 모델을 훈련하는 것은 개척 연구실의 인기 있는 목표가 되었으며 Anthropic의 결과는 좁은 영역에서 그것이 어떻게 보이는지에 대한 초기의 구체적인 모습입니다.
논리는 간단합니다. 모델이 자신의 정렬 훈련을 안정적으로 개선할 수 있다면 동일한 기계가 더 광범위하게 훈련 관행을 가리킬 수 있을 것입니다(능력 작업 포함). TechCrunch는 인간 AI 연구자가 결국 프로세스에서 덜 중심적이 될 수 있다는 암시를 지적합니다. 이는 논문 자체가 피하는 것이 아니라 참여하는 가능성입니다.
다음에 볼 내용
이 결과가 일반화되는지 여부를 결정하는 세 가지 질문이 있습니다. 첫째, 더 복잡하고 잘 정의되지 않은 실패 모드에서 접근 방식이 인류가 테스트한 10가지 벤치마크 외부에 적용되는지 여부입니다. 둘째, 자동화된 조사를 정직하게 유지할 수 있을 만큼 벤치마크 유지 관리 문제를 빠르게 해결할 수 있는지 여부입니다. 셋째, 다른 연구실에서도 비슷한 결과를 발표하는지 여부, 이를 통해 단일 논문이 업계 방향으로 전환될 수 있는지 여부입니다.
현재로서는 그 발견은 좁지만 실제적입니다. 인류가 테스트한 특정 정렬 작업에서 자동화된 연구원은 숙련된 인간보다 더 빠르고 훨씬 더 저렴하게 수행되었습니다. AI 산업의 안전 측면은 인간이 아닌 AI 연구자가 대부분의 작업을 수행하는 첫 번째 장소일 수 있습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →