OpenAI - 초인공지능 정렬
초인공지능의 정렬 (Superalignment)

인간보다 훨씬 더 똑똑한 AI 시스템을 조종하고 제어하기 위해 과학적, 기술적 돌파구가 필요하다. 이 문제를 4년 이내에 해결하기 위해, 우리는 일리야 수츠케버와 얀 레이케가 공동으로 이끄는 새로운 팀을 구성하고, 지금까지 확보한 컴퓨팅 자원의 20%를 이 노력에 할애하고 있습니다. 우리는 훌륭한 ML 연구원과 엔지니어들이 우리와 함께하기를 바랍니다.
영어 원문 읽기
초지능은 인류가 발명한 가장 영향력 있는 기술이 될 것이며, 세계의 가장 중요한 문제들 중 많은 것을 해결할 수 있습니다. 그러나 초지능의 막대한 힘은 매우 위험할 수도 있으며, 인류의 권한 박탈이나 심지어 인류의 멸종으로 이어질 수도 있습니다.
초지능은 지금은 멀게 느껴질지 모르지만, 우리는 이 세대에 도래할 수 있다고 믿습니다.
이러한 위험을 관리하기 위해서는 새로운 거버넌스 기관과 초지능 정렬 문제의 해결이 필요합니다.
우리는 어떻게 훨씬 더 똑똑한 AI 시스템이 인간의 의도를 따르도록 보장할 수 있을까요?
현재로서는 잠재적으로 초지능적인 AI를 조종하거나 제어할 수 있는 해결책이 없습니다.
우리의 현재 AI 정렬 기술은 인간의 피드백에 기반한 강화 학습과 같은 방법에 의존하고 있습니다. 그러나 인간은 우리보다 훨씬 더 똑똑한 AI 시스템을 신뢰할 수 없으며, 따라서 우리의 현재 정렬 기술은 초지능으로 확장되지 않을 것입니다. 우리는 새로운 과학적, 기술적 돌파구가 필요합니다.
우리의 접근 방식
우리의 목표는 대략 인간 수준의 자동화된 정렬 연구자를 구축하는 것입니다. 그런 다음 우리는 막대한 양의 컴퓨팅을 사용하여 노력을 확장하고 초지능을 반복적으로 정렬할 수 있습니다.
첫 번째 자동화된 정렬 연구자를 정렬하려면 1) 확장 가능한 훈련 방법을 개발하고, 2) 결과 모델을 검증하고, 3) 전체 정렬 파이프라인을 스트레스 테스트해야 합니다.
인간이 평가하기 어려운 작업에 대한 훈련 신호를 제공하기 위해 AI 시스템을 사용하여 다른 AI 시스템의 평가를 지원할 수 있습니다(확장 가능한 감독). 또한, 우리는 모델이 우리의 감독을 우리가 감독할 수 없는 작업으로 일반화하는 방식을 이해하고 제어하기를 원합니다(일반화).
시스템의 정렬을 검증하기 위해 문제의 행동(견고성)과 내부(자동화된 해석 가능성)을 찾는 자동화된 검색을 사용합니다.
마지막으로, 우리는 고의로 잘못 정렬된 모델을 훈련하고 우리의 기술이 최악의 종류의 잘못 정렬을 감지하는지 확인함으로써 전체 파이프라인을 테스트할 수 있습니다(적대적 테스트).
우리는 문제를 더 많이 이해함에 따라 연구 우선순위가 크게 바뀔 것으로 예상하며 완전히 새로운 연구 분야를 추가할 가능성이 높습니다. 우리는 미래에 우리의 로드맵에 대해 더 공유할 계획입니다.
새로운 팀
우리는 이 문제를 해결하기 위해 최고의 머신 러닝 연구원과 엔지니어 팀을 구성하고 있습니다.
우리는 지금까지 확보한 컴퓨팅 자원의 20%를 향후 4년 동안 초지능 정렬 문제 해결에 할애하고 있습니다. 우리의 주요 기초 연구 베팅은 새로운 Superalignment 팀이지만, 이것을 올바르게 달성하는 것이 우리의 임무를 달성하는 데 필수적이며, 우리는 새로운 방법을 개발하고 확장하여 배포하는 것에서부터 기여할 것으로 기대합니다.
우리의 목표는 4년 안에 초지능 정렬의 핵심 기술적 과제를 해결하는 것입니다.
이 목표는 매우 야심차고 성공을 보장할 수는 없지만, 집중적이고 단호한 노력이 이 문제를 해결할 수 있다고 낙관하고 있습니다.
많은 아이디어들이 예비 실험에서 유망한 결과를 보였고, 우리는 점점 더 유용한 진척 지표를 가지고 있으며, 오늘날의 모델을 사용하여 많은 이 문제들을 경험적으로 연구할 수 있습니다.
우리의 목표는 4년 안에 초지능 정렬의 핵심 기술적 과제를 해결하는 것입니다.
이 목표는 매우 야심차고 성공을 보장할 수는 없지만, 집중적이고 단호한 노력이 이 문제를 해결할 수 있다고 낙관하고 있습니다.
많은 아이디어들이 예비 실험에서 유망한 결과를 보였고, 우리는 점점 더 유용한 진척 지표를 가지고 있으며, 오늘날의 모델을 사용하여 많은 이 문제들을 경험적으로 연구할 수 있습니다.
일리야 수츠케버(OpenAI 공동 창업자 겸 최고 과학자)는 이 문제를 그의 핵심 연구 중점으로 삼았으며, 얀 레이케(정렬 총괄)와 함께 팀을 공동 이끌 것입니다. 팀에는 이전 정렬 팀의 연구원과 엔지니어, 그리고 회사 내의 다른 팀의 연구원들이 합류할 것입니다.
우리는 또한 이 노력에 참여할 뛰어난 새로운 연구원과 엔지니어를 찾고 있습니다. 초지능 정렬은 근본적으로 머신 러닝 문제이며, 우리는 훌륭한 머신 러닝 전문가들(비록 그들이 이미 정렬에 종사하고 있지 않더라도)이 그것을 해결하는 데 필수적이라고 생각합니다.
우리는 이 노력의 성과를 널리 공유할 계획이며, 비-OpenAI 모델의 정렬과 안전에 기여하는 것을 우리의 중요한 업무 중 하나로 보고 있습니다.
이 새로운 팀의 작업은 ChatGPT와 같은 현재 모델의 안전을 개선하고 AI의 다른 위험을 이해하고 완화하는 OpenAI의 기존 작업과 함께합니다. 이러한 위험에는 오용, 경제적 혼란, 정보 왜곡, 편견과 차별, 중독과 과도한 의존 등이 있습니다. 이 새로운 팀은 초지능 AI 시스템을 인간의 의도와 정렬하는 데 필요한 머신 러닝의 도전 과제에 집중할 것이지만, 우리는 기술 솔루션이 더 넓은 인간과 사회의 관심을 고려할 수 있도록 다양한 분야의 전문가들과 적극적으로 협력하고 있습니다.
댓글
로그인 후 댓글을 남길 수 있습니다.
아직 댓글이 없습니다.