AI 생성 콘텐츠를 고려한 Next Robots.txt 프로토콜 협의 참여하기
구글 검색 팀에서는 생성 AI 콘텐츠를 고려한 Robots.txt 표준 업데이트를 리딩하면서 관련 업계의 참여를 기대하고 있어요.
요즘 검색을 하다보면 가끔씩 이 콘텐츠가 정말 사람이 만든 것인지, 혹은 인공지능 생성한 콘텐츠인지 궁금할 때가 많아지고있죠. 딱 봐도 이건 AI가 자동생성한 거구나 알아챌 수 있을 정도로 티나는 콘텐츠도 많았지만, 이제는 그 수준이 높아져서 쉽게 구분하기 어려워지고 있구요.
생성 AI 모델은 이미 인터넷에 공개된 콘텐츠를 크롤링해서 만들어지고 있고, 또 이러한 모델에서 새롭게 만들어진 콘텐츠는 누구나 특별한 조건 없이 조회할 수 있도록 공개된 콘텐츠를 통해 만들어졌지만 분명 콘텐츠 생산자가 AI가 활용하는 것에 동의하지 않은 경우도 꽤 많았겠죠.
텍스트 뿐 아니라 이미지, 영상 등 콘텐츠 유형이 점차 다양해지고 이에 대한 이용 권한 역시 콘텐츠 생산자 입장에서 충분히 제어할 수 있길 원하지만, 현재의 웹 크롤러는 이런 세분화된 권리 표현을 할 수 있는 표준화된 방법이 없어요. 게다가 RAG (Retrieval-Augmented Generation) 와 같은 AI 기술들을 이용해서 모델이 아닌 서비스로서 인터넷에 공개된 콘텐츠를 가져가 활용하는 경우도 늘어나고 있는데요. 이러한 방식으로 콘텐츠가 이용되는 것에 대해 콘텐츠 생산자가 동의를 했는가 역시 사회적 합의가 제대로 이뤄졌다고 볼 수 없구요.
현재 기존 Robots.txt 프로토콜을 그대로 활용해서 Yes or No를 할 수 있는 수준으로 AI 에서 사용여부에 대한 의사 표현을 할 수는 있습니다. 예를 들어 OpenAI GPTBot 은 ‘User-agent’: GPTBot 을 통해 차단여부를 정할 수 있도록 가이드 하고 있어요. 하지만 호스트가 정확히 그 크롤러봇 이름을 알고 일일히 표현하는 방식으로는 한계가 명확합니다.
최근 구글은 2023 Google I/O 중 향후 AI 콘텐츠의 사용성을 고려한 프로토콜 업데이트 협의(AI Web Publisher Controls)를 시작하며 전세계 기술, 콘텐츠 퍼블리셔 등 업계 관계자와 함께 참여해주길 요청했어요.
이를 리딩하고 있는 팀은 구글 검색 관계 관리 (Google Search Relations Team) 팀이고 이 팀은 구글 SEO 에 대한 가이드 문서를 제공하고, 구글 봇 표준을 관리하는 업무를 하는 팀인데요. 이 협의를 통해 새로 업데이트되는 Robots.txt Protocol 은 Google Bard, Vertax AI 에 적용될 계획이라고 하구요. 이렇게 되면 사실상의 웹 표준으로 받아들여질 가능성이 높으니 이 논의가 향후 AI 콘텐츠의 공개적인 사용에 대한 표준이 될 수 있을 정도로 매우 중요한 논의라고 생각됩니다.
그리고 최근 AI Web Publisher 킥오프가 2023.10.27 에 있었습니다.

Google Search 팀 2023.10.27 올린 AI Web Publisher Controls Kickoff 영상
위 영상에서 이 논의에서 다뤄져야 하는 주요 4가지 담론을 이야기하는데 다음과 같습니다.
담론 4가지 Slides PDF 참고
Alignment (일치성)
크로링 봇이 과거 주로 검색 등 웹을 다루는 곳이 중심이었다면 이제 새롭계 AI 업계로 넓어졌는데요. 구글 역시 이러한 확장을 고려해서 새롭게 AI 목적에 맞도록 포괄적으로 컨트롤할 수 있는 프로토콜로서 Robots.txt 가 기능하기 위해 새로운 option, taxonomy 등 웹, AI업계, 콘텐츠 생산자 모두 일관성있는 기준이 필요합니다. 특히 웹 콘텐츠 생산자는 40억개 이상의 호스트가 존재하는데, 이러한 40억개 호스트가 최대한 영향을 받지 않도록 하는 표준을 만드는 것이 매우 중요하다고 보고 있구요.
Transparency (투명성)
봇이 콘텐츠 호스트에 접근할 때, 봇이 왜 접근하는 지 목적을 명확하고 투명하게 제공할 수 있어야 합니다. 호스트는 봇의 목적을 보고 콘텐츠 접근 여부를 정할 수 있으므로 봇이 충분한 정보를 제대로 제공하는 것이 중요한데요. 이러한 표준을 잘 지키기 위해 구글 검색 봇은 충분히 정보를 제공하고 있고 (이 논의를 주도하는 팀이 이 역할을 하니까 당연히.. 😅 ) 다른 봇들도 그러하길 기대하고 있는 눈치? 입니다. 이를 위해 bot 정보를 중앙에서 등록하고 host 가 접근가능한 registry 도입도 하나의 대안으로 언급됩니다.
Granularity (세분성)
검색엔진과 생성AI 앱 등에서 사용되는 목적, 방식 등이 완전히 다를 수 있기 때문에 이를 나누는 과정. 또 AI 안에서도 목적 세분화가 잘 이루어져야 합니다. 어떤 방식으로의 이용은 허용하고 말지 콘텐츠 생산자가 잘 정의된 경우가 아니라면 분명 AI 발전이 오히려 닫힌 인터넷으로 가도록 만들 수 도 있으니까요. 그렇다고 너무 세분화되면 부작용도 많을 것이고 말이죠. 그리고 새로운 목적, 사용방식을 가진 크롤러가 계속 등장할 것을 고려해서 이러한 새로운 유형이 계속 늘어나도 호스트 영향도는 최소화 되어야 합니다.
Adoption (적용성)
구글 등의 검색, 웹 업계 뿐 아니라 관련된 AI업계 및 스타트업 그리고 웹 콘텐츠 생산자 까지 관계자가 정말 많은데요. 그러면서도 최대한 다수가 이를 존중하고 적용할 수 있어야 비로소 제대로 표준으로서 기능할 것이기 때문에 잘 적용될 수 있도록 하는 것도 중요한 논의 주제 입니다.
이를 위해 여러가지 도구를 만들어야 할 수도 있구요. 봇에서 사용되는 certificate 인증 탑재도 고려될 수 있습니다.
이러한 논의에 참여하고 싶으시면 지금 바로 아래 mailing list 에 메일을 입력하면 됩니다.
현재 첫번째 피드백 일정이 11. 28 에 종료되었기 때문에 이에 대해 정리된 내용 조만간 구글에서 공유할 것 같아요.
사실 이번 이 kick-off 논의 내용 관련 정보나 뉴스 기사, 영상 조회수 등을 보면 크게 업계에서 관심을 받지는 못하는 듯 합니다. 하지만 분명 Robots.txt 는 앞으로 AI 콘텐츠 시대에 중요한 표준이 될 것 같습니다. 네이버, 구글 모두 Robots.txt 표준에 선언된 사이트 게시자의 의도를 보고 해당 웹사이트의 콘텐츠를 검색에 이용할지 결정하고 있으며, 그렇기에 인터넷에서 검색사업자가 현재 웹 콘텐츠를 제공하는 것은 콘텐츠 생산자와의 합의하에 제공하고 있다고 말할 수 있으니까요.
그래서 이번 Robots.txt 의 개선방향은 웹 뿐 아니라 향후 AI 업계 사업자들에게 일종의 콘텐츠 사용권을 어떤 수준으로 얼마나 인정받게 될지 결정되는 중요한 과정이라고 생각 됩니다. 그래서 저는 국내 AI업계도 적극적으로 이 협의에 참여하고 의견을 내는 것이 중요하다고 생각합니다.
스닙팟도 웹 콘텐츠 크롤러봇을 운영하고 있는 정보 제공 사업자이기 때문에 Robots.txt 를 준수하고 있으며, 이번 프로토콜 개선이 어떻게 진행되어 갈지 주목하고 있습니다. 그래서 이번 11월 피드백에 참여하고 지속적으로 상황을 추적하려고 합니다.
앞으로 이와 관련된 내용 계속 스닙팟 #정보 검색 팟 및 #인공지능 기술 트렌드 팟에서 공유할 예정입니다. 관심있는 분은 스닙팟에서 해당 팟 팔로우 부탁드립니다!
#해시태그로 인기 있는 콘텐츠가 모이는 주제 탐색형 서비스
댓글
로그인 후 댓글을 남길 수 있습니다.
OpenAI 를 고소한 책 저자 기사.. 책처럼 확실히 저작권에 보호를 받는 콘텐츠는 고소가 가능한데,, 일반적인 웹 콘텐츠는 더 쉽지 않을듯.. https://www.cnbc.com/2023/07/05/authors-sue-openai-allege-chatgpt-was-trained-on-their-books.html