요약
클라우드플레어가 AI 에이전트가 웹을 검색하게 해 주는 웹 검색 API를 베타로 내놓았습니다.
클라우드플레어가 개발자 문서의 변경 기록에 올린 발표입니다. AI 에이전트가 URL을 짐작하거나 모델의 학습 시점 지식에 기대지 않고, 실시간 정보로 답의 근거를 대게 하려는 기능입니다.
왜 중요한가
- 검색 업체마다 따로 가입하지 않고 AI Gateway 크레디트 하나로 세 업체를 골라 쓸 수 있습니다.
- 업체 정가 그대로 청구하고 클라우드플레어는 웃돈을 붙이지 않아, 중개를 거쳐도 검색 비용이 늘지 않습니다.
핵심 내용
- 출시 시점의 검색 업체는 세라믹(Ceramic.ai), 엑사(Exa), 링크업(Linkup) 세 곳입니다.
- 세 업체 모두 클라우드플레어를 거친 요청에 대해 무보관(요청 데이터를 남기지 않는 방식)을 지원합니다.
- 세 업체는 클라우드플레어의 검증된 봇 크롤링 기준도 따르기로 약속했습니다.
- AI Gateway(AI 요청을 중계하고 기록하는 서비스)를 거치므로 검색 요청이 게이트웨이 로그에 남습니다.
- REST API나 Workers 바인딩으로 검색어, 업체, 결과 수를 지정해 호출하며 자기 업체 API 키도 쓸 수 있습니다.
HN 반응
- 세라믹 약관이 검색 결과의 저장과 재배포를 막는다는 지적에, 웹을 공짜로 수집한 업체가 남의 재사용을 막는 건 모순이라는 비판이 이어졌습니다.
- 하루 1,000회 무료 구글 검색이 되는 Gemini 2.5 Flash-Lite를 권하는 의견과, 앱에 쓰기엔 한도가 막혀 Perplexity를 쓴다는 경험담이 나왔습니다.
검색 API를 볼 때 제가 제일 먼저 묻는 건 늘 하나입니다. 받은 결과를 저장하고 다시 배포(resyndicate)해도 되는가입니다.
에이전트 시스템을 돌리는데 응답을 저장할 수 없거나 "대화 기록 공유" 버튼을 제공할 수 없다면, 꽤 큰 제약입니다.
이 질문의 답은 어김없이 약관 깊숙한 곳에 묻혀 있습니다. 세라믹의 경우, 해서는 안 되는 일을 나열한 목록에서 관련 대목을 찾았습니다.
https://www.ceramic.ai/terms-of-service
이런 걸 신경 쓰는 사람이 저뿐인가요?
이 부분이 원하시던 예외를 주는 것처럼 보였습니다.
그런데 문장이 이렇게 이어집니다.
화면에 보이는데 사용자가 추출하지 못하게 하는 게 어떻게 가능합니까? 이렇게 지킬 수 없는 조건을 달아 예외를 무효로 만들 거면, 애초에 예외는 왜 둔 겁니까?
그러니까 자기들은 웹을 크롤링해서 정보를 훔쳐다 자기 데이터베이스를 채워 놓고, 이제 와서 남들이 그걸 도로 훔쳐 가면 "불법"인 척한다는 거죠?
인터넷 테크 업계의 이 이상한 태도는 골드러시 때와 닮았어요.
그럼 원주민은 누구일까요?
맞아요, 자기들이 만드는 데 아무 기여도 안 한 남의 콘텐츠를 라이선스도 없이 그냥 재배포하면서, 거기에 저작권이나 지식재산권이 생기기라도 한 것처럼 굴잖아요. 앤트로픽의 다리오가 디스틸레이션(distillation)을 막는 규제를 요구할 때마다 짜증이 나요.
미국 지식재산권법은 실제로 그렇게 돌아간다는 거, 알고 계시죠?
모아 놓은 사실 하나하나에는 저작권이 없어도, 그 사실들을 모은 편집물에는 저작권이 있을 수 있어요.
요즘은 이게 "상투적 수법(modus operandi)"인 것 같아요. 누가 정권과 더 가까워져서, 집행할 수 없는 걸 어느 날 갑자기 집행하게 만드느냐는 내기죠. 여러분의 안전을 위해서라면서요. 설마 자동차를 훔치진 않으시겠죠?
만들어진 "사회적 진실"에 순응하고, 그것이 "상투적 수법(modus operandi)"이라며 안일하게 체념하는 것은 스스로를 자신이 사는 사회 바깥에 두는 일입니다.
당신은 자신이 통제할 수 없다고 멋대로 단정한 사회적 현실에 스스로를 종속시키고 있습니다. 하지만 그런 현실을 가능하게 한 것도 하다못해 당신의 침묵하는 수용이었습니다.
도덕적, 윤리적 판단을 애초에 그 판단으로 제약받아야 할 바로 그 사람들에게 맡겨 둘 수는 없습니다.
해법이 사람들한테 잘못된 방식으로 답답해한다고 훈계하는 거였다니, 누가 알았겠어요.
당신 말고 누가 그런 말을 했죠?
"답답하다"는 이유로 개인의 책임과 그에 따른 행동을 면제받는 것은 패배주의입니다.
이전의 시도가 통하지 않았다면 접근법을 바꾸십시오. 접근법이 없다면 찾아내거나 만들어 내야 합니다. 방법을 모르겠다면 그것부터 알아보십시오.
"답답하니까 아무것도 안 한다"는 태도, 그리고 그 순환논리를 지적하는 사람에게 훈계한다고 반발하는 태도는 패배와 몰락을 보장하는 것 말고는 아무 소용이 없습니다.
헤비메탈 기타 코드가 울려 퍼진다
당신은 자기 몰락을 조롱하고 있습니다. 그걸 즐기게 되리라고 어떻게 그렇게 확신합니까?
무리한 요구는 아닌 것 같습니다. 그쪽에서 크롤링해서 소화하기 쉬운 형태로 제공하는 건데요. 한 번 읽는 값만 내고 그 사본을 가져다 무한정 배포할 수는 없죠. 직접 크롤러를 만들어서 웹을 크롤링하세요. 그리고 원하면 무료로 나눠 주시고요!
그들이 애초에 데이터를 훔쳤고 출처에 아무런 보상도 하지 않았다는 사실은 슬쩍 넘어가시는군요. 그건 "합리적"이지 않습니다.
게다가 "쉽게" 제공하는 것도 아닙니다. 온갖 장벽을 세워 놓았고, 장물에 돈까지 내라고 합니다.
그러면서 전혀 다른 두 상황을 똑같이 놓으시네요. 한쪽은 그런 구조를 쉽게 짜 놓을 수 있는 수십억 달러 규모의 기업이고, 다른 쪽은 (제가 대변하는) 대중인데, 대중은 흔히 궁핍과는 거리가 멉니다.
그러니 아니요, 여기서 비합리적인 쪽은 당신입니다. 그들도 마찬가지고요.
robots.txt를 따르는 검색 엔진도 도둑질이라는 건가요?
검색 엔진 색인에 올라가기 싫다고, 색인하지 말라고 했는데도 색인했다면 그건 도둑질입니다.
하지만 "제 콘텐츠를 읽어서 당신네 사용자에게 제공해 주세요"라고 해 놓고 나중에 그렇게 한 걸 도둑질이라고 주장하는 건 좀 뜬금없어 보여요.
제가 놓치고 있는 게 뭔가요?
"내 콘텐츠를 읽어서 당신네 사용자에게 제공한다"와 "내 콘텐츠를 읽어서 당신네 사용자에게 제공하는 걸로 돈을 번다"는 다릅니다. 이런 이용 약관은 "이걸로 돈 버는 건 우리뿐이다"라고 말하려는 것이고, 문제는 바로 거기에 있습니다.
맞아요, 검색 엔진은 비영리여야겠죠. 그런데 수익을 내려면 사용자를 보내 줘야 하잖아요.
좋은 지적입니다. 클라우드플레어가 색인한 콘텐츠 중 일부에도 분명 클라우드플레어 같은 약관이 붙어 있었을 텐데, 그건 신나게 무시했을 겁니다.
Geocities와 vBulletin 사용자들이죠!
데이터가 해자(moat)이고, 컴퓨팅은 비용 항목일 뿐입니다.
“지금 보고 계시잖아...”
게다가 "해당 Output을 일반적이고 실시간적인 사용 과정에서 승인된 최종 사용자에게 표시하는 데 합리적으로 필요한 범위를 넘어 Output을 보유, 캐시 또는 저장하는 행위"라는 대목은 오래 유지되는 세션에 저장하는 것도 금지하는 걸로 읽힙니다.
"합리적으로 필요한"이라는 표현은 정말 짜증 날 정도로 모호합니다.
아니요, 그리고 웃긴 건 자기들은 "데이터"를 "공짜"[1]로 긁어 가면서 되파는 건 금지한다는 겁니다. 이게 법적으로 효력이 있기는 한지도 저는 모르겠어요. 이 거래의 당사자가 누굽니까? 프로그램 둘이요? 자기 프로그램이 하는 일에 사람이 책임져야 한다면, AI 하는 사람들은 왜 CFAA 위반으로 감옥에 안 갑니까? 네? 다 어딘가 단단히 꼬여 있어요.
Blekko를 운영할 때는 패치되지 않은 취약점이 있는 WordPress 플러그인이나 쇼핑 카트 패키지를 찾으려고 WordPress 사이트를 크롤링하려는 사람이 정말 많았습니다. 그런데 클라우드플레어가 이걸 어떻게 돈으로 만들고 있는지는 정말 궁금하네요.
[1] 웹 스크레이퍼가 몰고 오는 크롤링 트래픽을 감당하는 데 비용이 안 든다고 생각하는 사람은 없겠죠.
저는 업무 때문에 이 부분이 아주 중요한데, 제가 찾아본 곳 중에 결과 저장을 허용하는 곳은 Brave뿐이었습니다(대신 돈을 더 내야 합니다).
저는 이런 건 보통 의도를 따져 봅니다. 그 회사가 왜 약관에 그런 조항을 넣었는지를요. 그걸 기준 삼아 그 회사가 약관을 들어 나를 상대로 집행할 가능성을 가늠합니다.
그건 상대가 하루아침에 판을 뒤집어도 감당할 수 있는 위험 수준까지만 통하는 얘기입니다.
그래서 저는 클라우드플레어를 아무리 좋아해도 이런 건 그쪽 결제로 연결하지 않을 겁니다. 회사 인프라 전체가 멈출 위험이 너무 큽니다. 잘못 설정된 AI가 사기/위험 플래그를 잘못 띄워서 그렇게 될 수도 있고요. 예를 들어 검색 API 제공업체들이 자기네 쪽의 오류 가능성 있는 어뷰징 판정 메타데이터를 클라우드플레어에 되돌려 공유하는 경우도 있겠죠.
혼자가 아니에요. 저도 답답한 제약이라는 데 동의합니다.
그냥 허접한 웹 스크레이핑 스타트업이잖아요. 약관 위반하세요, 누가 신경이나 쓴답니까.
맞는 생각입니다. 걸릴까 봐 걱정되면 평판 좋은 VPN이나 수백 곳에 달하는 주거용 프록시 업체 중 하나를 쓰면 됩니다.