웹 검색 API

Web Search API

developers.cloudflare.com ▲ 476 댓글 220 tosh

요약

클라우드플레어가 AI 에이전트가 웹을 검색하게 해 주는 웹 검색 API를 베타로 내놓았습니다.

클라우드플레어가 개발자 문서의 변경 기록에 올린 발표입니다. AI 에이전트가 URL을 짐작하거나 모델의 학습 시점 지식에 기대지 않고, 실시간 정보로 답의 근거를 대게 하려는 기능입니다.

왜 중요한가

  • 검색 업체마다 따로 가입하지 않고 AI Gateway 크레디트 하나로 세 업체를 골라 쓸 수 있습니다.
  • 업체 정가 그대로 청구하고 클라우드플레어는 웃돈을 붙이지 않아, 중개를 거쳐도 검색 비용이 늘지 않습니다.

핵심 내용

  • 출시 시점의 검색 업체는 세라믹(Ceramic.ai), 엑사(Exa), 링크업(Linkup) 세 곳입니다.
  • 세 업체 모두 클라우드플레어를 거친 요청에 대해 무보관(요청 데이터를 남기지 않는 방식)을 지원합니다.
  • 세 업체는 클라우드플레어의 검증된 봇 크롤링 기준도 따르기로 약속했습니다.
  • AI Gateway(AI 요청을 중계하고 기록하는 서비스)를 거치므로 검색 요청이 게이트웨이 로그에 남습니다.
  • REST API나 Workers 바인딩으로 검색어, 업체, 결과 수를 지정해 호출하며 자기 업체 API 키도 쓸 수 있습니다.

HN 반응

  • 세라믹 약관이 검색 결과의 저장과 재배포를 막는다는 지적에, 웹을 공짜로 수집한 업체가 남의 재사용을 막는 건 모순이라는 비판이 이어졌습니다.
  • 하루 1,000회 무료 구글 검색이 되는 Gemini 2.5 Flash-Lite를 권하는 의견과, 앱에 쓰기엔 한도가 막혀 Perplexity를 쓴다는 경험담이 나왔습니다.

댓글

30개 표시 · 전체 220개
  1. simonw HN

    검색 API를 볼 때 제가 제일 먼저 묻는 건 늘 하나입니다. 받은 결과를 저장하고 다시 배포(resyndicate)해도 되는가입니다.

    에이전트 시스템을 돌리는데 응답을 저장할 수 없거나 "대화 기록 공유" 버튼을 제공할 수 없다면, 꽤 큰 제약입니다.

    이 질문의 답은 어김없이 약관 깊숙한 곳에 묻혀 있습니다. 세라믹의 경우, 해서는 안 되는 일을 나열한 목록에서 관련 대목을 찾았습니다.

    (n) 검색 결과, 관련도 점수, 순위를 포함한 Output을 수집, 집계, 저장 또는 취합하여 데이터베이스, 데이터셋, 인덱스 또는 코퍼스를 만들거나 그 구축에 기여하는 행위. 해당 데이터베이스, 데이터셋, 인덱스 또는 코퍼스가 세라믹과 경쟁하는 용도로 쓰이는지 여부는 묻지 않음. (o) Output을 독립된 형태로, 또는 다른 제품이나 서비스의 별도 접근 가능한 구성요소로서 제3자에게 재판매, 신디케이션하거나 달리 제공하는 행위. 다만 Output이 귀하의 애플리케이션 기능에 통합되어 있고, 최종 사용자의 실시간 질의에 부수하며, 최종 사용자나 제3자가 독립적으로 접근, 추출 또는 다운로드할 수 없는 한, 귀하의 애플리케이션 안에서 승인된 최종 사용자에게 Output을 표시하는 것은 허용됨. (p) 해당 Output을 일반적이고 실시간적인 사용 과정에서 승인된 최종 사용자에게 표시하는 데 합리적으로 필요한 범위를 넘어 Output을 보유, 캐시 또는 저장하는 행위. 해당 주문서에서 명시적으로 허용한 경우는 예외.

    https://www.ceramic.ai/terms-of-service

    이런 걸 신경 쓰는 사람이 저뿐인가요?

  2. infogulch HN

    이 부분이 원하시던 예외를 주는 것처럼 보였습니다.

    다만 Output이 귀하의 애플리케이션 기능에 통합되어 있고, 최종 사용자의 실시간 질의에 부수하는 한, 귀하의 애플리케이션 안에서 승인된 최종 사용자에게 Output을 표시하는 것은 허용됨 ...

    그런데 문장이 이렇게 이어집니다.

    ... 최종 사용자나 제3자가 독립적으로 접근, 추출 또는 다운로드할 수 없는 한

    화면에 보이는데 사용자가 추출하지 못하게 하는 게 어떻게 가능합니까? 이렇게 지킬 수 없는 조건을 달아 예외를 무효로 만들 거면, 애초에 예외는 왜 둔 겁니까?

  3. Loquebantur HN

    그러니까 자기들은 웹을 크롤링해서 정보를 훔쳐다 자기 데이터베이스를 채워 놓고, 이제 와서 남들이 그걸 도로 훔쳐 가면 "불법"인 척한다는 거죠?

    인터넷 테크 업계의 이 이상한 태도는 골드러시 때와 닮았어요.

    그럼 원주민은 누구일까요?

  4. pseudosavant HN

    맞아요, 자기들이 만드는 데 아무 기여도 안 한 남의 콘텐츠를 라이선스도 없이 그냥 재배포하면서, 거기에 저작권이나 지식재산권이 생기기라도 한 것처럼 굴잖아요. 앤트로픽의 다리오가 디스틸레이션(distillation)을 막는 규제를 요구할 때마다 짜증이 나요.

  5. thephyber HN

    미국 지식재산권법은 실제로 그렇게 돌아간다는 거, 알고 계시죠?

    모아 놓은 사실 하나하나에는 저작권이 없어도, 그 사실들을 모은 편집물에는 저작권이 있을 수 있어요.

  6. atmosx HN

    그러니까 자기들은 웹을 크롤링해서 정보를 훔쳐다 자기 데이터베이스를 채워 놓고, 이제 와서 남들이 그걸 도로 훔쳐 가면 "불법"인 척한다는 거죠?

    요즘은 이게 "상투적 수법(modus operandi)"인 것 같아요. 누가 정권과 더 가까워져서, 집행할 수 없는 걸 어느 날 갑자기 집행하게 만드느냐는 내기죠. 여러분의 안전을 위해서라면서요. 설마 자동차를 훔치진 않으시겠죠?

  7. Loquebantur HN

    만들어진 "사회적 진실"에 순응하고, 그것이 "상투적 수법(modus operandi)"이라며 안일하게 체념하는 것은 스스로를 자신이 사는 사회 바깥에 두는 일입니다.

    당신은 자신이 통제할 수 없다고 멋대로 단정한 사회적 현실에 스스로를 종속시키고 있습니다. 하지만 그런 현실을 가능하게 한 것도 하다못해 당신의 침묵하는 수용이었습니다.

    도덕적, 윤리적 판단을 애초에 그 판단으로 제약받아야 할 바로 그 사람들에게 맡겨 둘 수는 없습니다.

  8. nkingsy HN

    해법이 사람들한테 잘못된 방식으로 답답해한다고 훈계하는 거였다니, 누가 알았겠어요.

  9. Loquebantur HN

    당신 말고 누가 그런 말을 했죠?

    "답답하다"는 이유로 개인의 책임과 그에 따른 행동을 면제받는 것은 패배주의입니다.

    이전의 시도가 통하지 않았다면 접근법을 바꾸십시오. 접근법이 없다면 찾아내거나 만들어 내야 합니다. 방법을 모르겠다면 그것부터 알아보십시오.

    "답답하니까 아무것도 안 한다"는 태도, 그리고 그 순환논리를 지적하는 사람에게 훈계한다고 반발하는 태도는 패배와 몰락을 보장하는 것 말고는 아무 소용이 없습니다.

  10. debo_ HN

    헤비메탈 기타 코드가 울려 퍼진다

  11. Loquebantur HN

    당신은 자기 몰락을 조롱하고 있습니다. 그걸 즐기게 되리라고 어떻게 그렇게 확신합니까?

  12. slowpoison HN

    무리한 요구는 아닌 것 같습니다. 그쪽에서 크롤링해서 소화하기 쉬운 형태로 제공하는 건데요. 한 번 읽는 값만 내고 그 사본을 가져다 무한정 배포할 수는 없죠. 직접 크롤러를 만들어서 웹을 크롤링하세요. 그리고 원하면 무료로 나눠 주시고요!

  13. Loquebantur HN

    그들이 애초에 데이터를 훔쳤고 출처에 아무런 보상도 하지 않았다는 사실은 슬쩍 넘어가시는군요. 그건 "합리적"이지 않습니다.

    게다가 "쉽게" 제공하는 것도 아닙니다. 온갖 장벽을 세워 놓았고, 장물에 돈까지 내라고 합니다.

    그러면서 전혀 다른 두 상황을 똑같이 놓으시네요. 한쪽은 그런 구조를 쉽게 짜 놓을 수 있는 수십억 달러 규모의 기업이고, 다른 쪽은 (제가 대변하는) 대중인데, 대중은 흔히 궁핍과는 거리가 멉니다.

    그러니 아니요, 여기서 비합리적인 쪽은 당신입니다. 그들도 마찬가지고요.

  14. sroussey HN

    robots.txt를 따르는 검색 엔진도 도둑질이라는 건가요?

    검색 엔진 색인에 올라가기 싫다고, 색인하지 말라고 했는데도 색인했다면 그건 도둑질입니다.

    하지만 "제 콘텐츠를 읽어서 당신네 사용자에게 제공해 주세요"라고 해 놓고 나중에 그렇게 한 걸 도둑질이라고 주장하는 건 좀 뜬금없어 보여요.

    제가 놓치고 있는 게 뭔가요?

  15. BrenBarn HN

    "내 콘텐츠를 읽어서 당신네 사용자에게 제공한다"와 "내 콘텐츠를 읽어서 당신네 사용자에게 제공하는 걸로 돈을 번다"는 다릅니다. 이런 이용 약관은 "이걸로 돈 버는 건 우리뿐이다"라고 말하려는 것이고, 문제는 바로 거기에 있습니다.

  16. sroussey HN

    맞아요, 검색 엔진은 비영리여야겠죠. 그런데 수익을 내려면 사용자를 보내 줘야 하잖아요.

  17. devmor HN

    좋은 지적입니다. 클라우드플레어가 색인한 콘텐츠 중 일부에도 분명 클라우드플레어 같은 약관이 붙어 있었을 텐데, 그건 신나게 무시했을 겁니다.

  18. strbean HN

    그럼 원주민은 누구일까요?

    Geocities와 vBulletin 사용자들이죠!

  19. measurablefunc HN

    데이터가 해자(moat)이고, 컴퓨팅은 비용 항목일 뿐입니다.

  20. DANmode HN

    “지금 보고 계시잖아...”

    • 토니 소프라노
  21. foota HN

    게다가 "해당 Output을 일반적이고 실시간적인 사용 과정에서 승인된 최종 사용자에게 표시하는 데 합리적으로 필요한 범위를 넘어 Output을 보유, 캐시 또는 저장하는 행위"라는 대목은 오래 유지되는 세션에 저장하는 것도 금지하는 걸로 읽힙니다.

  22. simonw HN

    "합리적으로 필요한"이라는 표현은 정말 짜증 날 정도로 모호합니다.

  23. ChuckMcM HN

    아니요, 그리고 웃긴 건 자기들은 "데이터"를 "공짜"[1]로 긁어 가면서 되파는 건 금지한다는 겁니다. 이게 법적으로 효력이 있기는 한지도 저는 모르겠어요. 이 거래의 당사자가 누굽니까? 프로그램 둘이요? 자기 프로그램이 하는 일에 사람이 책임져야 한다면, AI 하는 사람들은 왜 CFAA 위반으로 감옥에 안 갑니까? 네? 다 어딘가 단단히 꼬여 있어요.

    Blekko를 운영할 때는 패치되지 않은 취약점이 있는 WordPress 플러그인이나 쇼핑 카트 패키지를 찾으려고 WordPress 사이트를 크롤링하려는 사람이 정말 많았습니다. 그런데 클라우드플레어가 이걸 어떻게 돈으로 만들고 있는지는 정말 궁금하네요.

    [1] 웹 스크레이퍼가 몰고 오는 크롤링 트래픽을 감당하는 데 비용이 안 든다고 생각하는 사람은 없겠죠.

  24. pclark HN

    저는 업무 때문에 이 부분이 아주 중요한데, 제가 찾아본 곳 중에 결과 저장을 허용하는 곳은 Brave뿐이었습니다(대신 돈을 더 내야 합니다).

  25. cj HN

    저는 이런 건 보통 의도를 따져 봅니다. 그 회사가 왜 약관에 그런 조항을 넣었는지를요. 그걸 기준 삼아 그 회사가 약관을 들어 나를 상대로 집행할 가능성을 가늠합니다.

  26. derac HN

    그건 상대가 하루아침에 판을 뒤집어도 감당할 수 있는 위험 수준까지만 통하는 얘기입니다.

  27. btown HN

    그래서 저는 클라우드플레어를 아무리 좋아해도 이런 건 그쪽 결제로 연결하지 않을 겁니다. 회사 인프라 전체가 멈출 위험이 너무 큽니다. 잘못 설정된 AI가 사기/위험 플래그를 잘못 띄워서 그렇게 될 수도 있고요. 예를 들어 검색 API 제공업체들이 자기네 쪽의 오류 가능성 있는 어뷰징 판정 메타데이터를 클라우드플레어에 되돌려 공유하는 경우도 있겠죠.

  28. sanderjd HN

    혼자가 아니에요. 저도 답답한 제약이라는 데 동의합니다.

  29. phoghed HN

    그냥 허접한 웹 스크레이핑 스타트업이잖아요. 약관 위반하세요, 누가 신경이나 쓴답니까.

  30. writtenone HN

    맞는 생각입니다. 걸릴까 봐 걱정되면 평판 좋은 VPN이나 수백 곳에 달하는 주거용 프록시 업체 중 하나를 쓰면 됩니다.

Hacker News에서 보기 ↗