필라델피아 인콰이어러가 동네 소식을 찾아내는 AI 도구 Scrape를 만들었습니다

The Philadelphia Inquirer built Scrape, an AI tool to surface hyperlocal news

lenfestinstitute.org ▲ 82 댓글 29 giuliomagnifico

요약

필라델피아 인콰이어러가 흩어진 동네 소식을 AI로 걸러 내는 Scrape를 뉴스레터 제작의 핵심 도구로 키웠습니다.

렌페스트 연구소가 펴낸 사례 연구입니다. 연구소의 AI 펠로로 인콰이어러에 파견된 케빈 호프먼이 지역 뉴스레터 편집자의 자료 찾기 부담을 덜려고 개발을 이끌었습니다.

왜 중요한가

  • 편집자 한 명이 매주 12시간가량 하던 자료 찾기를 AI가 맡아, 더 넓은 지역을 다룰 수 있게 됐습니다.
  • 막연한 "뉴스 가치" 대신 편집자의 기준을 구체적으로 적어 줘야 AI가 쓸모 있다는 점을 보여 줍니다.
  • AI는 기삿거리를 찾는 일만 맡고, 편집자는 고르고 다듬는 일에 시간을 쓰게 됐습니다.

핵심 내용

  • 지자체 회의, 학교 일정, 페이스북 페이지처럼 잘게 흩어진 출처를 매일 훑어 제보 목록(팁 시트)을 만듭니다.
  • 처음 쓴 지역 기준 필터와 일반적인 "뉴스 가치" 프롬프트는 편집자가 늘어나자 통하지 않았습니다.
  • 대신 뉴스레터마다 독자층, 다룰 지역과 뺄 지역, 학군, 관심 주제를 적은 편집 지침을 넣었습니다.
  • 편집자들이 3~4개월 동안 결과에 쓸모 여부를 표시해 연기된 회의나 일상적인 도로 통제 같은 잡음을 걸렀습니다.
  • 지금은 뉴스레터 6개를 지원하고 8개로 늘릴 예정이며, 기자 20명가량이 결과를 받아 봅니다.

HN 반응

  • 동네 단위의 AI 저질 글만 늘 것이라는 우려에, 기사를 쓰는 게 아니라 기삿거리를 찾는 도구일 뿐이라는 반박이 나왔습니다.
  • 작은 지역인데 검색 비용이 왜 크냐는 의문에는 지자체마다 공개 방식이 제각각이라 공통 표준이 필요하다는 의견이 이어졌습니다.

댓글

29개 표시 · 전체 29개
  1. syntaxing HN

    이거 정말 마음에 드네요. 제가 너무 낭만적으로 보는 걸 수도 있지만, 이런 도구가 지역 뉴스가 싱클레어 브로드캐스팅(Sinclair Broadcasting) 같은 독점 기업에 맞설 기회가 되어 줬으면 좋겠어요.

  2. cyanydeez HN

    결국 초지역(hyper local) 봇이 초지역 슬롭(slop)을 찍어내는 걸로 끝날 겁니다. 미디어 환경은 내리막길이에요.

  3. ChrisMarshallNY HN

    제 생각엔 그냥 취재 단서를 찾아주는 용도예요. 신문사가 AI로 기사를 쓰거나 편집하기로 한다면, 그건 또 다른 얘기고요.

  4. binarymax HN

    검색 요약도 슬롭인가요?

  5. phoghed HN

    너무 많은 사람이 "슬롭"을 "AI가 만든 것"과 같은 말로 쓰는 바람에, 이제 용어로서 쓸모가 없어지고 있어요.

  6. Forgeties79 HN

    결과물이 그렇게 자주 엉성하지만 않아도 슬롭이라고 부르지 않을 텐데요.

  7. phoghed HN

    알고 보니 슬롭은 엄청 유용하고, 값지고, 맛있더라고요.

  8. Forgeties79 HN

    여기엔 단서와 조건이 아주 많이 붙어야죠.

  9. ginko HN

    네.

  10. binarymax HN

    무조건 "네"라는 뜻이 아닙니다. "때에 따라서는"이라는 뜻이고, 그 "때"는 쓰임새에 달려 있습니다. 하루치 조사 내용을 간추리는 것은 AI의 가장 좋은 용도 중 하나입니다.

  11. irishcoffee HN

    우리 열두 살짜리가 그러는데, 친구들끼리 실수하면 농담으로 "아 나 AI했네"라고 한대요. 그런데 AI가 하루치 정보를 100% 정확하게 간추려 줄 거라고 믿으십니까? 사춘기 전 아이들조차 AI가 얼마나 믿을 수 없는지 이미 아는데요?

  12. binarymax HN

    인용 출처가 함께 나오고 요약이 그 인용과 잘 맞아떨어진다면 괜찮습니다. 다시 말해 요약이 다시 쓴 글이 아니라 핵심만 짚어 준 것이라면 저는 만족합니다. 이 문제를 폭넓게 연구했고 관련 지표도 직접 만들었습니다: https://maxirwin.com/articles/llm-rag/

  13. irishcoffee HN

    그러니까 전체 데이터를 직접 검토한다는 거네요? 그럴 거면 그냥 요약을 직접 쓰는 게 낫지 않습니까?

    저도 "AI"를 많이 씁니다. 훌륭한 도구예요. 하지만 이제 AI가 만병통치약인 것처럼 구는 건 그만해야 합니다. 도구일 뿐입니다.

  14. Forgeties79 HN

    저도 "AI"를 많이 씁니다. 훌륭한 도구예요. 하지만 이제 AI가 만병통치약인 것처럼 구는 건 그만해야 합니다. 도구일 뿐입니다.

    저도 몇 달째 이 말을 조금씩 바꿔 가며 반복하고 있습니다. 사람들이 AI를 모든 일에 항상 통하는 기술적 해결책인 양 떠받드는 걸 멈춘다면, 비판하는 사람 상당수가 잠잠해질 거라고 생각해요. 과대광고에 이제는 지칩니다. 그것도 몇 년째 계속되고 있고요.

    며칠 전에 GPT가 제 계산을 틀렸습니다. TRT(총 상영 시간) 때문에 시간 10개를 더하던 중이었어요. HH:MM:SS 입력 몇 개를 더하는 건데, 귀찮은 작업이라 마침 열려 있던 GPT에 맡겼죠.

    답이 틀려서 틀렸다고 말해 줬더니 또 틀렸습니다. 그래서 궁금한 마음에 정답을 알려 주고 원래 숫자와 대조해서 확인해 보라고 했더니 "맞습니다, 정답은 [아까 그 틀린 답]입니다"라고 하더군요.

    이런 일이 모델을 가리지 않고 제 경험상 10~15% 정도는 일어납니다. 수학만이 아니라 아주 단순한 일에서도요. 3~4년 동안 "하이퍼스케일링"하고 과대광고를 해 온 지금까지도 이런 걸 보고 있다니 기가 막힙니다. 저 같은 사람이 물에 한두 발만 담근 채 더 깊이 들어가지 않는 이유가 바로 이런 거예요.

  15. Zambyte HN

    "100% 정확한" 요약이 대체 무슨 뜻입니까? 말이 안 되는 소리 같은데요. 요약의 가치는 근본적으로 "이 정도면 충분하다"에서 나오는 것이지, 완벽함에서 나오는 게 아닙니다.

  16. ToucanLoucan HN

    말씀하시는 큰 줄기에는 동의하지만 한마디만 하자면, 제 경험상 LLM이 자료를 직접 찾아야 할 때보다 요약할 자료를 건네줄 때 환각 비율이 엄청나게 떨어집니다. 요약해 달라는 자료를 요청할 때 함께 줬다면 큰 환각을 겪은 적이 한 번도 없어요.

    그보다 더 멀어지면, 예를 들어 그때까지 나눈 대화를 요약하는 경우만 해도 훨씬 위태로워지지만요.

  17. jasonlotito HN

    기사를 안 읽었다는 말을 참 길게도 하시네요.

  18. 1-6 HN

    제가 사는 곳의 지역 방송국은 선정적인 헤드라인과 클릭 수로 돈을 벌려고 나라 반대편의 이슈에 집중하기 시작했어요... 지역 뉴스를 개선하려는 움직임이 있다니 반갑습니다.

  19. ChrisMarshallNY HN

    꽤 멋지네요.

    누군가 이걸로 대체될 수 있다는 점이 단점일 수 있겠지만, AI를 아주 제대로 활용한 사례로 보입니다.

    사실 취재 단서 찾기는 LLM에 딱 맞는 일 같아요.

  20. mmooss HN

    초기에 팀은 작고 흩어진 여러 출처를 검색하는 데 드는 높은 비용과 품질 사이에서 균형을 잡으려 했다. 그들은 프롬프트로 검색의 깊이와 동작을 암묵적으로 제어할 수 있다는 것을 알아냈지만, 그것도 시행착오를 거친 뒤였다.

    여기서 말하는 비용이 이해가 안 됩니다. 출처 수는 비교적 아주 적을 텐데요. 일반적인 인터넷 검색도 아니고요. 긁어오는 데이터 양도 비교적 아주 적어 보입니다. 펜실베이니아의 교외 카운티에 데이터가 얼마나 있겠어요?

  21. linkjuice4all HN

    필라델피아 지역은 미국 인구의 약 2%를 차지하고, 뉴저지 남부와 델라웨어 북부를 포함하는 경우가 많으며 메릴랜드 일부와도 맞닿아 있습니다. 게다가 제3순회 항소법원과 여러 주 정부·연방 기관도 거기 있어서, 소유 주체가 서로 다른 연결 안 된 시스템이 많아요.

    우리 괴짜들은 공통 표준을 만드는 데 실패했고, 우리 유권자들은 우리 삶을 좌우하는 수많은 회의, 문서, 협약 등을 모두 드러내도록 정보공개법(FOIA)을 확대하는 데 실패했습니다. 그 결과 그 틈을 메우겠다고 아마 형편없이 해낼 AI 스크레이핑 도구에 의지하게 된 거죠.

  22. mrweasel HN

    카운티 하나만 보면 아마 데이터가 많지 않겠지만, 필라델피아 같은 곳의 모든 카운티로 곱하면 많아집니다.

    보통은 신문에서 다루지 않는 데이터, 회의, 행사 같은 게 있습니다. 관련된 사람이 몇천 명밖에 안 되기 때문인데, 그 몇천 명에게는 아주 중요할 수 있죠.

    제가 사는 도시도 웹사이트에 많은 걸 게시하지만, 찾기 어렵고 관련된 사람은 천 명쯤이거나 그보다 적습니다. 교육위원회 회의, 공공 유틸리티 회사, 그리고 기업 전반이 방대한 정보를 게시하지만 드러나지 않고 있고, 그 인근에 사는 사람들에게는 의미가 있습니다. 이 모든 것을 모아 분류하고, 관련성을 평가해 초지역 뉴스를 만들어 낼 수 있다면 풀뿌리 지역 운동과 지역 현안, 선거 참여에 큰 힘이 될 수 있습니다.

  23. thephyber HN

    경우의 수가 늘어나는 게 문제라는 데는 동의하지만, 정리 방식은 아주 간단할 수 있습니다. 주에서 모든 지방자치단체가 웹사이트의 sitemap.xml처럼 표준 색인 파일 형식을 쓰도록 의무화하면 돼요.

    주, 카운티, 투표구를 가로질러 선거 결과를 표준화하는 커뮤니티 운영 프로젝트가 있습니다. 지역 정보 공개의 본보기가 될 수 있을 거예요.

  24. nemomarx HN

    그 표준 색인 파일에 대한 문서가 있나요? 펜실베이니아 정부 페이지에서 그걸 설명하는 걸 본 기억이 없어서요.

  25. tclancy HN

    저는 얼마나 다양한 종류의 콘텐츠를 봐야 하느냐가 더 큰 문제라고 봐요. 공개된 구글 캘린더, 페이스북 이벤트 페이지, 개인 사이트 등등 말이죠.

  26. FL410 HN

    그 결과: Scrape는 작은 실험에서 “하중을 떠받치는 핵심 인프라”로 발전했다

    제발 풍자였으면 좋겠네요.

  27. scottyeager HN

    저도 이 대목에서 눈썹이 확 올라갔어요 :D

  28. dec0dedab0de HN

    philly.com을 닫아 버린 건 아직도 짜증이 나요.

  29. calvinmorrison HN

Hacker News에서 보기 ↗