AI가 바로 쓸 수 있는 생물학 데이터: 전 세계 18억 달러 투자 약속

AI-ready biological data: $1.8B global commitment

biohub.org ▲ 133 댓글 19 ray__

요약

바이오허브와 미국 정부, 빅테크가 AI 학습용 공개 세포 데이터에 18억 달러를 모읍니다.

생명과학 연구기관 바이오허브와 미국 에너지부(DOE), 국립보건원(NIH)이 10월 7일 발표했습니다. 목표는 세포가 외부 개입에 어떻게 반응할지 예측하는 AI 모델이고, 이를 위해 표준화된 공개 데이터를 대규모로 만듭니다.

왜 중요한가

  • 연구실마다 따로 모은 데이터 대신 같은 기준으로 만든 데이터를 누구나 AI 학습에 쓸 수 있게 됩니다.
  • 정부 기관과 구글 딥마인드·메타 같은 기업, 주요 연구소가 하나의 데이터 공유 체계로 묶였습니다.
  • NIH는 실험을 컴퓨터에서 먼저 해 보는 '가상 세포' 모델이 의학 발전을 앞당길 수 있다고 봤습니다.

핵심 내용

  • 바이오허브는 5억 달러를 내고, 이 가운데 4억 달러를 새 측정·공학 기술 개발에 씁니다.
  • 에너지부는 제네시스 미션을 통해 5년간 5억 달러 넘게 측정과 모델링, 컴퓨팅에 투자합니다.
  • 구글 딥마인드, 아이소모픽 랩스, 메타가 합쳐 3억 달러를 내고, 엔비디아는 컴퓨팅을 지원합니다.
  • NIH는 연방 예산 5억 달러 이상으로 쌓은 기존 데이터를 내놓고, 바이오허브가 이를 표준화합니다.
  • 극저온 전자 단층촬영(세포 내부를 원자에 가까운 수준으로 보는 기법)과 대규모 세포 현미경 데이터도 새로 만듭니다.

HN 반응

  • 병목은 컴퓨팅이 아니라 실험 데이터였다며 반기는 의견이 나왔고, 같은 시료를 여러 방식으로 함께 재야 연구실 간 잡음이 줄어든다는 보충이 붙었습니다.
  • 반면 현 미국 행정부가 연구에 중요한 공개 데이터를 내리고 있다며 엇갈린 정부 행보를 꼬집는 댓글도 있었습니다.

댓글

15개 표시 · 전체 19개
  1. ricksunny HN

    기사가 홍보 자료에서 별로 알려지지 않은 biohub를 (훨씬 유명한) NIH, DoE와 나란히 세워 놓고는 빼먹은 게 있는데, biohub는 저커버그가 벌인 사업이라는 거예요. 그러니까 여러분의 생물학 데이터가 페이스북, 인스타그램 계정과 떼려야 뗄 수 없게 묶인다고 상상해 보세요. 거부할 수는 있다지만 사실상 못 하는 방식으로요.

  2. thatsabadlook HN

    네, 저도 그 생각을 했어요. 그러다 이게 다른 데서는 어떻게 쓰일지도 생각해 봤죠. 정신 건강 문제, 중독, 질병 같은 걸 예측하는 모델은 마케팅에 악용하기 딱 좋은 데이터예요. 그러다 결국 건강보험과 생명보험 회사들이 규제가 충분히 풀리거나, 벌금을 내서라도 돈을 더 쥐어짜려 들겠죠. 그리고 운이 좋으면 언젠가는 우생학 시도와 특정 대상을 겨냥한 생물무기까지 나올 거고요. 와, 신나네요.

  3. randomdrake HN

    (현재는) 보조금을 받아 싸게 풀린 AI 업체들의 구독에서 남는 크레딧을 모아, 이런 공동의 목표에 보태 쓰는 SETI@Home 후속 같은 걸 만들어 볼까 하는 생각을 만지작거리고 있었습니다.

    앞으로 이렇게 자원을 함께 모을 기회가 또 있을지 궁금합니다.

    저는 개발도상국 사람들이 무료로 AI 응답을 받을 수 있게 해 주는 작은 프로토타입을 만들어 봤습니다. 그런데 이런 일에 다 같이 노트북과 구독을 투입할 수 있다면 정말 멋질 것 같습니다.

  4. randomdrake HN

    조금 찾아보니, 제가 만들던 것과 비슷한 방향으로 BOINC[0]와 AI Horde[1]가 있더군요. NVIDIA PAIR[2]도 로컬 네트워크용 분산 추론을 연구하고 있는 모양입니다.

    [0] - https://boinc.berkeley.edu/

    [1] - https://aihorde.net/

    [2] - https://www.nvidia.com/en-us/ai-on-rtx/personal-ai-router/

  5. oefrha HN

    계정 정지당하기 딱 좋은 방법이네요... 제 Claude 계정도 한번 영문도 모른 채 정지됐다가 사흘 뒤에 역시 영문도 모른 채 복구된 적이 있습니다. 재판매나 공유를 한 것도, 민감한 질문을 한 것도 아니었는데 말이죠. 그러니 이용약관을 대놓고 어기는 건 위험이 더 클 겁니다. 오탐으로 정지시키는 건 전혀 개의치 않는 것 같고, 일단 정지되면 하소연할 곳도 전혀 없으니까요. 고객 지원이라는 게 AI 챗봇인데, 그 챗봇 페이지마저 정지 안내 페이지로 리디렉션될 뿐이라니까요 ㅋㅋ

  6. randomdrake HN

    맞는 말씀입니다. 저도 PoC 단계를 넘기지는 못했습니다. 다만 로컬에서 돌리는 모델로 같은 일을 하는 것도 구현해 봤습니다. 요청이 들어오면 지금 놀고 있는 머신으로 넘기고, 그 머신이 응답하는 방식입니다.

    보조금 덕에 싼 구독에서 돈은 냈는데 안 쓰고 남는 크레딧도 이렇게 쓸 수 있으면 좋겠다는 생각은 했습니다. 하지만 맞아요, 계정이 막히는 건 "만약"이 아니라 "언제"의 문제겠죠.

  7. arcanemachiner HN

    도움이 필요하다고 주장하는 사람들에게 나눠 주기보다는, 모두가 혜택을 볼 수 있는 공개 합성 학습 데이터를 만드는 쪽이 낫지 않을까 싶습니다. 그런 방식의 시스템은 며칠 안에 악용당하고 남용될 테니까요.

  8. soltanov HN

    여기서 병목은 애초에 컴퓨팅이 아니었습니다. 고처리량 웻랩(wet-lab) 텔레메트리와 표준화된 멀티모달 그라운드 트루스(ground truth)가 병목입니다. 래퍼 레이어를 더 얹는 데 쓰지 않고 실제 데이터 확보에 자금이 흘러가는 건 반가운 일입니다.

  9. zhaoziyuan2000 HN

    표준화된 멀티모달 그라운드 트루스가 무슨 뜻인지 설명해 주실 수 있을까요?

  10. soltanov HN

    똑같은 조건에서 동일한 시료 하나를 대상으로 쌍을 이루는 측정값을 얻는 것입니다. 예를 들어 공간 전사체학, 단백질체학, 형태학 데이터를 서로 정합(co-registration)해 놓은 것이죠. 그러면 모델이 연구실마다 다른 배치 노이즈에 과적합되는 걸 막을 수 있습니다.

  11. peter_retief HN

    우리는 우리 데이터를 우리가 소유하면서 공공의 이익을 위해 쓰이도록 허용할 수 있어야 합니다. 안타깝게도 사람들은 그 개념도, 가치도 잘 이해하지 못합니다. 우리는 오픈소스를 하는 사람들이고, 우리를 지켜 줄 좋은 오픈소스 법이 필요합니다.

  12. Fomite HN

    한편 현 행정부는 연구에 꼭 필요한, 예전에는 공개돼 있던 데이터셋을 적극적으로 내리고 있죠.

  13. swframe2 HN

    점점 더 어려워지는 바이오 AGI 대회가 필요해요.

  14. m3kw9 HN

    그 RSI를 여기에 써서 마음껏 돌려 보자고요.

  15. redanddead HN

    괜찮을 것 같네요

    Mayo Clinic의 데이터 지원 사업 같은 거죠.

Hacker News에서 보기 ↗