Rampart: 브라우저에서 기기 안에서만 개인정보를 가려 주는 도구

Rampart: Browser native on-device PII radaction

ndstudio.gov ▲ 82 댓글 31 nateb2022

요약

미국 정부 조직이 브라우저 안에서만 개인정보를 가리는 오픈소스 필터 Rampart를 내놓았습니다.

미국 정부 디자인 조직인 내셔널 디자인 스튜디오가 공개한 도구입니다. AI 업체가 개인정보를 지킨다고 약속해도 밖에서는 검증하기 어렵습니다. 그래서 개인정보가 아예 기기를 떠나지 않게 하는 쪽을 택했다고 설명했습니다.

왜 중요한가

  • 챗봇에 메시지를 보내기 직전에 걸러 내므로 AI 업체 서버가 무엇을 기록하는지 믿지 않아도 됩니다.
  • 기존 개인정보 제거 모델은 너무 커서 웹 앱에 넣기 어려웠는데, 이 문제를 크기로 풀었습니다.
  • 비교 대상인 OpenAI 필터(약 2.8GB)는 10Mbps 회선에서 내려받는 데만 38분쯤 걸린다고 했습니다.

핵심 내용

  • 사회보장번호·카드 번호·전화번호 같은 정형 정보는 검증 규칙을 붙인 정규식으로 잡습니다.
  • 규칙으로 예상하기 어려운 이름과 주소는 14.7MB짜리 소형 언어 모델(MiniLM)이 문맥으로 찾습니다.
  • 찾은 값은 [SSN] 같은 자리표시자로 바꿔 보내고, 원래 값은 기기에 두었다가 답변에서 되살립니다.
  • 7개 언어 3만 건 평가에서 재현율(가려야 할 정보를 찾아낸 비율)이 98.42%로 OpenAI Privacy Filter(97.4%)보다 높았다고 밝혔습니다.
  • 아직 알파 단계이고 라틴 문자 7개 언어만 지원해, 완전한 해법이 아닌 첫 방어선이라고 했습니다.

HN 반응

  • 98.4%로는 개인정보 가리기라 부르기에 부족하고, 따로는 무해한 정보가 모여 신원을 드러내는 경우는 이런 필터로 막을 수 없다는 지적이 이어졌습니다.
  • 정부라면 챗봇에 사회보장번호를 넣지 말라고 알리고 AI 회사의 저장을 규제하는 게 먼저라는 비판과, 개발자가 무료로 쓸 수 있는 개선이라는 옹호가 맞섰습니다.

댓글

30개 표시 · 전체 31개
  1. dwa3592 HN

    저는 이 분야에서 일했고, https://github.com/deepanwadhwa/zink 패키지를 만든 사람입니다.

    정부가 만든 거라서 몇 가지가 눈에 띕니다.

    • 이 문제에서 가장 손쉬운 해법은 시민들에게 금전적 피해나 신원 도용으로 이어질 수 있는 개인 정보를 챗봇에 공유하지 말라고 분명히 알리는 것입니다. 그런데 페이지에 나온 예시는 아파트를 찾는 데 도움을 받으려고 챗봇에 사회보장번호를 알려 주는 사람입니다. "My name is Maria Garcia, my Social Security number is 123-45-6789, and I make $1,950 a month. Can you help me find affordable housing?"(제 이름은 마리아 가르시아이고, 사회보장번호는 123-45-6789이며, 월수입은 1,950달러입니다. 저렴한 주택을 찾도록 도와주실 수 있나요?) 대체 왜요?? 정부라면 시민들에게 정반대로 조언할 거라고 기대하잖습니까.

    • 좋은 정책은 늦은 법이 없습니다. 정부는 HIPAA와 다른 개인정보 보호법을 AI 기업에까지 확대 적용했어야 합니다. 사용자가 아무리 어리석어도 AI 기업은 누구의 사회보장번호도 저장해서는 안 됩니다. 저장하지 않을 책임은 AI 기업에 있어야 하고, 그러니 이런 계층은 AI 기업 쪽에 있어야 합니다.

    • 기술적인 문제도 있습니다. 준식별자(quasi identifier)라는 것이 있는데(제 패키지가 겨냥하는 부분입니다), 이건 점근적으로 다루기 어렵습니다. 프라이버시를 노출할 수 있는 걸 전부 지우면 텍스트가 의미를 잃는다는 뜻입니다. Rampart도 이 문제는 해결하지 못할 것 같고, 그 점은 웹사이트에 분명히 밝혀야 한다고 생각합니다.

  2. bberenberg HN

    말씀하신 내용은 모두 타당하다고 생각합니다. 하지만 정부가 애플리케이션 개발자들이 지금보다 조금 더 나은 수준을 갖추도록 무료로 쉽게 도와주려 한다는 사실은 그대로입니다. 완벽하지 않더라도 그 자체로 칭찬할 만한 일입니다.

  3. prometheus1992 HN

    위 댓글에서 제가 이해한 바로는, 정부가 해결책부터 만들겠다고 뛰어들기 전에 기본적인 정책부터 마련해야 한다는 겁니다. AI 기업 등에 협상의 여지가 없는 조건을 먼저 정하라는 거죠. 기술적인 해결책은 시장이 알아서 찾게 두고요.

  4. iAMkenough HN

    OP의 공동 저자가 오래 지켜 온 보안 관행을 어기고, 적절한 감독도 없이 사회보장 데이터베이스를 보안이 허술한 AWS 인스턴스에 복사했다는 점이 흥미롭네요.

    이걸 개발하려고 세금으로 월급 받는 개발자가 연방 데이터 보안 규정도 따르지 않은 채 우리의 개인식별정보(PII)를 민간이 운영하는 일반 소비자용 서드파티 서버에 올렸다면, 그래도 칭찬할 만한 일일까요? 자기가 낸 피해를 만회하려는 시도로밖에 안 보입니다.

    내부에 AWS에 해당하는 환경을 직접 구축하는 건 그리 어려운 일이 아닙니다. 그런데 이 개발자의 개인적인 선택과, 민감한 정부 데이터가 외부에 공개되는 걸 막을 감독이 없었던 탓에 PII가 공개 서비스로 새어 나갔습니다.

    게다가 이렇게 나온 결과물은 퍼블릭 도메인(CC0)으로 공개되지도 않았습니다.

  5. applesauce3572 HN

    그 지적은 전적으로 공정합니다. 깊은 개인 정보를 공유하는 문제에 관해서는 일종의 회색지대인데, 그쪽은 아예 대충 넘어가는 것 같습니다.

  6. stuaxo HN

    그 환상적인 메가드라이브 게임 Rampart와는 아무 상관이 없다니, 아쉽네요.

  7. bob1029 HN

    저는 은행 고객들에게 이런 접근 방식을 소개한 적이 있는데, 여전히 별로 관심을 보이지 않습니다. 이 사람들을 만족시키는 건 데이터 보존 제로(ZDR)와 원천에서의 결정적(deterministic) 마스킹뿐입니다. 임의의 문자열 리터럴에 정규식을 돌리는 건 이 맥락에서 결정적이라고 할 수 없고요.

    서비스가 최종 고객과 나누는 자연어 대화를 다룬다면, 나머지를 다 망치지 않고서는 가끔 생기는 PII 유출을 막을 방법이 별로 없습니다. 투자자들이 바라는 대로 마법 같은 AI 경험이 제대로 돌아가길 정말 원한다면, ZDR이 최선의 완화책입니다.

    PII는 그 자체로는 PII로 취급되지 않는 여러 상관 요인이 합쳐져서 드러나는 경우가 많습니다. 아무리 완벽한 AI 시스템이라도 이런 관계를 전부 포착할 수는 없습니다. 몇 년 치 제 HN 댓글을 충분히 오래 분석하면 제가 사는 곳을 반경 20마일 안으로 짚어낼 수 있을 겁니다. 그 댓글 중 어느 하나도 단독으로는 PII 필터에 걸리지 않을 거고요.

  8. sscaryterry HN

    "radaction"은 도저히 못 봐주겠네요.

  9. nhinck2 HN

    98.4%로는 PII 마스킹이라고 부르기에 턱없이 부족합니다.

  10. iAMkenough HN

    그래서 OP의 공동 저자인 big ballz가 DOGE의 스타링크 단말기를 통해 우리 PII를 보안이 허술한 AWS 인스턴스에 올렸던 거군요.

    https://www.csoonline.com/article/4046997/whistleblower-doge-put-social-security-database-covering-300-million-americans-on-insecure-cloud.html

  11. throw03172019 HN

    채팅 입력창의 일반 텍스트는 문제의 일부일 뿐입니다. PII로 가득한 PDF나 문서 같은 파일은 어떻게 하나요?

  12. simontwiggyahuk HN
  13. handfuloflight HN

    국가디자인스튜디오(National Design Studio)는 왜 읽을 수 있는 글을 전부 페이지 오른쪽 열에 몰아넣어야 한다고 생각했을까요?

  14. swiftcoder HN

    우리한테 정말 필요한 건 영상용 PII 마스킹 모델인데요...

  15. Cider9986 HN

    소스 코드는 퍼블릭 도메인이어야 하는 거 아닌가요?

  16. 22c HN
  17. iAMkenough HN

    LICENSE 파일은 오류가 납니다. https://github.com/nationaldesignstudio/rampart/blob/master/LICENSE

    CC BY 4.0은 CC0(퍼블릭 도메인)과 다릅니다. https://creativecommons.org/public-domain/

  18. Onavo HN

    이 정도면 HIPAA를 충족하기에 충분한가요?

  19. fwip HN

    아니요.

  20. Onavo HN

    AI 헬스테크 업체 상당수가 쓰는 기법인데요.

  21. estearum HN

    무엇이요? 이건 HIPAA가 요구하는 수준에 한참 못 미칩니다.

  22. Onavo HN

    임상 의사결정 지원 AI 도구 상당수는 사실상 프런트엔드에서 PHI 데이터를 지웁니다.

  23. estearum HN

    PHI는 PII와는 다른 데이터 항목들이에요, 친구.

  24. Onavo HN

    같은 기법이면 충분합니다.

  25. estearum HN

    그래서 "이 기법"이 무슨 뜻이냐고 물었던 겁니다.

    질문이 "클라이언트 측 비식별화만으로 HIPAA를 충족하기에 충분한가"라면, HIPAA가 비식별화하라고 요구하는 데이터 항목을 비식별화한다는 전제 아래서는 그렇다고 할 수 있습니다. 다만 이런 걸 믿고 의존한다면 정말 엄청난 바보일 겁니다.

    질문이 "블로그 글에 설명된 이 라이브러리가 HIPAA에 충분할 만큼 데이터를 비식별화하는가"라면, 아니요, 그렇지 않은 것 같습니다.

  26. fwip HN

    PHI를 지우는 데 주로 이런 종류의 도구에 의존하고 있다면, 이미 규정을 지키지 못하고 있다고 단언할 수 있습니다.

  27. sgnelson HN

    회의적인 저로서는 지금 정부가 제 정보를 지켜 줄 거라고는 도저히 믿기 어렵습니다.

  28. BowBun HN

    이 경우에는 굳이 믿을 필요가 없으니 다행이죠. 소스가 공개되어 있습니다. https://github.com/nationaldesignstudio/rampart

    모델이 뭔가 딴짓을 할 수도 있겠지만, 소스를 받아서 모델을 직접 만든 걸로 바꿔 끼울 수도 있잖아요.

  29. Cider9986 HN

    정보가 온라인으로 옮겨 온 뒤로 미국 정부가 우리 정보를 지켜 줄 거라고 믿어 본 적은 한 번도 없습니다.

  30. goodmythical HN

    로컬에서 실행할 수 있으니 꼭 믿어야 하는 건 아니죠. 모델을 통한 공격 벡터 CVE가 나온 적이 없다면요.

    아직 그런 일은 없었죠? HF에서 받은 모델을 그대로 실행하기만 해도 머신이 장악되는 경우 말이에요. 모델이 나중에 탈출이나 데이터 유출을 시도하는 것 말고요.

    그렇다고 해도 세금 신고를 하거나 '진짜' 신분증이 있는 사람이라면, 정부는 고의로든 유출로든 우리를 엿먹이는 데 필요한 정보를 이미 다 갖고 있으니, 뭐...

Hacker News에서 보기 ↗