2014년 3월 23일 일요일

[e-Discovery ⑨] TAR 활용한 현실적 소송전략 수립

TAR, 소송 전략수립과 직결된 문서 좀더 빠르고 많이 찾아낼 수 있어
TAR은 Technology Assisted Review의 줄임말로써, 기계학습(Machine Learning)을 통해 해당 사안과 관련성이 높은 문서를 순위화(혹은 서열화) 하는 과정을 말한다. TAR은 Predictive Coding으로도 불리우는데 TAR이 Predictive Coding을 포함하는 개념으로 볼 수 있다.

TAR은 사람이 눈으로 직접 검토하던 ESI의 검토 방식과 각종 필터링이나 키워드 검색 등 컴퓨터를 이용한 분석 과정에서 시간과 비용의 문제를 야기시키는 문제점 등을 연관성 분석등 수학적인 알고리즘으로 분석함으로써 검토과정에서 소송의 전략수립과 직결된 문서를 좀더 빠른 시점에서 더 많이 찾아낼 수 있도록 고안되었다.

e-Discovery도 정보통신 기술의 발달과 함께 비약적으로 성장하였고, e-Discovery에 활용되는 새로운 기술들도 많이 등장하였다. 2007년의 Near DeDuplication, 2009년의 ECA(Early Case Assessment) 기능처럼 당시에는 획기적인 기능으로 제안되었으나, 현재는 검토 소프트웨어에서의 표준기능으로 자리잡을 정도로 e-Discovery분야도 상당히 급속한 발전을 거듭하고 있다.

기존의 e-Discovery 관련 소송에서 방대한 양의 ESI 중 필요한 문서를 선별하는 작업은 일반적인 키워드 검색과 같은 기계적인 방법에 의존할 수밖에 없었다. 그러나 이러한 방법은 소수의 법무전문가와 해당 안건을 담당하는 담당자의 기억에 의존하여 소송에 필요한 정보를 충분히 반영하지 못하는 경우가 많았고, 이로 인해 필요한 결과를 도출하는 작업에 어려움이 많았다.

TAR은 해당 과정에 숙련된 법무전문가가 표본(혹은 Seed로 불리우는)을 검토하는 과정에서 검토 솔루션의 TAR 기계 학습 재료에 그 표본을 반영하여 검토된 결과를 기준으로 전체 문서에 대한 관련성를 기준으로 서열을 정리한다. TAR을 이용하면 서열화된 문서 중 순위가 높은 상위의 문서를 우선 검토함으로써 안건에 연관성이 높은 문서를 조기에 다량으로 찾아낼 수 있어 현실적인 소송 전력수립이 용이해진다.
 
 


TAR에서 가장 핵심이 되는 ‘기계 학습’은 우리가 온라인 쇼핑몰에서 추천 상품이 나오는 것과 같은 원리이다. 온라인 쇼핑몰에서 특정 장르의 음악을 자주 구매하는 사용자에게 관련성이 높은 음반을 제안하는 것은 사용자 개개의 구매 이력 등을 분석하여 이를 참고하는 경우가 많다. 예전에는 일방적으로 쇼핑몰이 팔고 싶은 제품을 제안하는 일방적인 구조가 많았지만 최근에는 고객의 구매 이력을 통해서 충분히 관심을 가지고 있을 법한 제품을 제안하면서 제품의 구매로 이어지는 확률이 높아지게 되었다.

그러한 기술들은 제작사별로 다양한 수학적인 알고리즘을 통해서 기계에게 Seed를 분석하게 하도록 하고 있는데, 이러한 기술들은 대개 언어의 고유한 특성을 기반으로 하고 있으므로, 제품의 선택에 중요한 검토 요소라고 할수 있다.

◇TAR가 등장하기 이전의 e-Discovery 대응 절차
기존의 e-Discovery 대응절차는 변호사가 제시한 키워드를 솔루션에서 요구하는 Syntax에 맞춰 각 Keyword별로 어느 정도의 문서가 검출되는지를 확인한 후 키워드의 조합을 결정하여 검출된 문서로 리뷰를 진행한다.

TAR가 등장하기 전까지 Conceptual Search나 Manual Review등의 방법이 제시되었지만 대부분은 재래식 키워드 검색을 그대로 사용하는 경우가 많아 근본적인 해결책을 제시하지는 못했다. 파일의 암호화나 네트워크의 고도화가 이루어지기 전에는 데이터의 양이 많지 않았고, 파일을 처리하는데 검토해야 할 요소들이 상대적으로 적었으므로 윈도우의 검색(인덱싱된)이나 dtSearch 등의 기술들이 자주 사용되었다.

그러나 훈민정음, 아래하한글, MS오피스 2010버전에 이르러 인덱싱된 파일이 등장하고, 검색해야할 분량들이 늘어남에 따라 검색에 앞서 데이터를 잘 분류해야하는 기능에 대한 검토가 생겨나고 있는 추세이다.

초기의 검색은 인덱싱된 데이터 속에서 키워드를 'OR'로 나열하는 방식이 일반적이었기에 검색 결과가 불필요하게 많거나 관련성이 낮은 데이터가 검출되는 경우가 많았다. 이때는 자료들을 검토자들이 나누어서 보는 형태의 일반적인 문서 검토 공정이 진행되어 분석 과정이 다소 노동 집약적이었으며, 인건비로 인해 비용이 상당히 가중되는 경향이 있었다.

설문조사에 따르면 " 사내 변호사중 응답자의 92%가 소송의 규모가 작년과 비슷하거나 증가될 것으로 보고 있으며, 응답자중 31%는 적어도 한 개 이상의 소송은 2천만불 정도의 비교적 큰 소송에 직면하고 있다고 답변했는데 이는 과거보다 소송의 양상이 점점 Discovery 비용의 관리 또한 중요하게 봐야 할 부분으로 인식되어진다고 볼 수 있다.

◇TAR이후 나타나는 새로운 소송대응 전략은 어떠한가?
컴퓨터가 검토자의 할 일을 완전히 대체한 것은 아니지만, 상대적으로 예전의 소송 대응과 비교하면 상당 부분에서 인력의 투입이 감소되었다. 또한 지금까지 드러나지 않고 있는(하지만 상당히 높은 빈도로 발생하던) 엔지니어에 의한 문제를 대부분 극복할 수 있게 되었다.

EDBP(Electronic Discovery Best Practice)에서는 TAR을 기본 절차의 하나로 제시하고 있으며, 그에 따라 법무법인의 형태가 다수의 계층적 문서 열람팀 형태에서 소규모의 인력으로도 운용이 가능한 형태로 변모하는 양상을 볼 수 있다.

이러한 추세를 반영하듯 안전한 사내 Discovery 관리를 위해 Merit Counsel이라는 기업의 소송을 관리하기 위해 '횡적인 소통방식'에서 '종적인 소통방식'으로 소송의 전반적인 과정을 설계하는 역할의 외부 변호사가 등장하게 되었다.

기존의 방식처럼 소송이 발생하면 외부 법무전문가를 선정하고 이후 안건의 검토를 시작하게 되면 고객사의 모든 환경을 이해하기 위한 '착수(着手)'만으로도 상당 시간이 소요되는 점을 감안했을 때, Merit Counsel은 소송 이전부터 이미 고객과 관계를 유지하며 소송이 발생하기 전에 벤더 등의 선정하여 소송과 동시에 즉각적으로 보전 절차 등 대응할 수 있어 소송에서 가장 중요시되는 '비용과 시간'에서 우위를 제공할 수 있게 된다.

TAR을 분석 과정에서 적용하면 가능한 소송 비용을 최소화시키고, e-Discovery에서 특정, 수집, 프로세스, 분석, 저비용의 열람과 생산 공정이 가능한 벤더를 확보하는 등 소송 비용을 절감할 수 있다. 기업의 측면에서도 이러한 기능은 단지 소송 대응뿐만 아니라 상시적인 문서 보안의 형태로 활용할 수 있고, 기업의 방화벽 내에서 실시간으로 발생되는 문서의 중요 정도와 위험 정도를 판단하여 해당 부서에 전달하는 형태로 활용할 수 있다.

       <특정 조건에 해당되는 문서들을 자동적으로 분류, 기록 할수 있도록 고안된 플랫폼>

◇맺음말
TAR는 다양한 측면에서 기존의 업계의 흐름을 바꿀 만큼 충분한 효과를 가진 기술임에는 분명하다. 물론 아시아의 2바이트 언어 체계에 온전히 적용되기 위해 벤더마다 다소 시행착오를 겪고 있으나 아마도 적용은 머지않은 것으로 보인다.
검토(Review)의 과정을 컴퓨터에게 전담시킬 수는 없지만, 기본적인 분류와 우선 순위를 TAR을 통해 선정함으로써 시간과 비용을 단축시킬 수 있다는 것은 다수의 소송을 동시에 진행해야 하는 기업들에게는 반가운 소식이 될 것이라고 생각한다.

[필자. 박영수 ypark@catalystsecure.com]
Catalyst Repository System 한국 대표. 한국 Catalyst의 대표자이자 각종 E-Discovery의 안건들에 대한 전반적인 영역의 컨설팅 및 실무를 담당하고 있다. 2009년부터 현재까지 다년간에 한국과 일본등 아시아 를 기반으로한 글로벌기업의 각종소송/미법무부조사/공정거래위원회/M&A/국제중재 등의 프로젝트에 대해 실무에서부터 전반적인 프로젝트 관리에 이르는 그의 경험을 토대로, 그는 현재 Catalyst의 한국 시장 진출에 있어 가장 큰 역할을 수행하고 있다.

2014년 3월 2일 일요일

[e-Discovery ⑧] 정보 관리 단계의 중요성


[e-Discovery ⑧] 정보 관리 단계의 중요성
등록 : 14-03-01 10:01 , 데일리시큐 길민권기자 , mkgil@dailysecu.com
정보 관리 시스템 구축되면, 소송 제기됐을 때 발생 비용 대폭 감소
정보화 시대라는 말로 표현할 수 있는 현재를 살아가는 사람들에게 정보 관리라는 용어는 더 이상 생소한 용어가 아니다. 컴퓨터를 비롯한 정보통신 기기의 발달이 가속화될수록 기업과 학교, 관공서 등의 집단에서 생산되는 정보의 양은 폭발적으로 증가하고 있고, 사람들은 이러한 정보들을 체계적으로 관리하기 위한 고민을 계속 하고 있다. 기업에서도 하루가 다르게 증가하는 정보의 양을 효과적으로 통제하고, 업무에 필요한 정보를 효과적으로 관리하며, 필요한 정보를 관리하는데 적절한 시스템을 구축하는 것이 비용의 증감과 직결되는 것을 인지하고 많은 노력을 기울이고 있다.

이러한 정보 관리의 필요성에 대해서 많은 이들에게 공감하고 있는 만큼 시중에는 다양한 정보 관리의 서적들이 존재한다. 이러한 서적들은 대부분 정보의 효율적인 생산과 관리에 대한 시스템의 구축과 운용을 설명하고 있는 것들이다. 하지만 최근에는 기업의 위기 관리 측면에서의 정보 관리를 다루고 있는 책들도 볼 수 있는데 이러한 책들 중에는 e-Discovery와 연관된 내용을 설명하는 것들도 다수 있다.

이들이 설명하는 e-Discovery와 관련된 정보 관리는 앞서 언급한 EDRM(Electronic Discovery Reference Model)이나 후에 설명할 EDBP(Electronic Discovery Best Practice)에서 제시하는 정보 관리와 유사한 점을 많이 볼 수 있다. EDRM과 EDBP는 e-Discovery프로젝트에서 요구되는 정보관리를 제시한다. 하지만 이들이 제시하는 정보 관리는 다소 차이가 있다.

EDRM이 제시하는 정보 관리는 e-Discovery프로젝트가 시작되는 단계라고 할 수 있는 소송이 합리적으로 예상되는 시점 이전의 정보 관리라고 볼 수 있다. EDRM은 정보 관리 참조 모델인 IGRM(Information Governance Reference Model)을 제시하는데 이는 EDRM에서 제시하는 e-Discovery 절차와는 독립적인 정보 관리 모델로 제시된다.

IGRM은 일상적인 기업의 정보 관리에서 고려해야 할 요소 중 하나로 법률적인 위험과 책임있는 정보 관리에 대한 위험을 e-Discovery와 관련하여 설명한다. IGRM은 정보 관리에서 고려해야 할 법률적인 위험으로 e-Discovery 프로젝트가 시작될 때 어떤 데이터를 보존하고, 언제 어떠한 방법으로 데이터를 수집하며 공개할 지에 대한 책임을 제시한다. 또한 책임있는 정보 관리를 위해서 기업이 생산하는 정보 중 보존해야 할 대상과 기간을 선정하고, 이를 일상적인 기업의 정보 관리 정책에 반영할 것을 제시한다.

앞서 언급한 것처럼 EDRM에서 정보 관리의 참조모델로 제시하는 IGRM은 전적으로 e-Discovery 프로젝트를 준비하기 위한 정보 관리가 아니고, 기업의 일반적인 정보 관리에서 법률적인 위험과 이를 반영한 정보 관리 정책을 수립할 것을 제시하는 반면에 EDBP에서 제시하는 정보 관리는 법무팀과 같이 소송과 관련된 부서에 의해서 이루어지는 e-Discovery 프로젝트와 직접적으로 관련된 정보 관리를 말한다.

정보 관리는 e-Discovery를 준비하는 담당자들에게는 소송이 합리적으로 예상되기 이전부터 소송 대응 준비를 할 수 있는 가장 효과적인 방법이다. 체계적으로 정보가 생산되고, 관리되며 이러한 내용들이 구체적으로 정책에 반영된 기업은 e-Discovery를 준비하는데 큰 어려움이 없다.

정보 관리 시스템이 명확하게 구축된 기업은 소송이 합리적으로 예상될 때 소송과 잠재적으로 관련된 정보를 효율적으로 파악할 수 있고, 신속하게 보존을 할 수 있다. 또한 대량의 정보에서 소송과 관련된 정보를 찾기 위해 e-Discovery기술 서비스 제공자와 법무법인의 검토자에게 추가적인 비용을 지불하지 않아도 된다. 실제로 검토(Review) 과정에서 막대한 비용이 소요되는 것을 감안하면 정보 관리가 체계적으로 이루어진 기업은 많은 비용을 감소시킬 수 있다.

하지만 정보 관리는 소송을 준비하는 담당 부서인 법무담당자 뿐만 아니라 기업의 정보 생산과 활용을 담당하는 관리자와 인사부서, 전산부서, 보안부서 같은 관련 분야의 담당자들이 기능별로 역할을 수행해야 가능하다. 여기서 법무부서의 담당자는 법률적인 위험을 고려하여 필요한 정보를 식별하고, 관리하며, 보존할 수 있는 정책을 제시해야 한다. 또한 이러한 정책들이 e-Discovery만을 고려하는 정책이 아닌 국내의 법률까지 고려한 정책을 제시하여야 한다.

보안 담당자들은 이러한 정보들이 효과적으로 관리되고, 보존될 수 있는 보안 정책을 제시하여야 한다. David G. Hill과 같은 사람들이 Information Security Management Handbook(Sixth Edition)과 같은 정보 보안 서적에서 e-Discovery에 대한 내용을 고려한 보안 설계를 제시하는 것도 이와 같은 이유이다. 보안 담당자들은 보존되어야 할 정보들의 훼손을 방지하기 위한 보안 시스템을 구축하고, 정책을 수립해야 한다. 또한 소송이 합리적으로 예상될 때 소송과 잠재적으로 관련되어 보존을 해야 하는 데이터들이 훼손될 수 있는 정책을 사전에 식별하고, 이를 법무 담당자에게 제시할 수 있어야 한다.

정보 관리는 고려해야 할 요소도 많고, 다양한 부서의 담당자들의 협업을 통해서 이루어지는 만큼 어려움이 많다. 하지만 기업이 직면할 수 있는 법률적인 위험을 고려한 정보 관리 시스템이 구축된다면 소송이 제기되었을 때 발생하는 비용을 대폭 감소시킬 수 있고, 소송에서 승소할 수 있는 확률 또한 증가하는 만큼 그 필요성은 더없이 중요하다고 볼 수 있다. 그리고 체계적인 정보 관리는 수많은 정보가 범람하는 빅 데이터 시대에 기업의 위험을 감소시키고, 비용을 줄일 수 있는 필수 요소가 될 것이다.

[필자. 유 정 호(griphis77@me.com)]
다년간 군 수사기관에서 디지털 포렌식과 사이버 수사교관 등을 지내면서 경찰수사 연수원, 지방경찰청 사이버수사대 등 국가기관의 강사로 활동했고, 디지털 포렌식 관련 매뉴얼집 등 다수 서적을 집필했으며, 각종 번역 작업에 참여한 바 있다. 현재는 기업에서 e-Discovery, 디지털 포렌식, 개인정보보호 등의 업무를 담당하고 있다. 

2014년 2월 18일 화요일

[e-Discovery ⑦] 생산(Production) 과정에 대해

[e-Discovery ⑦] 생산(Production) 과정에 대해
등록 : 14-02-17 17:17 , 데일리시큐 길민권기자 , mkgil@dailysecu.com
e-Discovery 지원 업체의 아시아 언어 대응능력 면밀한 검토 필요
생산(Production)은 변호사의 검토(Review)가 완료된 문서를 소송 상대방에게 전달하기 위해 양측이 합의한 사양과 일정에 맞추어 준비하는 과정이다. e-Discovery에서는 일반적으로 양측 모두 문서의 검토를 위한 별도의 소프트웨어를 사용한다. 그래서 생산을 위해 제공되는 파일들은 소송 당사자들이 사용하는 별도의 e-Discovery시스템에 문서를 업로드(upload) 하기 위해 만들어진 로드 파일(Load File)과 그래픽 파일로 변환된(PDF, TIFF 등) 파일 또는 원본(native) 형태의 파일로 제공되는 것이 일반적이다.

ESI를 그래픽 파일(PDF, TIFF)로 형태를 바꾸어 제공하는 이유는 표면적으로는 데이터의 볼륨 줄이고, 어떠한 열람 소프트웨어 에서도 빠르게 열람이 가능하도록 위함이나, 검토 과정에서 검토되지 않은 (제출대상에 포함되지 않았던) 메타데이터의 영역을 통제할 수 있는 장점이 있어 그래픽 파일도 여전히 생산방법으로써 많이 사용되고 있다.

일반적으로 검토 과정에서의 작업은 문서의 내용(Contents)을 중심으로 이루어지고, 메타데이터 등 데이터의 속성에 대해서는 법무대리인의 확인이 어려운 경우가 많기 때문에 법무 대리인의 검토 과정에서 검토되지 않은 내용이 노출되는 과정을 막기 위해서 TIFF나 PDF(텍스트가 아닌 그래픽 파일로써의)의 형태로 전달을 하는 방식도 전략적으로 활용되곤한다.

생산 과정은 대체로 시간적인 여유 없이 타이트하게 진행되는 과정이기 때문에, 대부분의 경우 초기 협의(Meet&Confer)에서 사양(Specification)을 사전에 결정하고, 결정된 사양에 맞게 정상적으로 검토가 가능한지 표본(sample)을 먼저 제공하게 된다.

사실 이러한 과정은 e-Discovery 지원 업체의 수행 능력과 직접적으로 관련된 부분이므로 작업 시간(Lead Time)의 단축을 위한 절차의 자동화가 많은 역할을 한다. 단, 아시아 언어의 경우는 이러한 처리에서 추가적인 작업 시간을 필요로 하는 경우도 있으므로, e-Discovery 지원 업체의 아시아 언어 대응능력에 대한 면밀한 검토가 필요하다. 또한 소송 비용 관리 전략 측면에 있어 다른 과정에 비해 상대적으로 단가가 저렴한 과정에 속하기 때문에 소송 전략상 활용 가능한 측면도 고려할 필요가 있다.

제공되어야 할 자료로 제출되는 문서 내에 비닉특권(Privileged) 등의 이유로 문서의 일부에서 제외할 필요가 있는 문장이나 단어들은 열람 과정에서 편집하여 소거를 하는 과정을 거친다. 이 때 그러한 과정이 단지 이미지의 덮어쓰기 수준으로, 보이지 않게 덧씌우더라도 검색이 가능한 상태가 되는 솔루션도 여전히 존재할 수도 있으므로 주의해야 한다. 또한 해당 문장이 완전히 소거되었는지 확인도 해야 한다. 이러한 쟁점들이 최근까지 e-Discovery 지원 업체들 중에서 발생되는 경우가 있었고, 이 때 이미 소송 상대방에게 제공된 자료는 소송의 결과에 결정적인 영향을 미치는 문제로 발전된 사례들도 있으므로 품질 통제(Quality Control) 등 생산된 문서를 확인하는 과정을 철저하게 진행하여야 한다.

환수 명령(Clawback Order)은 본의 아니게 소송에서 공개되지 않아도 되는 문서가 생산 과정에서 소송 상대방 법무대리인에게 제공되는 것을 차단할 수 있는 절차이다. 물론 법원에서 그 타당성이 인정되어야만 가능한 과정이지만 수정 등이 제대로 이루어지지 않았거나, 개시문서 관리번호(Bates Number)이나 Load File등에서 발생하는 기술적인 문제로 인해 제출되게 되는 자료에 대해 돌려받을 수 있는 민사 소송 절차인만큼 반드시 인지하고 있어야 한다.

생산 과정에서 생산된 데이터는 소송이 진행되고 있는 해당 국가인 미국으로 데이터가 전달되는 경우가 많다. 생산 이전의 과정들이 대상 기업의 국가 내에서 처리를 해도 문제가 없었지만 데이터가 생산되는 시점에서는 소송 상대방이 위치한 국가인 미국으로 전달되는 것이 일반적이다. 이 때 소송 상대방도 별도의 검토 소프트웨어를 사용할 수 있으므로 보편적인 규격을 EDRM.org에서 제안하였는데 XML의 형태로 공통의 규격을 만듦으로써 호환성을 유지할수 있게 되었다.

                      <그림: 문건을 선택과 변환을 동시에 감독할 수 있도록 고안된 모듈>

미국의 e-Discovery 시장은 어느 정도 성숙 단계에 접어들고 있고, 세부적으로 분업화되어 있다. 미국에서는 EDRM의 모든 과정을 여러 업체가 분담할 만큼 세부적으로 e-Discovery 프로젝트를 진행하는 경우도 있다. 우리나라에 진출한 업체들 중에도 원-스톱 시스템을 지원한다고는 하지만 실제 자체 솔루션 내에서 일부 과정만을 처리하고, 나머지 과정을 미국에서 진행하거나 제3국에서 처리하는 업체도 있다. 이를 맹목적으로 잘못되었다고 할 수는 없지만, 이러한 부분에서 투명성이 확보되지 않은 것은 명백한 문제라고 볼 수 있다. 우리나라에서 이는 ‘재용역’으로 볼 수 있으나 이것은 분명히 전문화 / 분업화의 형태로 이루어지는 장점이 있는 동시에 고객사의 정보가 여러 업체를 통해서 작업이 이루어지면서 보안상의 취약점도 발생한다는 단점도 있으므로 충분한 확인이 필요하다.

◇Load File이란=데이터를 소송 상대방(혹은 사법기관 등)에게 전달할 때 서로 다른 종류의 검토  소프트웨어 에서 각각의 레코드를 정상적으로 연결(구조화)하기위해 레코드를 정의한 목록이다. 이미지(혹은 네이티브)파일을 데이터베이스로 가져오는데 각각의 레코드의 정의(혹은 서술)로 필요한데, 해당 검토 소프트웨어의 호환성이나 데이터를 열람하는 기관(DoJ 미사법부)에 제출되는 경우도 있는데, CSV나 엑셀 스프레드시트의 형태를 띄고 있다. 합의(Meet&Confer)로 정해진 메타 데이터들이 이 파일에 포함된다.

[필자. 박영수 (goodsped76@outlook.com)]
Catalyst Repository System 한국 지사장. 한국 Catalyst의 대표자이자 각종 E-Discovery의 안건들에 대한 전반적인 영역의 컨설팅 및 실무를 담당하고 있다. 2009년부터 현재까지 다년간에 수많은 프로젝트에 대해 실무에서부터 전반적인 프로젝트 관리에 이르는 그의 경험을 토대로, 그는 현재 Catalyst의 한국 시장 진출에 있어 가장 큰 역할을 수행하고 있다. 

2014년 2월 7일 금요일

[e-Discovery ⑥] 문서 검토(Review) 단계

출처 : http://www.dailysecu.com/news_view.php?article_id=6163

Home > 뉴스
뉴스
토픽
[e-Discovery ⑥] 문서 검토(Review) 단계
등록 : 14-02-07 08:38 , 데일리시큐 길민권기자 , mkgil@dailysecu.com
e-Discovery 과정에서 가장 많은 비용 소요되는 상당히 중요한 요소
앞장에서 언급한 처리와 분석을 거친 자료들은 소송 사안과 관련된 것들을 생산(Production)하기 위한 검토가 이루어지게 된다. 이와 더불어 상대편에서 제출된 많은 양의 자료를 검토하는 작업이 될 수도 있다.

문서 검토는 상대편에서 제출된 문서들 또는 상대편에게 제공해야 할 모든 문서들이 검토되어야 하기 때문에 e-Discovery 과정에서 가장 많은 비용이 소요되는 상당히 중요한 요소이다. 2012년 미국의 Rand Corporation 에 의해 발표된 자료 에 의하면 e-Discovey프로젝트에서 비용이 가장 많이 소요되는 부분은 수집(8%)이나 처리, 분석(19%) 단계가 아니라 검토 과정에서 가장 많은 비용(73%)이 소요되고 있는 것으로 확인되었다.

결국 검토 과정에서 전체 비용의 70% 이상이 소요된다는 것은 이 단계가 e-Discovery 비용을 절감시킬 수 있는 분명한 표적임을 알려주고 있는 것이다. 따라서 검토 비용을 감소하기 위한 기업의 끊임없는 요구 사항에 맞추어 갈수록 기술이 진화하고 있는 실정이다.

검토는 검토를 위한 전략, 예산과 기한을 결정하는 계획을 수립함으로써 시작해야 한다. 여기서 수립하는 전략들은 여러 가지가 있을 수 있지만, 공통적으로 검토의 범위를 이해하고 검토자들을 관리하는 통제와 절차가 포함되어야 하며 검토를 위한 적당한 벤더와 플랫폼 등을 선정하는 내용이 반영되어야 할 것이다.

검토 비용은 주로 두 유형의 법적 행위들로 발생하게 되는데 이러한 법적 조치는 검토 과정에서 이루어져야 하는 핵심 요소들이다.

첫 번째 법적 조치는 소송 쟁점에 관련되어 있거나(Responsive) 잠재적으로 관련이 있을 수 있는(Relevant) 문서들을 찾아 식별하는 것인데, 이러한 유형의 검토는 ‘First Pass Review’라고 불리우기도 한다.

두 번째 조치는, 관련되어 있다고 식별된 문서들에 대한 분석을 하여 소송 대응 전략 등이 포함된 비닉특권 정보(Privileged Communication)와 같은 고객의 비밀 정보를 보호하도록 그 정보를 제출 대상에서 제외하거나, 좀더 면밀한 검토를 위해 태그(Tag)하거나 또는 특정 핵심 부분을 보이지 않도록 조치(Redact)하는 것이다.

이와 동시에 기밀성(Confidentiality)에 대한 우려가 없는 특정 쟁점에 대한 세부적인 대응(Responsiveness) 표시 작업을 포함할 수 있는데, 이러한 문서들은 검토 단계를 통하여 다음의 4가지 기준들로 분류될 수 있다.

◇관련성(Relevance): 정보가 소송에서 쟁점이 되는 것과 관련이 있는지에 여부이다. 만약 관련성이 없다면 ‘First Pass Review’ 후 차후 검토에 포함되지는 않지만, 품질 보증(Quality Assurance)절차에서의 결함으로 표본화의 대상이 될 수 있으며 관련이 없다면 상대편에게 제출되어야 할 필요가 없을 것이다.

◇대응성(Responsiveness): 정보가 상대편의 개시 요구사항 또는 규제기관의 조사 요청에 호응하는지에 대한 것이다. 만약 그렇다면, 어떤 제출 요청사항에 그 정보가 호응되는지에 대한 인지를 위해 코드를 표시하여 입력하게 된다. 문서 검토자들은 소송 사안에 핵심적인 정보를 포함하고 특히 호응되는 문서들을 ‘hot’ 문서들로 태그하게 된다.

◇면책특권(Privilege): 변호사-의뢰인 특권, 변호사 Work-Product 원칙 또는 기밀 규칙과 프라이버시 보호법에 해당하는 정보에 대한 것이다. 변호사-의뢰인 특권에 해당하는 요소들로는 법적 조언을 주거나 또는 받은 목적으로, 기밀성을 예상하고 만들어진 변호사 또는 변호사 대행업자와 의뢰인 또는 의뢰인 대행업자 사이에서의 의사소통이 될 수 있다. 만약 이것에 포함된다면, 이것 또한 상대편에게 제출되지 않아도 될 것이다.

◇기밀성(Confidentiality): 기밀 문서의 경우 제출 대상에서 제외가 되어야 한다. 예를 들어, 만약 문서가 한 제과회사의 핵심 생산품인 초콜릿의 레시피와 같은 기업 비밀을 논하고 있다면 그 문서가 상대편에게 제출되어야 할 의무가 없게 되는 것이다. 문서 검토자는 그 문서가 기밀 정보를 포함하고 있는지를 결정하기 위해 그 문서에 대한 분석을 행해야 할 것이다.


만약 그렇다면, 검토자는 의뢰인의 기밀 생산품을 보호하기 위해 특정 부분을 보이지 않도록(Redact)해야 하는지 또는 전적으로 포함되지 않아야 하는지에 대해 결정해야 한다. 특정 부분을 가리는 과정(Redaction)은 원본 문서에서 행하여 지는 것이 아니라 상대편에게 제출되는 복사본에만 이루어지게 된다. 대부분의 검토 플랫폼에서 이 과정은 문서의 복사본으로 TIFF 또는 PDF 형태로 변환된 것에서 까맣게 표시하는 것으로 행해진다.

과거에 검토자들은 많은 양의 문서를 면밀히 살필 필요가 있었지만 지금은 더 이상 그럴 필요가 없어지고 있다. Predictive Coding이라고도 알려진 기술 기반의 검토(Technology-Assisted Review, TAR)는 변호사들의 전문성과 특정 사안에 관련성이 있는 정도(Responsive)에 기반하여 문서들의 검토 순위를 자동화하는 기계학습 기술을 사용하여 이 검토 과정을 자동화하는 기술이 점차 생기고 있는 추세이다.

간단 명료하게 설명하자면, TAR는 변호사가 문서들의 일부를 샘플링하여 대응성(Responsiveness)에 대한 코드를 입력하고, 전문화된 소프트웨어를 사용하여 검토되지 않은 모든 남아있는 문서들에 대해 그 샘플링한 검토 결과를 적용하는 것이다. 결국, 처음 샘플링해서 만들어진 결정에 따라 대응성이 없는(Non-Responsiveness) 것들은 제외되므로 기존보다 적은 비율의 문서들이 검토될 수 있다. 많은 e-Discovery 벤더들이 이 기술을 활용하는 추세이며 이러한 검토 소프트웨어의 역량을 잘 활용하려면 검토가 시작되기 전에 반드시 그 소프트웨어에 대한 기초적인 이해가 필요하다.

관련성, 대응성, 면책특권 및 기밀성에 대한 검토와 더불어 검토 팀은 그 핵심 문서의 정보가 소송에서 주장된 사실 또는 핵심 법적 쟁점과 연관시킬 수 있도록 분석하여야 한다. 문서 검토자들은 또한 핵심 문서들을 그것에 대해 증언하거나 다른 사안에 대한 정보를 식별할 수 있는 핵심 인물들과 연관시키도록 시도해야 한다. 수집된 문서들의 검토와 분석을 기반으로, 법무팀은 소송에서 사실에 기반을 둔 쟁점에 대한 더 많은 이해를 얻어 이것을 바탕으로 소송대응책을 만들어내고 재판에서 증언할 핵심 증인을 식별할 수 있을 것이다.

[필자. 이신형(sophie.shlee@gmail.com)]
University College London, U. of London대학에서 수학과 컴퓨터 공학을 전공하였으며, 고려대학교 정보보호 대학원 과정을 수료후 삼성SDS를 거쳐 국제적인 Risk Management 기업인 Kroll과 Kroll Ontrack에서 오랫동안 아시아 지역에서의 다양한 국제소송 대응 업무 및 국재 중재업무등 다양한 업무에 대한 경험을 가지고 있음. 현재는 한국의 대기업의 미국소송 및 미 사법부 조사등의 다양한 Legal Issue에 대한 실무중심의 연구를 진행하고 있음.

2014년 1월 27일 월요일

[e-Discovery ⑤] 처리와 분석(Processing & Analysis)

출처 : http://www.dailysecu.com/news_view.php?article_id=6103

[e-Discovery ⑤] 처리와 분석(Processing & Analysis)
등록 : 14-01-27 07:17 , 데일리시큐 길민권기자 , mkgil@dailysecu.com
법무대리인의 안건에 대한 이해를 목적으로 이루어지는 작업
처리와 분석 과정은 다소 ‘피상적’으로 관련되어 보이는 데이터만을 선정하여 다음 과정인 검토(Review)를 준비하는 과정이다. ‘피상적’이라는 표현을 하게 된 이유는 이 장에서 필자가 말하고자 하는 핵심이 될 것이다.

처리와 분석 과정에서 이루어지는 작업은 문서의 검토 과정에 앞서 합리적이고, 설명할 수 있는 방법을 통해 방대한 자료 중에서 소송과 잠재적으로 관련된 문서가 다수 존재할 것으로 여겨지는 부분을 걸러내는 작업이고, 법무대리인에 의해 실제 문서의 내용을 검토하는 과정과는 달리 법무대리인의 안건에 대한 이해를 목적으로 이루어지는 작업이다.

수집되어진 데이터는 파일 단위로 복제를 하기도 하지만, 훼손을 방지하기 위해 소송 관련자(Custodian)의 모든 데이터(때로는 삭제영역, 비할당영역 등을 아우르는 전체 데이터)가 저장된 저장장치를 보존하는 것이 일반적인데, 이러한 경우 용량이 방대하여 주어진 시간 내에 모든 문서를 검토할 수 없는 상황에 직면할 수 있으므로 안건에 맞추어 특정 조건의 데이터만을 따로 선별해서 검토할 필요가 있다.

선별 조건의 대부분은 법무대리인에 의해서 결정되는데 이러한 조건을 모든 데이터에 적용하여 열람 가능한 최소한의 데이터로 선별하는(Culling)작업이 처리와 분석 단계에서 이루어진다. 선별 조건은 다양한 것이 있지만 필자는 아래와 같은 방식을 제안한다. (순차적이나 병행 또는 순환하면서 아래와 같은 과정을 거치게 된다.) 아래 열거된 작업들은 업계에서 일반적으로 사용되는 기법인데 e-Discovery 기술 지원 업체마다 자신들만의 기술을 이용한 방법을 추가하기도 한다.


◇De-NISTing
미국 국립표준 연구소(NIST)에서 정의된 NSRL RDS(Reference Data Set)에 의해 사용자가 작성하지 않은 시스템이 자동적으로 생성한 파일이나 각종 어플리케이션에서 참조하는 파일등 불필요한 파일을 hash값을 기준으로 제외하는 과정이며, 통상 운영체제를 담고 있는 영역에서 적용하면 약 2GB정도의 데이터가 제거되는 효과가 있다. 다만 RDS가 미국 기준으로 작성되어 한국에서 사용되는 어플리케이션의 해쉬값이 포함되어 있지 않아서 큰 효과를 기대하기는 어렵다.

◇DeDuplication (Global, Custodian, Near)
한 개 부서의 다수의 대상자의 자료는 필연적으로 동일한 Hash Set을 가진 파일이 다수 발견되는데 이것을 우선순위를 지정하여 우선순위가 가장 높은 대상자의 파일을 제외한 나머지의 중복 파일을 제외한다. 통상 Global과 Custodian으로 적용범위에 따라 구분하며, Near처럼 부분적으로 중복된 것을 분석하는 기법도 사용되기도 한다.

Near DeDuplication의 경우는 한 개의 주제로 여러 번 주고받는 이메일 Thread처럼 중복 부분의 열람을 최소화 하는데 그 목적이 있다. 또한 Family Coding(주석1) 등의 Review과정에서 이뤄지는 반복되는 작업을 감소시켜주는 효과를 기대할 수 있다.

◇File Extension
문서 Review는 대개 인간의 눈으로 읽을 수 있는 문서를 대상으로 하는 경우가 일반적이다. 도면이나 영상파일등을 Review해야 할 필요가 있는 경우도 소송에 따라서는 추가적으로 필요로 하는 경우가 발생하는데 확장자를 기준으로 Review의 필요와 불필요를 사전에 결정하는 것이 일반적이다.

◇Date Filtering
각종 문서와 이메일 – ESI는 Meta Data중 TimeStamp라 하여 생성일시, 최종수정일시, 최근열람일시 등을 기준으로 파일의 속성을 이용해 제외 대상을 선정하기도 한다. 다만 Acquisition의 공정에서 Meta Data에 대한 충분한 보존절차가 수반되지 않은 경우나, DRM등의 복호화 과정을 거친경우에는 본 작업이 적절하지 않을 수도 있으며, 메일 아카이브의 경우는 아카이브 내부의 메시지는 대해서 적용되도록 주의를 기울여야한다.


◇Keyword Search
키워드는 주로 법무대리인에 의해서 주어지는 단어들을 이용해서 전체문서에 대해서 검색을 실시한다. 연관성이 높은(Responsive) 키워드들의 묶음과 공개대상이 아닌 비닉특권(Privilege)등의 이유로 인해 제외되어야할 키워드들의 묶음등 다양한 목적으로 키워드 검색을 실시하며 OR나 AND등으로 이뤄지는 단어의 조합의 검색이 이뤄진다. 좀더 정확한 검색결과를 위해서 아래의 방법들도 함께 사용되는 추세이다.

-Proximity Search(Neighborhood, 근방 검색)
Within Sentence 나 Within Word등으로 설명되어지는 근방검색은 A와 B라는 단어간의 거리가 지정된 기준(단어 혹은 간격)에 부합되는 경우만을 결과로 보는 검색방법이다. 기존의 키워드 검색에서 의도하지 않았던 검색의 오류를 개선시킨 방법이다. 다만 아시아의 2 Byte의 언어와 달리 영미권의 알파벳과의 기호학적 차이로 인해 키워드 선정시에 언어별로 거리기준을 다르게 적용해야 한다. 문법은 아래와 같은 형식으로 이용된다.
DocText near/2 (cable modem, wireless)

-Conceptual Search
실제로 키워드를 선정할 때에는 시행착오를 거치게 된다. 기본적으로 키워드의 선정은 변호사와 사내의 해당 안건의 실무자가 참여하게 되지만, 수십 수백여 개의 키워드를 준비하다보면 종종 놓치기도 한다. Concept Search라 불리우는 이 검색은 본 검색에 앞서 어떠한 키워드들이 존재하는가에 대해 특정 단위내의 문서군(群)에서 단어간의 거리나 출현 빈도 등의 분석으로 단어들의 조합이나 연관성이 있는 키워드를 제안해주는 역할을 하기도 한다.

◇Set Operation (집합 연산)
집합연산은 엄밀히 말하면 분석의 범주에 해당된다고 보기엔 다소 어려움이 있다. 교집합, 합집합 등을 이용해서 Review공정의 우선순위나 절차 등을 정하는데 이용하기도 한다. 이러한 작업을 통해 검토(Review)에 앞서서 제출(Production)되어야 할 대상과 그렇지 않은 대상을 분류하기 위한 사전 검토작업으로써 이용되기도 한다.

위의 과정들을 통해서 전제 데이터(보존된 전체 볼륨)중에서 일반적으로 약 10~20% 수준의 데이터가 최종 검토 대상으로 선별되고, TAR(Tech Assist Review)의 기능이 이 과정에서 활용되기도 한다. (일정 부분 법률 대리인에 의한 학습이 필요하므로 분석의 범주에 넣기에는 다소 애매한 부분이다.)

처리와 분석 과정에서 소송과 무관한 자료를 최대한 제외할 수 있으면 검토 과정에서의 비용을 절감할 수 있지만, 충분한 확인 작업이 이루어지지 않는다면 검토의 대상이 되는 소송과 관련된 자료까지 제외될 수 있으므로 않도록 이에 유의해야 한다. 따라서 본 과정의 기준은 가능한 e-Discovery의 경험이 많은 법무법인 변호사와 e-Discovery 기술 지원 업체, 소송 대상 기업의 관계자들의 긴밀한 협조와 논의 후에 진행되어야 한다.

[용어해설]
1. Family Coding: 메일은 통상 [본문, 첨부문서]의 구성으로 이뤄진 경우가 많고, Embeded 문서는 문서안에 문서가 존재하기도 한다. 이러한 경우 문서와 문서간의 연관관계는 다른 평행적인 관계와 달리 부자관계(Parent-Child Relationship)의 상하관계로 보고 리뷰할 필요가 있다. 대개의 리뷰 솔루션은 이러한 문서의 묶음을 모아서 코딩 할 수 있도록 제공되는 경우가 일반적이다.

1.2. Hash: 데이터의 무결성 및 메시지 인증 등에서 사용되는 함수로써 정보보호의 여러 메커니즘에 사용되는 기술이다. 해시 알고리즘은 임의의 길이의 비트열을 고정된 길이의 출력값인 Hash Code로 압축시키는 함수이며, 암호학적 측면에서 사용되는 대부분의 해시 함수는 강한 충돌 저항성을 필요로 한다. 일치할 확률이 상당히 낮기 때문에 악성코드의 검출 등에 사용되기도 한다.

[필자. 박영수 (goodsped76@outlook.com)]
Catalyst Repository System 한국 지사장. 한국 Catalyst의 대표자이자 각종 E-Discovery의 안건들에 대한 전반적인 영역의 컨설팅 및 실무를 담당하고 있다. 2009년부터 현재까지 다년간에 수많은 프로젝트에 대해 실무에서부터 전반적인 프로젝트 관리에 이르는 그의 경험을 토대로, 그는 현재 Catalyst의 한국 시장 진출에 있어 가장 큰 역할을 수행하고 있다.

2014년 1월 26일 일요일

3 Key Benefits of Email Archiving


아래 article에서는 이메일 아카이빙의 3가지 장점을 다음과 같이 말합니다.

1# Storage of Intellectual Property
#2 Preparation for Legal Discovery
#3 Mining Of Customer Insights

ery business must decide what they do with old emails. Each day most employees send and receive countless emails, some or all of which may contain important information. This information may also be needed at a later date, whether an employee is searching for old correspondence, or a court order requires the business to divulge email records. This blog will detail three key benefits of email archiving in the storage of intellectual property, preparation for legal discovery and mining of customer insights.
1# Storage of Intellectual Property
It has become standard practice in most workplaces to arrive at the office and trudge through your email inbox. Due to this dependence on email there is no doubt that some emails will contain valuable intellectual property, in fact 75% of a companies intellectual property is stored in emails.

Rather than having a filing cabinet brimming with a disarray of papers and business records, it is much better for your business to use an enterprise email archive with quick search and retrieval. This allows anyone in the business to quickly find his or her correspondence, and those in charge to easily monitor and retrieve vital documents. Keeping track of intellectual property at your company is part of insuring the company’s future.





3 Key Benefits of Email Archiving image Email Marketing resized 600

#2 Preparation for Legal Discovery
It is possible that through legal actions a large number of email messages and the data in them will be needed for investigation. This obviously necessitates easy access to employee emails of both current and historical employees. Indeed all businesses are faced with the challenge of providing on-demand access to a continuously growing set of data generated every day.
Dries Moriss an operations director at Securicom, a specialist IT services company, said, “When users can’t access this information when they need it, they can’t do their jobs. Their productivity is hampered. For business continuity, cloud-based email archiving systems must be integrated and they must give users direct access to new and archived email. It’s become expected.”
This has become the new standard for email archiving and not meeting the standard means being unable to complete your work to the best of your ability. This means falling behind both your client’s demands but also your competitors. It is also important that when an employee leaves you know how you are going to access their past emails.
#3 Mining Of Customer Insights
It is common for businesses to conduct an email archive mining process for historical customer insights. In times of urgent recovery of contracts, agreements, relationship communication or even sales rep’s promises, discovery-driven search will need to be made. At less frantic times supporting internal initiatives such as the simple filing and retrieval of client data will become the priority. In both cases the ability to easily access old emails and find crucial pieces of information is essential.

Read more at http://www.business2community.com/tech-gadgets/3-key-benefits-email-archiving-0750434#fY8RVTlrbzPe5y6K.99