최근 인공지능(AI) 업계가 학습용 데이터 부족 문제를 해결하기 위해 파산한 기업들의 방대한 데이터를 대거 사들이고 있다고 합니다.
현재 오픈AI, 구글, 마이크로소프트 등 빅테크를 비롯한 수많은 AI 스타트업들은 이미 인터넷상에 공개된 공개 데이터(Public Data)를 거의 소진한 상태입니다. 모델의 성능을 비약적으로 발전시키기 위해서는 이제 실제 사람들의 전문적인 업무 문서, 고객 응대 기록, 내부 커뮤니케이션 내용 등 고품질의 사내 데이터(Private Data)가 필수적인 상황입니다.
하지만 이러한 고품질 데이터를 합법적이고 대규모로 확보하기란 하늘의 별 따기만큼 어렵습니다. 이 빈틈을 파고든 것이 바로 파산 기업들의 데이터 아카이브입니다. 재정난으로 청산 절차를 밟게 된 기업들의 서버 속에는 수년간 축적된 방대한 고객 정보, 비즈니스 노하우, 문서 데이터가 고스란히 남아있기 때문입니다. 파산 관재인이나 법정관리인 입장에서도 과거에는 가치를 매기기 힘들었던 디지털 자산을 매각해 채권자들에게 나눠줄 현금을 확보할 수 있어 양측의 이해관계가 절묘하게 맞아떨어지고 있습니다.
다만, 이러한 거래를 두고 법적, 윤리적인 우려의 목소리도 커지고 있습니다. 파산한 기업에 자신의 개인정보나 업무 데이터를 맡겼던 이용자들의 동의 없이 해당 데이터가 AI 학습용으로 고스란히 넘어가 악용될 수 있기 때문입니다. 유럽 등 엄격한 개인정보보호법(GDPR) 체제하에서는 상당한 논란과 법적 공방으로 번질 가능성도 배제할 수 없습니다.
AI의 한계를 극복하기 위해 파산 기업의 유산까지 싹쓸이하는 업계의 움직임이 앞으로 어떤 파장을 몰고 올지 주목됩니다.
가끔 보면 새로생긴 기업이나 앱인데 성능이 너무 좋은데 공짜나 엄청 낮은 가격으로 준다?
얼마후 기업 정리하거나 앱 내리고 그 개인정보 팔죠. 이거 노리고 만드는 유령 기업을 많습니다.
물론 어디까지 삭제하느냐는 회사마다 다르지만 개인이 특정될정도의 데이터를 거래하면 소송의 나라 미국에서 난리가 나겠죠.