비정형 데이터

칸칸이 정리된 서랍 속 양말이 아니라, 커다란 배낭 속에 자유롭게 담긴 온갖 물건들과 같아요.

정의 칸칸이 나뉜 서랍장처럼 정해진 규격에 맞춰 저장된 것이 아니라, 일상에서 주고받는 대화나 사진, 동영상처럼 형태가 고정되지 않은 자유로운 모습의 데이터를 말해요.

엑셀 표와 일기장의 차이

정리 정돈이 완벽한 서랍장을 떠올려 보세요. 양말 칸에는 양말만, 속옷 칸에는 속옷만 들어있어서 필요한 물건을 찾기가 아주 쉬워요. 컴퓨터 세상에서 이런 서랍장 역할을 하는 것이 바로 '정형 데이터'예요. 이름, 나이, 전화번호처럼 정해진 칸(행과 열)에 깔끔하게 들어가는 정보들이죠.

하지만 우리가 매일 만들어내는 정보는 서랍장에 차곡차곡 넣기 힘들어요. 친구와 메신저로 나눈 일상 대화, 주말에 찍은 음식 사진, 유튜브에 올린 동영상, 길거리에서 녹음한 음성 메모는 정해진 규격의 칸으로 나누기 어렵거든요. 이렇게 정해진 규격이나 틀이 없는 데이터를 비정형 데이터라고 불러요.

놀랍게도 오늘날 인류가 만들어내는 디지털 데이터의 80% 이상은 이런 비정형 데이터예요. 우리가 스마트폰으로 일상을 기록하고 인터넷으로 소통하는 모든 행동이 거대한 비정형 데이터의 바다를 만들고 있어요.

정형 데이터와 비정형 데이터의 비교 정형 데이터 정해진 규격과 틀 비정형 데이터 (80% 이상) 규격 없는 자유로운 형태

골칫덩어리에서 보물로 변신한 이유

과거의 컴퓨터 프로그램은 숫자를 더하거나 정해진 표를 검색하는 일에는 뛰어났지만, 사진이나 글의 뜻을 스스로 이해하지는 못했어요. 사진 파일은 컴퓨터 눈에 그저 정체를 알 수 없는 수많은 색상 점들의 나열로 보였거든요. 그래서 비정형 데이터는 보관 공간만 차지하는 다루기 힘든 골칫덩어리로 여겨지기도 했어요.

하지만 인공지능과 딥러닝 기술이 발전하면서 상황이 완전히 뒤집혔어요. 인공지능은 수백만 장의 강아지 사진을 보며 스스로 강아지의 공통적인 생김새를 배우고, 수많은 글을 읽으며 문장의 숨은 뜻이나 감정을 파악할 수 있게 되었어요.

이제 기업들은 고객이 남긴 솔직한 후기 글을 분석해 상품의 결함을 찾아내고, 도로 위 영상 데이터를 분석해 자율주행 기술을 학습시켜요. 다듬어지지 않은 원석처럼 방치되었던 비정형 데이터가 인공지능을 만나 가장 값비싼 원자재로 다시 태어난 거예요.

조금 더 정확히 말하면: 반정형 데이터와 메타데이터

세상의 모든 데이터가 칼로 자르듯 정형 데이터와 비정형 데이터로만 나뉘는 것은 아니에요. 그 중간에 걸쳐 있는 '반정형 데이터'도 있어요. 웹 문서를 구성하는 HTML이나 데이터를 교환할 때 쓰는 JSON처럼, 표 형태는 아니지만 내용 안에 이름표(태그)가 붙어 있어 대략적인 구조를 짐작할 수 있는 형태예요.

또한 비정형 데이터 안에도 질서가 숨어 있어요. 스마트폰으로 찍은 사진 자체는 비정형이지만, 사진 파일 속에는 촬영한 시각, 장소, 카메라 기종 같은 정보가 일정한 규격으로 기록되어 있거든요. 이를 데이터를 설명해 주는 데이터인 메타데이터라고 불러요.

최근에는 비정형 데이터의 의미를 컴퓨터가 수학적으로 비교할 수 있도록 숫자의 묶음(벡터)으로 변환해 저장하는 기술이 널리 쓰여요. 겉으로 보기에는 제각각인 정보라도, 그 속에 담긴 뜻을 인공지능이 이해할 수 있게 가공하여 활용하고 있답니다.

🤔 흔한 오해

✕ 오해

비정형 데이터는 규칙이 없어서 정형 데이터보다 가치가 떨어진다.

✓ 사실

과거에는 분석하기 어려웠지만, 인공지능 기술의 발전으로 사람의 생각, 행동 패턴, 감정이 담긴 비정형 데이터가 기업과 연구에서 가장 강력한 핵심 자산이 되었어요.

🧺 일상에서 만나요

1 유튜브에 올라오는 영상과 댓글, 쇼츠 콘텐츠는 대표적인 비정형 데이터예요.
2 병원에서 찍은 엑스레이(X-ray) 사진이나 의사가 진료차트에 자유롭게 적은 메모도 비정형 데이터에 해당해요.
💡 그러니까 한마디로

비정형 데이터는 정해진 표 규격이 없는 사진, 영상, 텍스트 등으로, 현대 인공지능의 가장 중요한 학습 재료예요.