'빅 데이터'란?

Dec 23 2013
인터넷이 출현 한 이래로 우리는 엄청난 양의 데이터를 생산해 왔습니다. 누가 수집하고 있으며 걱정해야합니까?
온라인으로 구매할 때마다 데이터 스트림에 추가됩니다.

어떤 의미에서 빅 데이터는 말 그대로 많은 데이터입니다. 인터넷이 출현 한 이래로 우리는 엄청난 양의 데이터를 생산해 왔습니다. 2003 년까지 항상 5 엑사 바이트의 데이터 만 생성 된 것으로 추정되며 이는 50 억 기가 바이트에 해당합니다. 그러나 2003 년부터 2012 년까지 그 양은 약 2.7 제타 바이트 (또는 2,700 엑사 바이트 또는 2.7 조 기가 바이트)에 달했습니다 [출처 : Intel , Lund ]. Berkeley 연구원에 따르면, 우리는 현재 약 5 천경 바이트 (또는 약 4.3 엑사 바이트)의 데이터를 2 일마다 생산하고 있습니다 [출처 : Romanov ].

'빅 데이터'라는 용어는 일반적으로 기존 데이터베이스를 사용하여 유지 관리하기 어려운 방대하고 빠르게 확장되고 다양하며 종종 구조화되지 않은 디지털 데이터 세트를 가리키는 데 사용됩니다. 여기에는 인터넷에 떠 다니는 모든 디지털 정보, 우리가 비즈니스를 수행 한 회사의 독점 정보 및 공식 정부 기록 등이 포함될 수 있습니다. 데이터가 어떤 목적으로 분석되고 있다는 의미도 있습니다.

우리는 온라인 구매와 소셜 미디어 참여를 통해 많은 것을 직접 만들어 왔지만 이는 빙산의 일각에 불과합니다. 빅 데이터에는 디지털화 된 문서, 사진, 비디오, 오디오 파일, 트윗 및 기타 소셜 네트워킹 게시물, 이메일, 문자 메시지, 전화 기록, 검색 엔진 쿼리, RFID 태그 및 바코드 스캔, 금융 거래 기록 등이 포함될 수 있습니다. 유일한 출처. 온라인에서 무엇이든 할 때마다 데이터를 생성하고, 다른 사람들이 유용한 정보를 얻기 위해 찾아올 수있는 디지털 흔적을 남깁니다.

데이터를 생성하는 장치의 수와 유형도 급증하고 있습니다. 가정용 컴퓨터 및 소매 업체의 POS 시스템 외에도 인터넷에 연결된 스마트 폰, 체중을 트윗하는 WiFi 지원 체중계, 건강 관련 데이터를 추적하고 때때로 공유하는 피트니스 센서, 사진과 비디오를 온라인에 자동으로 게시 할 수있는 카메라 및 몇 가지 예를 들어, 지구상에서 우리의 위치를 ​​정확히 파악할 수있는 GPS ( Global Positioning Satellite ) 장치입니다. 날씨 및 교통 센서, 감시 카메라, 자동차 및 비행기의 센서 및 지속적으로 데이터를 수집하는 개인과 관련이없는 기타 것들을 잊지 마십시오. 데이터를 생성하고 업로드하는 수많은 전자 장치로 인해 "사물 인터넷"이라는 용어가 등장했습니다.

빅 데이터에 대한 여러 정의를 찾을 수 있으므로 모든 사람이 포함 된 내용에 전적으로 동의하는 것은 아니지만 컴퓨터 분석을받을 수 있다는 사실을 알고 싶은 사람이라면 누구나 관심을 가질 수 있습니다. 그리고 이러한 크고 다루기 힘든 데이터 세트는 수집, 저장, 처리 및 분석을위한 새로운 방법이 필요합니다.

빅 데이터를 분석하고 사용하는 방법

캘리포니아 산호세에있는 이와 같은 서버 팜은 패턴과 연관성을 식별하기 위해 방대한 양의 데이터를 처리하고 있습니다.

빅 데이터는 누구에게나 유용 할 수 있도록 수집, 마사지, 함께 연결 및 해석되어야합니다. 회사 및 기타 주체는 가장 관련성이 높은 데이터를 얻기 위해 방대한 양의 사용 가능한 데이터를 필터링해야합니다. 다행스럽게도 방대한 양의 정보를 처리, 저장 및 분석 할 수있는 하드웨어와 소프트웨어가 점점 더 저렴 해지고 빨라지고 있으므로 작업에 더 이상 방대하고 엄청나게 비싼 슈퍼 컴퓨터가 필요하지 않습니다. 일부 소프트웨어는보다 사용자 친화적이되어 프로그래머와 데이터 과학자 팀이 데이터를 엉망으로 만들 필요는 없습니다 (비록 귀하의 요구 사항을 이해할 수있는 지식이있는 사람이 있어도 문제가되지는 않습니다).

기업은 클라우드 컴퓨팅 서비스를 활용하여 모든 데이터 처리를 위해 자체 컴퓨터를 구입할 필요조차 없습니다. 서버 팜 이라고도하는 데이터 센터 는 여러 서버에서 처리하기 위해 데이터 일괄 처리를 배포 할 수 있으며 필요에 따라 서버 수를 빠르게 확장하거나 축소 할 수 있습니다. 이 확장 가능한 분산 컴퓨팅은 Apache Hadoop, MapReduce 및 MPP (Massively Parallel Processing)와 같은 혁신적인 도구를 사용하여 수행됩니다. NoSQL 데이터베이스는 기존 SQL 기반 데이터베이스 시스템에 대한보다 쉽게 ​​확장 가능한 대안으로 개발되었습니다.

이러한 빅 데이터 처리 및 분석의 대부분은 의사 결정에 활용하거나 사용할 수있는 통찰력을 제공하는 패턴과 상관 관계를 찾는 데 목적이 있습니다. 기업은 이제 소비자 습관, 제품의 인기 또는보다 효율적인 비즈니스 수행 방법에 대한 정보를 얻기 위해 방대한 양의 데이터를 마이닝 할 수 있습니다. 빅 데이터 분석을 사용하면 구매 가능성이 가장 높은 고객에게 관련 광고, 제품 및 서비스를 타겟팅하거나 일반 대중의 관심을 끌 가능성이 높은 광고를 만들 수 있습니다. 기업들은 이제 스마트 폰을 통해 사람들에게 최근에 신용 카드를 사용한 곳 근처에있는 장소에 대한 실시간 광고와 쿠폰을 보내는 것과 같은 일을하기 시작했습니다 .

그러나 우리가 물건을 사게 만드는 것은 아닙니다. 기업은이 정보를 사용하여 가장 비용 효율적인 배송 경로를 찾거나 상품을보다 적절하게 보관하는 등의 효율성과 관행을 개선 할 수 있습니다. 정부 기관은 교통 패턴, 범죄, 유틸리티 사용 및 기타 통계를 분석하여 정책 결정과 공공 서비스를 개선 할 수 있습니다. 정보 기관은이 정보를 사용하여 범죄 및 테러리스트 음모를 감시 할 수 있습니다. 뉴스 의상은이를 사용하여 트렌드를 찾고 스토리를 개발할 수 있으며 물론 빅 데이터에 대한 더 많은 기사를 작성할 수 있습니다.

본질적으로 빅 데이터를 통해 기업은 과거와 같이 대부분의 오래된 정보에 의존하지 않고 거의 실시간 데이터를 사용하여 결정을 내릴 수 있습니다. 그러나 현재 우리에게 무슨 일이 일어나고 있는지 볼 수 있고 때로는 미래의 행동을 예측하는 능력은 약간 오싹 할 수 있습니다.

빅 데이터 : 친구 또는 적?

ATM 거래와 신용 카드 및 직불 카드 구매는 기업이 지출 습관을 예측하는 데 도움이되는 데이터 프로필의 일부입니다.

빅 데이터에 대한 생각은 우리를 불편하게 만듭니다. 오웰의 빅 브라더처럼 들리며, 우리가하고있는 일을 알고있는 회사의 광고와 최근 NSA 국내 스파이 폭로를 통해 우리 모두에 대한 방대한 양의 정보를 발견하는 사람들이 있음을 이해할 수 있습니다. .

사람들은이 데이터를 통해 귀하의 나이, 성별, 성적 취향, 결혼 여부, 소득 수준, 건강 상태, 취향, 취미, 습관 및 귀하가 공개되기를 원하거나 원하지 않을 수있는 기타 모든 것을 포함하여 귀하에 대해 많은 것을 알 수 있습니다. 지식. 그들은 그것을 모으고 분석 할 수단과 의지 만 있으면됩니다. 그리고 그 의미가 좋든 나쁘 든 의도하지 않은 결과를 초래할 수 있습니다.

우리는 특히 로열티 카드를 사용하거나 신용 카드 또는 직불 카드로 결제하는 경우 비즈니스를 수행하는 회사에 인식하는 것보다 더 많은 정보를 제공합니다. 누군가 당신의 구매를 분석함으로써 당신에 대해 많은 것을 배울 수 있습니다. Target은 어떤 고객이 임신했는지, 심지어 구매하는 보충제 및 로션의 유형과 같은 항목에서 기한까지 얼마나 가까웠다는 사실을 발견했을 때 언론을 받았습니다. 한 사례에서 Target은 10 대 소녀에게 직접 유아 용품 쿠폰을 우편으로 보내기 시작했고, 그녀의 임신 사실을 알기 전까지는 나이에 부적절하다고 생각하는 광고를 보낸 회사에 대한 아버지의 분노를 불러 일으켰습니다 [출처 : Datoo , Duhigg , 경제학자 ].

정부와 개인 정보 보호 옹호자들은 개인 이 공개 지식이되는 것에 대해 어느 정도 통제권을 부여하기 위해 사람들의 개인 식별 정보 (PII)가 사용되거나 공개되는 방식을 규제하려는 시도를했습니다 . 그러나 예측 분석은 기존의 많은 법률을 우회 할 수 있습니다 (주로 재무, 의료 등 특정 유형의 데이터를 다루는또는 교육 기록) 디지털 소스에서 수집 한 서로 다른 정보를 사용하여 회사가 귀하의 지식없이 간접적으로 귀하에 대해 결론을 내 리도록합니다. 일부 회사는 정보를 사용하여 잠재 고객이 찾은 내용과 해석 방법에 따라 귀하에게 좋거나 나쁠 수있는 일반적인 신용 점수 이외의 데이터를 사용하여 잠재 고객의 신용 가치를 확인하는 등의 작업을 수행하고 있습니다. 그러나 한 가지 걱정은 이러한 유형의 개인 정보가 고용, 주택 또는 대출 차별로 이어질 수 있다는 것입니다. 더 나쁜 것은 항상 완전히 정확하지는 않을 수도 있습니다.

빅 데이터에서 보이는 패턴이 잘못 해석되어 잘못된 결정으로 이어질 수도 있습니다. 다른 도구와 마찬가지로 결과는 모두 사용 방법에 따라 다릅니다. 수학이 관련되어 있지만 빅 데이터 분석은 정확한 과학이 아니며 인간의 계획과 의사 결정은 어딘가에 있어야합니다. 방대한 데이터 세트로 인해 무엇이 중요하고 무엇을 무시할 수 있는지에 대한 판단을 내려야합니다. 그러나 빅 데이터 분석을 잘 수행하면 기업에 경쟁 우위를 제공 할 수 있습니다.

이러한 분석은 사기 퇴치와 같이 분명히 좋은 일에 사용할 수 있습니다. 돈을 다루는 은행, 신용 카드 제공 업체 및 기타 회사는 이제 범죄 활동을 가리키는 비정상적인 패턴을 파악하기 위해 빅 데이터 분석을 점점 더 많이 사용합니다. 개인 계정에서는 비정상적인 품목 구매, 고객이 일반적으로 지출하지 않을 금액, 이상한 지리적 위치 또는 소규모 테스트 구매 후 매우 큰 구매와 같은 위험 신호에 대해 빠르게 경고를받을 수 있습니다. 같은 지역의 다른 카드에 대한 유사한 청구와 같은 여러 계정의 패턴은 회사에 사기 행위 가능성을 경고 할 수 있습니다.

방대한 데이터 세트는 과학 및 사회학 연구, 선거 예측, 일기 예보 및 기타 가치있는 활동에 도움이 될 수 있습니다. 소셜 미디어 게시물과 Google 검색은 질병 발생 위치를 신속하게 파악하는 데 사용되기도했습니다. 따라서 모든 나쁜 소식이 아닙니다. 모든 잠재적 인 문제를 해결하고 잠재적 인 피해로부터 우리를 보호하는 법을 시행하는 데는 시간이 걸립니다. 그때까지 걱정된다면 현금 구매로 돌아가서 자신에 대해 무엇을 내놓았는지 지켜보고 싶을 것입니다. 그럼에도 불구하고 우리 중 누구라도 레이더에서 완전히 벗어나기에는 우리는 아마도 토끼의 구멍에서 너무 멀리 떨어져있을 것입니다.

더 많은 정보

저자 주 : '빅 데이터'란 무엇입니까?

다른 것과 마찬가지로 빅 데이터는 좋은 일과 나쁜 일, 그리고 그 사이의 많은 일에 사용될 수 있습니다. 우리를 겨냥한 광고와 쿠폰을 갖는 것은 편리하거나 큰 성가신 일이 될 수 있습니다. 그리고 우리가 그들의 상점에서 플라스틱을 긁거나 카드를 사용하기 때문에 낯선 사람들이 우리에 대해 배울 수있는 양이 조금 이상합니다.

제가 항상 생각했던 로열티 카드는 구매에 대한 데이터를 수집하는 방법 이었지만 지금까지 직불 / 신용 구매를 통해 개별적으로 유사한 데이터가 얼마나 많이 연결되어 있는지 또는 우리 삶에 대한 놀라운 세부 사항이 그것으로부터 식별 될 수 있습니다. 그리고 이것은 인터넷에있는 우리에 대한 다른 모든 정보도 포함하지 않습니다.

나의 모든 움직임이 분석 될 것이라는 생각 때문에 나는 다소 그리드에서 벗어나 온라인 게시를 중단하고 모든 것에 현금을 사용하고 싶습니다. 저를 포함한 대부분의 사람들은 편의를 위해 계속할 것입니다. 내가 지켜 보는 것처럼 게시하고 구매할 수 있습니다.

관련 기사

  • 데이터 센터 작동 방식
  • 데이터 통합 ​​작동 방식
  • 인터넷 쿠키의 작동 원리
  • 온라인에서 나에 대한 어떤 정보가 있는지 어떻게 알 수 있습니까?

출처

  • 아파치. "하둡." (2013 년 11 월 30 일) http://hadoop.apache.org/
  • 아서, 리사. "빅 데이터 란?" 포브스. 2013 년 8 월 15 일. (2013 년 12 월 1 일) http://www.forbes.com/sites/lisaarthur/2013/08/15/what-is-big-data/
  • 브룩스, 데이비드. "데이터로 할 수없는 일." 뉴욕 타임즈. 2013 년 2 월 18 일. (2013 년 12 월 4 일) http://www.nytimes.com/2013/02/19/opinion/brooks-what-data-cant-do.html?_r=1&
  • 브룩스, 데이비드. "다음에 할 일." 뉴욕 타임즈. 2013 년 4 월 15 일. (2013 년 12 월 4 일) http://www.nytimes.com/2013/04/16/opinion/brooks-what-youll-do-next.html
  • Brust, Andrew. "MapReduce와 MPP : 빅 데이터 코인의 양면?" ZDNet. 2012 년 3 월 2 일. (2013 년 12 월 5 일) http://www.zdnet.com/blog/big-data/mapreduce-and-mpp-two-sides-of-the-big-data-coin/121
  • 버틀러, 브랜든. "빅 데이터 작업에 대한 Numbers Guru Nate Silver의 교훈" 네트워크 세계. 2013 년 9 월 11 일. (2013 년 12 월 4 일) http://www.networkworld.com/news/2013/091113-nate-silver-big-data-273740.html
  • 콕스, 라이언. "Nate Silver는 빅 데이터 트렌드에 회의적이며 문화에 대한 핵심 요소입니다." 실리콘 각도. 2013 년 9 월 12 일. (2013 년 12 월 4 일) http://siliconangle.com/blog/2013/09/12/nate-silver-skeptical-of-big-data-trends-keys-in-on-culture /
  • 크로포드, 케이트, 제이슨 슐츠. "빅 데이터 및 적법 절차 : 예측 가능한 개인 정보 피해를 시정하기위한 프레임 워크를 향하여." 뉴욕 대학교 법대. 2013 년 10 월 1 일. (2013 년 12 월 4 일) http://papers.ssrn.com/sol3/papers.cfm?abstract_id=2325784
  • Datoo, Siraj. "빅 데이터 분석의 급속한 발전으로 투자가 증가했습니다." 보호자. 2013 년 11 월 22 일. (2013 년 11 월 29 일) http://www.theguardian.com/news/2013/nov/22/rapid-development-in-big-data-analytics-has-led-to-increased -투자
  • Duhigg, Charles. "회사가 귀하의 비밀을 배우는 방법." 뉴욕 타임즈. 2012 년 2 월 16 일. (2013 년 12 월 2 일) http://www.nytimes.com/2012/02/19/magazine/shopping-habits.html?pagewanted=6&_r=3&hp&pagewanted=all&
  • 경제학자. "빅 데이터-수치 분석." 2012 년 5 월 19 일. (2013 년 12 월 1 일) http://www.economist.com/node/21554743
  • EMC. "EMC : 빅 데이터 커튼 뒤에." 2012. (2013 년 12 월 1 일) http://www.emc.com/campaign/global/big-data/hfbd-infographic-4web-1500.jpg?cmp=micro-big_data-general-emc
  • 피츠 제럴드, 마이클. "빅 데이터 : 큰 위협 또는 큰 거짓말?" InformationWeek. 2013 년 11 월 21 일. (2013 년 12 월 4 일) http://www.informationweek.com/big-data-big-threat-or-big-lie/d/d-id/1112668?
  • 가트너. "빅 데이터." (2013 년 11 월 29 일) http://www.gartner.com/it-glossary/big-data/
  • 그 나우, 스콧. "컨텍스트에 빅 데이터 배치." 열광한. 2013 년 9 월 10 일. (2013 년 12 월 4 일) http://www.wired.com/insights/2013/09/putting-big-data-in-context/
  • Henschen, Doug. "빅 데이터는 날씨 채널 예측을 재구성합니다." InformationWeek. 2013 년 11 월 25 일. (2013 년 12 월 4 일) http://www.informationweek.com/big-data/software-platforms/big-data-reshapes-weather-channel-predictions/d/d-id/1112776 ?
  • IBM. "빅 데이터 란?" (2013 년 12 월 4 일) http://www-01.ibm.com/software/data/bigdata/what-is-big-data.html
  • 인텔. "빅 데이터 101 : 빅 데이터가 큰 영향을 미치는 방법." (2013 년 11 월 29 일) http://www.intel.com/content/www/us/en/big-data/big-data-101-animation.html
  • 인텔. "빅 데이터로 신용 카드 사기를 방지하십시오." (2013 년 11 월 30 일) http://www.intel.com/content/dam/www/public/us/en/documents/white-papers/combat-credit-card-fraud-with-big-data-whitepaper .pdf
  • 인텔. "빅 데이터 란?" (2013 년 11 월 30 일) http://www.intel.com/content/www/us/en/big-data/big-data-what-is-big-data-landing.html
  • 레이니, 더그. "Deja VVVu : 빅 데이터를위한 Gartner의 구성을 주장하는 다른 기업." 가트너. 2012 년 1 월 14 일. (2013 년 12 월 1 일) http://blogs.gartner.com/doug-laney/deja-vvvue-others-claiming-gartners-volume-velocity-variety-construct-for-big-data /
  • Lund, Susan, James Manyika, Scott Nyquist, Lenny Mendonca 및 Sreenivas Ramaswamy. "게임 체인저 : 미국의 성장과 갱신을위한 5 가지 기회." McKinsey Global Institute. 2013 년 7 월. (2013 년 12 월 3 일) http://www.mckinsey.com/insights/americas/us_game_changers
  • MongoDB. "빅 데이터 설명." (2013 년 12 월 5 일) http://www.mongodb.com/learn/big-data
  • 노튼, 존. "빅 데이터가 귀하의 개인 정보를 과거의 것으로 만든 이유" 보호자. 2013 년 10 월 5 일. (2013 년 11 월 29 일) http://www.theguardian.com/technology/2013/oct/06/big-data-predictive-analytics-privacy
  • 노벳, 요르단. "2014 년이 '사물 인터넷'의 해가되는 이유입니다."Venturebeat. 2013 년 11 월 25 일. (2013 년 12 월 1 일) http://venturebeat.com/2013/11/25/heres-why-2014-will-be-the-year-of-the-internet-of-things /
  • Romanov, Alex. "빅 데이터 통찰력에 달러 가치 부여." 열광한. 2013 년 7 월 17 일. (2013 년 12 월 4 일) http://www.wired.com/insights/2013/07/putting-a-dollar-value-on-big-data-insights/
  • SAS. "빅 데이터 란?" (2013 년 12 월 1 일) http://www.sas.com/big-data/
  • Sicular, 스베틀라나. "Gartner의 빅 데이터 정의는 3 개의 'V'와 혼동하지 않도록 세 부분으로 구성됩니다." 포브스. 2013 년 3 월 27 일. (2013 년 12 월 1 일) http://www.forbes.com/sites/gartnergroup/2013/03/27/gartners-big-data-definition-consists-of-three-parts-not- 세 대와의 혼동
  • 제타 셋. "빅 데이터와 하둡이란 무엇입니까?" (2013 년 11 월 29 일) http://www.zettaset.com/info-center/what-is-big-data-and-hadoop.php