壹、大數據何以為大
數據現在是個熱點詞匯,關於有了大數據,如何發揮大數據的價值,議論紛紛,而筆者以為,似乎這有點搞錯了原因與結果,就象關聯關系,有A的時候,B與之關聯,而有B的時候,A卻未必關聯,筆者還是從通常的4個V來描述壹下我所認為的大數據思維。
1、大數據的量,數據量足夠大,達到了統計性意義,才有價值。筆者看過的壹個典型的案例就是,例如傳統的,收集幾千條數據,很難發現血緣關系對遺傳病的影響,而壹旦達到2萬條以上,那麽發現這種影響就會非常明顯。那麽對於我們在收集問題時,是為了發現隱藏的知識去收集數據,還是不管有沒有價值地收集,這還是值得商榷的。其實收集數據,對於數據本身,還是可以劃分出壹些標準,確立出層級,結合需求、目標來收集,當然有人會說,這樣的話,將會導致巨大的偏差,例如說喪失了數據的完整性,有壹定的主觀偏向,但是筆者以為,這樣至少可以讓收集到的數據的價值相對較高。
2、大數據的種類,也可以說成數據的維度,對於壹個對象,采取標簽化的方式,進行標記,針對需求進行種類的擴充,和數據的量壹樣,筆者認為同樣是建議根據需求來確立,但是對於標簽,有壹個通常采取的策略,那就是推薦標簽和自定義標簽的問題,分類法其實是人類文明的壹大創舉,采取推薦標簽的方式,可以大幅度降低標簽的總量,而減少後期的規約工作,數據收集時擴充量、擴充維度,但是在數據進入應用狀態時,我們是希望處理的是小數據、少維度,而通過這種推薦、可選擇的方式,可以在標準化基礎上的自定義,而不是毫無規則的擴展,甚至用戶的自定義標簽給予壹定的限制,這樣可以使維度的價值更為顯現。
3、關於時效性,現在進入了讀秒時代,那麽在很短的時間進行問題分析、關聯推薦、決策等等,需要的數據量和數據種類相比以前,往往更多,換個說法,因為現在時效性要求高了,所以處理數據的方式變了,以前可能多人處理,多次處理,現在必須變得單人處理、單次處理,那麽相應的信息系統、工作方式、甚至企業的組織模式,管理績效都需要改變,例如筆者曾經工作的企業,上了ERP系統,設計師意見很大,說壹個典型案例,以往發壹張變更單,發出去工作結束,而上了ERP系統以後,就必須為這張變更單設定物料代碼,設置需要查詢物料的存儲,而這些是以前設計師不管的,又沒有為設計師為這些增加的工作支付獎勵,甚至因為物料的缺少而導致變更單不能發出,以至於設計師工作沒有完成,導致被處罰。但是我們從把工作壹次就做完,提升企業的工作效率角度,這樣的設計變更與物料集成的方式顯然是必須的。那麽作為壹個工作人員,如何讓自己的工作更全面,更完整,避免王府,讓整個企業工作更具有時間的競爭力,提高數據的數量、種類、處理能力是必須的。
4、關於大數據價值,壹種說法是大數據有大價值,還有壹種是相對於以往的結構化數據、少量數據,現在是大數據了,所以大數據的單位價值下降。筆者以為這兩種說法都正確,這是壹個從總體價值來看,壹個從單元數據價值來看的問題。而筆者提出壹個新的關於大數據價值的觀點,那就是真正發揮大數據的價值的另外壹個思路。這個思路就是針對企業的問題,首先要說什麽是問題,筆者說的問題不是壹般意義上的問題,因為壹說問題,大家都以為不好、錯誤等等,而筆者的問題的定義是指狀態與其期望狀態的差異,包括三種模式,
1)通常意義的問題,例如失火了,必須立即撲救,其實這是三種模式中最少的壹種;
2)希望保持狀態,
3)期望的狀態,這是比原來的狀態高壹個層級的。
我們針對問題,提出壹系列解決方案,這些解決方案往往有多種,例如員工的培訓,例如設備的改進,例如組織的方式的變化,當然解決方案包括信息化手段、大數據手段,我們壹樣需要權衡大數據的方法是不是壹種相對較優的方法,如果是,那麽用這種手段去解決,那麽也就是有價值了。例如筆者知道的壹個案例,壹個企業某產品部件偶爾會出現問題,企業經歷數次後決定針對設備上了壹套工控系統,記錄材料的溫度,結果又壹次出現問題時,進行分析認為,如果工人正常上班操作,不應該有這樣的數據記錄,而經過與值班工人的質詢,值班工人承認其上晚班時睡覺,沒有及時處理。再往後,同樣的問題再沒有再次發生。
總結起來,筆者以為大數據思維的核心還是要落實到價值上,面向問題,收集足夠量的數據,足夠維度的數據,達到具有統計學意義,也可以滿足企業生產、客戶需求、甚至競爭的時效要求,而不是壹味為了大數據而大數據,這樣才是壹種務實、有效的正確思維方式,是壹線大數據的有效的項目推進方式,在這樣的思維模式基礎上,采取滾雪球方式,把大數據逐步展開,才真正贏來大數據百花齊放的春天。
二、大數據思維方式
大數據研究專家舍恩伯格指出,大數據時代,人們對待數據的思維方式會發生如下三個變化:
1)人們處理的數據從樣本數據變成全部數據;
2)由於是全樣本數據,人們不得不接受數據的混雜性,而放棄對精確性的追求;
3)人類通過對大數據的處理,放棄對因果關系的渴求,轉而關註相關關系。
事實上,大數據時代帶給人們的思維方式的深刻轉變遠不止上述三個方面。筆者認為,大數據思維最關鍵的轉變在於從自然思維轉向智能思維,使得大數據像具有生命力壹樣,獲得類似於“人腦”的智能,甚至智慧。
1、總體思維
社會科學研究社會現象的總體特征,以往采樣壹直是主要數據獲取手段,這是人類在無法獲得總體數據信息條件下的無奈選擇。在大數據時代,人們可以獲得與分析更多的數據,甚至是與之相關的所有數據,而不再依賴於采樣,從而可以帶來更全面的認識,可以更清楚地發現樣本無法揭示的細節信息。
正如舍恩伯格總結道:“我們總是習慣把統計抽樣看作文明得以建立的牢固基石,就如同幾何學定理和萬有引力定律壹樣。但是,統計抽樣其實只是為了在技術受限的特定時期,解決當時存在的壹些特定問題而產生的,其歷史不足壹百年。如今,技術環境已經有了很大的改善。在大數據時代進行抽樣分析就像是在汽車時代騎馬壹樣。
在某些特定的情況下,我們依然可以使用樣本分析法,但這不再是我們分析數據的主要方式。”也就是說,在大數據時代,隨著數據收集、存儲、分析技術的突破性發展,我們可以更加方便、快捷、動態地獲得研究對象有關的所有數據,而不再因諸多限制不得不采用樣本研究方法,相應地,思維方式也應該從樣本思維轉向總體思維,從而能夠更加全面、立體、系統地認識總體狀況。
2、容錯思維
在小數據時代,由於收集的樣本信息量比較少,所以必須確保記錄下來的數據盡量結構化、精確化,否則,分析得出的結論在推及總體上就會“南轅北轍”,因此,就必須十分註重精確思維。然而,在大數據時代,得益於大數據技術的突破,大量的非結構化、異構化的數據能夠得到儲存和分析,這壹方面提升了我們從數據中獲取知識和洞見的能力,另壹方面也對傳統的精確思維造成了挑戰。
舍恩伯格指出,“執迷於精確性是信息缺乏時代和模擬時代的產物。只有5%的數據是結構化且能適用於傳統數據庫的。如果不接受混亂,剩下95%的非結構化數據都無法利用,只有接受不精確性,我們才能打開壹扇從未涉足的世界的窗戶”。也就是說,在大數據時代,思維方式要從精確思維轉向容錯思維,當擁有海量即時數據時,絕對的精準不再是追求的主要目標,適當忽略微觀層面上的精確度,容許壹定程度的錯誤與混雜,反而可以在宏觀層面擁有更好的知識和洞察力。
3、相關思維
在小數據世界中,人們往往執著於現象背後的因果關系,試圖通過有限樣本數據來剖析其中的內在機理。小數據的另壹個缺陷就是有限的樣本數據無法反映出事物之間的普遍性的相關關系。而在大數據時代,人們可以通過大數據技術挖掘出事物之間隱蔽的相關關系,獲得更多的認知與洞見,運用這些認知與洞見就可以幫助我們捕捉現在和預測未來,而建立在相關關系分析基礎上的預測正是大數據的核心議題。
通過關註線性的相關關系,以及復雜的非線性相關關系,可以幫助人們看到很多以前不曾註意的聯系,還可以掌握以前無法理解的復雜技術和社會動態,相關關系甚至可以超越因果關系,成為我們了解這個世界的更好視角。舍恩伯格指出,大數據的出現讓人們放棄了對因果關系的渴求,轉而關註相關關系,人們只需知道“是什麽”,而不用知道“為什麽”。我們不必非得知道事物或現象背後的復雜深層原因,而只需要通過大數據分析獲知“是什麽”就意義非凡,這會給我們提供非常新穎且有價值的觀點、信息和知識。也就是說,在大數據時代,思維方式要從因果思維轉向相關思維,努力顛覆千百年來人類形成的傳統思維模式和固有偏見,才能更好地分享大數據帶來的深刻洞見。
4、智能思維
不斷提高機器的自動化、智能化水平始終是人類社會長期不懈努力的方向。計算機的出現極大地推動了自動控制、人工智能和機器學習等新技術的發展,“機器人”研發也取得了突飛猛進的成果並開始壹定應用。應該說,自進入到信息社會以來,人類社會的自動化、智能化水平已得到明顯提升,但始終面臨瓶頸而無法取得突破性進展,機器的思維方式仍屬於線性、簡單、物理的自然思維,智能水平仍不盡如人意。
但是,大數據時代的到來,可以為提升機器智能帶來契機,因為大數據將有效推進機器思維方式由自然思維轉向智能思維,這才是大數據思維轉變的關鍵所在、核心內容。眾所周知,人腦之所以具有智能、智慧,就在於它能夠對周遭的數據信息進行全面收集、邏輯判斷和歸納總結,獲得有關事物或現象的認識與見解。同樣,在大數據時代,隨著物聯網、雲計算、社會計算、可視技術等的突破發展,大數據系統也能夠自動地搜索所有相關的數據信息,並進而類似“人腦”壹樣主動、立體、邏輯地分析數據、做出判斷、提供洞見,那麽,無疑也就具有了類似人類的智能思維能力和預測未來的能力。
“智能、智慧”是大數據時代的顯著特征,大數據時代的思維方式也要求從自然思維轉向智能思維,不斷提升機器或系統的社會計算能力和智能化水平,從而獲得具有洞察力和新價值的東西,甚至類似於人類的“智慧”。
舍恩伯格指出,“大數據開啟了壹個重大的時代轉型。就像望遠鏡讓我們感受宇宙,顯微鏡讓我們能夠觀測到微生物壹樣,大數據正在改變我們的生活以及理解世界的方式,成為新發明和新服務的源泉,而更多的改變正蓄勢待發”。
大數據時代將帶來深刻的思維轉變,大數據不僅將改變每個人的日常生活和工作方式,改變商業組織和社會組織的運行方式,而且將從根本上奠定國家和社會治理的基礎數據,徹底改變長期以來國家與社會諸多領域存在的“不可治理”狀況,使得國家和社會治理更加透明、有效和智慧。