徐挺耀 中文EN日本語

多少數據才算是大數據?

最近支付大戰開打了,有支付業者打算花5億元發動補貼大戰,其他支付業者也絲毫沒示弱,打算反擊。會想虧錢做的生意不多,為何支付業者都不惜一切要決戰呢?如果聽他們的說法,主要說支付本身是一個重度剛性使用行為,可以得到許多用戶數據,用戶數據在未來是很重要的,所以我們現在不能被落下云云。總之,他們認為有了很多的用戶數據,可以了解很多用戶的狀態,未來就比較有機會。

這就有個有趣的問題,多少用戶數據才算是多呢?弄到這麼多的用戶大數據,我們又能做什麼呢?

有一個最近台積電總裁魏哲家說的小故事很能比擬。魏哲家說汽車晶片荒之後,從來沒跟他聯絡過的車廠高層紛紛打電話給他,表現得很像多年好友。他問對方要下單多少晶圓呢,對方說25片,他傻眼指出,台積電的晶片接單,至少要25000片才能投產啊!難怪你得不到支援啊!因為1輛車上晶片需求雖然不少,但目前這些車也就是1輛車才用到120顆晶片上下,更何況更舊的車用更少,所以車廠高層雖然跳腳,但也無可奈何。

你要做什麼事!決定你要數據量的多少

這就是典型隔行如隔山,對車廠來說,用到十萬個、百萬個晶片可能已經是很大的採購數字,供應商還會來參加比價招標呢,但這個數字對台積電來說根本還不能投產呢。所以數字的大跟小完全取決於你要做什麼。大數據之大,小數據之小,都是存乎一心。

另一個比較個人的體驗,就是很常遇到客戶告訴我,他們已經投了幾百萬上千萬元的數位廣告,希望能把這些數據做某種厲害的應用,打敗谷歌臉書啊!但其實很難說明的,就是這上千萬元的投放廣告費用很高,是客戶晚上都睡不著的數字,但是光是谷歌1年全球廣告營收就超過6兆元,台灣的數位廣告1年超過540億元,你的1000萬元大概占台灣的1/5400。各位可以查查罕見疾病比方馬凡氏症,這類罕見疾病被叫罕見的原因,就是機率是大概1/5000。所以,這樣的預算如果要做怎樣怎樣的厲害應用,恐怕都有點困難。

大家對谷歌、臉書之類巨頭手上的數據總量認識往往很淺,其實,盤點一下你日常使用行為,你就知道他們手上有的數據量:你會開谷歌地圖嗎?你總會用一下IG跟臉書吧?你的手機是安卓嗎?要跟巨頭博數據就跟去賭場博機率一樣,是非常吃力不討好的事情。

做有用的事!不一定要靠天文數據量

但跟客戶這樣講肯定是非常不妙的,還是要幫忙想些辦法啊?還好對於多數公司,未必需要這些數據,才能做好數位轉型。因為,他們手頭的專用目標小數據是不少的。比方說美國郵政對於用戶資料知之甚少,但有個資料他們很熟悉,就是筆跡資料。所以美國郵政的筆跡系統何以辨識98%的郵件標籤,剩下2%讓人類專家找出到底在哪裡。這套系統運作得很好,主要是他們沒有包山包海,很清楚郵政效率提升需要的就是辨識筆跡,而這種筆跡數據在美國郵政多如牛毛,幾乎每個郵件上面都有,可以說是一種隨手可得的大數據。如果美國郵政是想要對寄信用戶的狀態做出準確的分析,他們手上這樣的資料應該很少,也很難做好,這也不是美國郵政的核心生意痛點。所以,還是要從自己有的數據,做出需要什麼樣大數據系統的判斷。

另一個例子是Vigilant是一家數據公司,在美國做警用自動車牌辨識系統,它們要做到這點,手上的資料要多少呢?它們宣稱手上至少有50億筆車牌紀錄(是記錄數不是車牌數,所以沒寫錯),以及美國不少執法機關提供的15億個數據點。這麼多的數據目標也僅僅做自動車牌辨識而已。兩個案例也證明,不一定要有天文數字的數據量才能做有用的事情。即使只有車牌或者筆跡資料,這兩個系統還是表現很好。在多數的演算法應用都還沒普及的現在,其實要改善大部分效率,不需要超大數據。

回到頭來,多少數據對支付產業才是夠的呢?我認為是要看主事者想法,如果只是改善會員服務等等小目標,我想是沒問題的。但長期想要建立一個壟斷性的管道,最好廣告也在我這兒,數據應用也在我這兒,所有東西都在我這兒,我想這樣數據量是不太夠用的。那樣的數據量就算是LINE台灣這種龐然大物,也只能說勉強夠而已,比起控制作業系統的巨頭還是不太夠。畢竟數據蒐集不像是實體展店,全球巨頭是隨時可以住在手機的基本建設上入侵。而且把數據應用都捆在自己家裡,長期來說再多補貼也不夠。比較好的作法也許是支付業者能支持比較開放性的數據生態系,但這一切可能要等支付補貼大戰先打完才行了。

Tim Shyu 電子報

AI agent、行銷科技與內容產業的第一手觀察,不定期直送信箱。

訂閱功能將隨網站上線開通,再等等。


← 所有文章