當(dāng)前位置：大數(shù)據(jù) → 方案 → 正文

大數(shù)據(jù)建模需要了解的九大形式

責(zé)任編輯：editor004 |來源：企業(yè)網(wǎng)D1Net 2013-11-15 18:04:22 本文摘自：中文互聯(lián)網(wǎng)數(shù)據(jù)研究資訊中心

數(shù)據(jù)挖掘是利用業(yè)務(wù)知識(shí)從數(shù)據(jù)中發(fā)現(xiàn)和解釋知識(shí)（或稱為模式）的過程，這種知識(shí)是以自然或者人工形式創(chuàng)造的新知識(shí)。

當(dāng)前的數(shù)據(jù)挖掘形式，是在20世紀(jì)90年代實(shí)踐領(lǐng)域誕生的，是在集成數(shù)據(jù)挖掘算法平臺(tái)發(fā)展的支撐下適合商業(yè)分析的一種形式。也許是因?yàn)閿?shù)據(jù)挖掘源于實(shí)踐而非理論，在其過程的理解上不太引人注意。20世紀(jì)90年代晚期發(fā)展的CRISP-DM，逐漸成為數(shù)據(jù)挖掘過程的一種標(biāo)準(zhǔn)化過程，被越來越多的數(shù)據(jù)挖掘?qū)嵺`者成功運(yùn)用和遵循。

雖然CRISP-DM能夠指導(dǎo)如何實(shí)施數(shù)據(jù)挖掘，但是它不能解釋數(shù)據(jù)挖掘是什么或者為什么適合這樣做。在本文中我將闡述我提出數(shù)據(jù)挖掘的九種準(zhǔn)則或“定律”（其中大多數(shù)為實(shí)踐者所熟知）以及另外其它一些熟知的解釋。開始從理論上（不僅僅是描述上）來解釋數(shù)據(jù)挖掘過程。

我的目的不是評(píng)論CRISP-DM，但CRISP-DM的許多概念對(duì)于理解數(shù)據(jù)挖掘是至關(guān)重要的，本文也將依賴于CRISP-DM的常見術(shù)語。CRISP-DM僅僅是論述這個(gè)過程的開始。

第一，目標(biāo)律：業(yè)務(wù)目標(biāo)是所有數(shù)據(jù)解決方案的源頭。

它定義了數(shù)據(jù)挖掘的主題：數(shù)據(jù)挖掘關(guān)注解決業(yè)務(wù)業(yè)問題和實(shí)現(xiàn)業(yè)務(wù)目標(biāo)。數(shù)據(jù)挖掘主要不是一種技術(shù)，而是一個(gè)過程，業(yè)務(wù)目標(biāo)是它的的核心。沒有業(yè)務(wù)目標(biāo)，沒有數(shù)據(jù)挖掘（不管這種表述是否清楚）。因此這個(gè)準(zhǔn)則也可以說成：數(shù)據(jù)挖掘是業(yè)務(wù)過程。

第二，知識(shí)律：業(yè)務(wù)知識(shí)是數(shù)據(jù)挖掘過程每一步的核心。

這里定義了數(shù)據(jù)挖掘過程的一個(gè)關(guān)鍵特征。CRISP-DM的一種樸素的解讀是業(yè)務(wù)知識(shí)僅僅作用于數(shù)據(jù)挖掘過程開始的目標(biāo)的定義與最后的結(jié)果的實(shí)施，這將錯(cuò)過數(shù)據(jù)挖掘過程的一個(gè)關(guān)鍵屬性，即業(yè)務(wù)知識(shí)是每一步的核心。

為了方便理解，我使用CRISP-DM階段來說明：

· 商業(yè)理解必須基于業(yè)務(wù)知識(shí)，所以數(shù)據(jù)挖掘目標(biāo)必須是業(yè)務(wù)目標(biāo)的映射（這種映射也基于數(shù)據(jù)知識(shí)和數(shù)據(jù)挖掘知識(shí)）；

· 數(shù)據(jù)理解使用業(yè)務(wù)知識(shí)理解與業(yè)務(wù)問題相關(guān)的數(shù)據(jù)，以及它們是如何相關(guān)的；

· 數(shù)據(jù)預(yù)處理就是利用業(yè)務(wù)知識(shí)來塑造數(shù)據(jù)，使得業(yè)務(wù)問題可以被提出和解答（更詳盡的第三條—準(zhǔn)備律）；

· 建模是使用數(shù)據(jù)挖掘算法創(chuàng)建預(yù)測(cè)模型，同時(shí)解釋模型和業(yè)務(wù)目標(biāo)的特點(diǎn)，也就是說理解它們之間的業(yè)務(wù)相關(guān)性；

· 評(píng)估是模型對(duì)理解業(yè)務(wù)的影響；

· 實(shí)施是將數(shù)據(jù)挖掘結(jié)果作用于業(yè)務(wù)過程；

總之，沒有業(yè)務(wù)知識(shí)，數(shù)據(jù)挖掘過程的每一步都是無效的，也沒有“純粹的技術(shù)”步驟。業(yè)務(wù)知識(shí)指導(dǎo)過程產(chǎn)生有益的結(jié)果，并使得那些有益的結(jié)果得到認(rèn)可。數(shù)據(jù)挖掘是一個(gè)反復(fù)的過程，業(yè)務(wù)知識(shí)是它的核心，驅(qū)動(dòng)著結(jié)果的持續(xù)改善。

這背后的原因可以用“鴻溝的表現(xiàn)”（chasm of representation）來解釋（Alan Montgomery在20世紀(jì)90年代對(duì)數(shù)據(jù)挖掘提出的一個(gè)觀點(diǎn)）。Montgomery指出數(shù)據(jù)挖掘目標(biāo)涉及到現(xiàn)實(shí)的業(yè)務(wù)，然而數(shù)據(jù)僅能表示現(xiàn)實(shí)的一部分；數(shù)據(jù)和現(xiàn)實(shí)世界是有差距（或“鴻溝”）的。在數(shù)據(jù)挖掘過程中，業(yè)務(wù)知識(shí)來彌補(bǔ)這一差距，在數(shù)據(jù)中無論發(fā)現(xiàn)什么，只有使用業(yè)務(wù)知識(shí)解釋才能顯示其重要性，數(shù)據(jù)中的任何遺漏必須通過業(yè)務(wù)知識(shí)彌補(bǔ)。只有業(yè)務(wù)知識(shí)才能彌補(bǔ)這種缺失，這是業(yè)務(wù)知識(shí)為什么是數(shù)據(jù)挖掘過程每一步驟的核心的原因。

第三，準(zhǔn)備律：數(shù)據(jù)預(yù)處理比數(shù)據(jù)挖掘其他任何一個(gè)過程都重要。

這是數(shù)據(jù)挖掘著名的格言，數(shù)據(jù)挖掘項(xiàng)目中最費(fèi)力的事是數(shù)據(jù)獲取和預(yù)處理。非正式估計(jì)，其占用項(xiàng)目的時(shí)間為50%-80%。最簡單的解釋可以概括為“數(shù)據(jù)是困難的”，經(jīng)常采用自動(dòng)化減輕這個(gè)“問題”的數(shù)據(jù)獲取、數(shù)據(jù)清理、數(shù)據(jù)轉(zhuǎn)換等數(shù)據(jù)預(yù)處理各部分的工作量。雖然自動(dòng)化技術(shù)是有益的，支持者相信這項(xiàng)技術(shù)可以減少數(shù)據(jù)預(yù)處理過程中的大量的工作量，但這也是誤解數(shù)據(jù)預(yù)處理在數(shù)據(jù)挖掘過程中是必須的原因。

數(shù)據(jù)預(yù)處理的目的是把數(shù)據(jù)挖掘問題轉(zhuǎn)化為格式化的數(shù)據(jù)，使得分析技術(shù)（如數(shù)據(jù)挖掘算法）更容易利用它。數(shù)據(jù)任何形式的變化（包括清理、最大最小值轉(zhuǎn)換、增長等）意味著問題空間的變化，因此這種分析必須是探索性的。這是數(shù)據(jù)預(yù)處理重要的原因，并且在數(shù)據(jù)挖掘過程中占有如此大的工作量，這樣數(shù)據(jù)挖掘者可以從容地操縱問題空間，使得容易找到適合分析他們的方法。

有兩種方法“塑造”這個(gè)問題空間。第一種方法是將數(shù)據(jù)轉(zhuǎn)化為可以分析的完全格式化的數(shù)據(jù)，比如，大多數(shù)數(shù)據(jù)挖掘算法需要單一表格形式的數(shù)據(jù)，一個(gè)記錄就是一個(gè)樣例。數(shù)據(jù)挖掘者都知道什么樣的算法需要什么樣的數(shù)據(jù)形式，因此可以將數(shù)據(jù)轉(zhuǎn)化為一個(gè)合適的格式。第二種方法是使得數(shù)據(jù)能夠含有業(yè)務(wù)問題的更多的信息，例如，某些領(lǐng)域的一些數(shù)據(jù) 挖掘問題，數(shù)據(jù)挖掘者可以通過業(yè)務(wù)知識(shí)和數(shù)據(jù)知識(shí)知道這些。通過這些領(lǐng)域的知識(shí)，數(shù)據(jù)挖掘者通過操縱問題空間可能更容易找到一個(gè)合適的技術(shù)解決方案。

因此，通過業(yè)務(wù)知識(shí)、數(shù)據(jù)知識(shí)、數(shù)據(jù)挖掘知識(shí)從根本上使得數(shù)據(jù)預(yù)處理更加得心應(yīng)手。數(shù)據(jù)預(yù)處理的這些方面并不能通過簡單的自動(dòng)化實(shí)現(xiàn)。

這個(gè)定律也解釋了一個(gè)有疑義的現(xiàn)象，也就是雖然經(jīng)過數(shù)據(jù)獲取、清理、融合等方式創(chuàng)建一個(gè)數(shù)據(jù)倉庫，但是數(shù)據(jù)預(yù)處理仍然是必不可少的，仍然占有數(shù)據(jù)挖掘過程一半以上的工作量。此外，就像CRISP-DM展示的那樣，即使經(jīng)過了主要的數(shù)據(jù)預(yù)處理階段，在創(chuàng)建一個(gè)有用的模型的反復(fù)過程中，進(jìn)一步的數(shù)據(jù)預(yù)處理的必要的。

第四，試驗(yàn)律（NFL律：No Free Lunch）：對(duì)于數(shù)據(jù)挖掘者來說，天下沒有免費(fèi)的午餐，一個(gè)正確的模型只有通過試驗(yàn)（experiment）才能被發(fā)現(xiàn)。

機(jī)器學(xué)習(xí)有一個(gè)原則：如果我們充分了解一個(gè)問題空間（problem space），我們可以選擇或設(shè)計(jì)一個(gè)找到最優(yōu)方案的最有效的算法。一個(gè)卓越算法的參數(shù)依賴于數(shù)據(jù)挖掘問題空間一組特定的屬性集，這些屬性可以通過分析發(fā) 現(xiàn)或者算法創(chuàng)建。但是，這種觀點(diǎn)來自于一個(gè)錯(cuò)誤的思想，在數(shù)據(jù)挖掘過程中數(shù)據(jù)挖掘者將問題公式化，然后利用算法找到解決方法。事實(shí)上，數(shù)據(jù)挖掘者將問題公式化和尋找解決方法是同時(shí)進(jìn)行的—–算法僅僅是幫助數(shù)據(jù)挖掘者的一個(gè)工具。

有五種因素說明試驗(yàn)對(duì)于尋找數(shù)據(jù)挖掘解決方案是必要的：

· 數(shù)據(jù)挖掘項(xiàng)目的業(yè)務(wù)目標(biāo)定義了興趣范圍（定義域），數(shù)據(jù)挖掘目標(biāo)反映了這一點(diǎn)；

· 與業(yè)務(wù)目標(biāo)相關(guān)的數(shù)據(jù)及其相應(yīng)的數(shù)據(jù)挖掘目標(biāo)是在這個(gè)定義域上的數(shù)據(jù)挖掘過程產(chǎn)生的；

· 這些過程受規(guī)則限制，而這些過程產(chǎn)生的數(shù)據(jù)反映了這些規(guī)則；

· 在這些過程中，數(shù)據(jù)挖掘的目的是通過模式發(fā)現(xiàn)技術(shù)（數(shù)據(jù)挖掘算法）和可以解釋這個(gè)算法結(jié)果的業(yè)務(wù)知識(shí)相結(jié)合的方法來揭示這個(gè)定義域上的規(guī)則；

· 數(shù)據(jù)挖掘需要在這個(gè)域上生成相關(guān)數(shù)據(jù)，這些數(shù)據(jù)含有的模式不可避免地受到這些規(guī)則的限制。

在這里強(qiáng)調(diào)一下最后一點(diǎn)，在數(shù)據(jù)挖掘中改變業(yè)務(wù)目標(biāo)，CRISP-DM有所暗示，但經(jīng)常不易被覺察到。廣為所知的CRISP-DM過程不是下一個(gè)步驟僅接著上一個(gè)步驟的“瀑布”式的過程。事實(shí)上，在項(xiàng)目中的任何地方都可以進(jìn)行任何CRISP-DM步驟，同樣商業(yè)理解也可以存在于任何一個(gè)步驟。業(yè)務(wù)目標(biāo)不是簡單地在開始就給定，它貫穿于整個(gè)過程。這也許可以解釋一些數(shù)據(jù)挖掘者在沒有清晰的業(yè)務(wù)目標(biāo)的情況下開始項(xiàng)目，他們知道業(yè)務(wù)目標(biāo)也是數(shù)據(jù)挖掘的一個(gè)結(jié)果，不是靜態(tài)地給定。

Wolpert的“沒有免費(fèi)的午餐”理論已經(jīng)應(yīng)用于機(jī)器學(xué)習(xí)領(lǐng)域，無偏的狀態(tài)好于（如一個(gè)具體的算法）任何其他可能的問題（數(shù)據(jù)集）出現(xiàn)的平均狀態(tài)。這是因?yàn)椋绻覀兛紤]所有可能的問題，他們的解決方法是均勻分布的，以至于一個(gè)算法（或偏倚）對(duì)一個(gè)子集是有利的，而對(duì)另一個(gè)子集是不利的。這與數(shù)據(jù)挖掘者所知的具有驚人的相似性，沒有一個(gè)算法適合每一個(gè)問題。但是經(jīng) 過數(shù)據(jù)挖掘處理的問題或數(shù)據(jù)集絕不是隨機(jī)的，也不是所有可能問題的均勻分布，他們代表的是一個(gè)有偏差的樣本，那么為什么要應(yīng)用NFL的結(jié)論？答案涉及到上面提到的因素：問題空間初始是未知的，多重問題空間可能和每一個(gè)數(shù)據(jù)挖掘目標(biāo)相關(guān)，問題空間可能被數(shù)據(jù)預(yù)處理所操縱，模型不能通過技術(shù)手段評(píng)估，業(yè)務(wù)問題本身可能會(huì)變化。由于這些原因，數(shù)據(jù)挖掘問題空間在數(shù)據(jù)挖掘過程中展開，并且在這個(gè)過程中是不斷變化的，以至于在有條件的約束下，用算法模擬一個(gè)隨機(jī)選擇的數(shù)據(jù)集是有效的。對(duì)于數(shù)據(jù)挖掘者來說：沒有免費(fèi)的午餐。

這大體上描述了數(shù)據(jù) 挖掘過程。但是，在有條件限制某些情況下，比如業(yè)務(wù)目標(biāo)是穩(wěn)定的，數(shù)據(jù)和其預(yù)處理是穩(wěn)定的，一個(gè)可接受的算法或算法組合可以解決這個(gè)問題。在這些情況下，一般的數(shù)據(jù)挖掘過程中的步驟將會(huì)減少。但是，如果這種情況穩(wěn)定是持續(xù)的，數(shù)據(jù)挖掘者的午餐是免費(fèi)的，或者至少相對(duì)便宜的。像這樣的穩(wěn)定性是臨時(shí)的，因?yàn)?對(duì)數(shù)據(jù)的業(yè)務(wù)理解（第二律）和對(duì)問題的理解（第九律）都會(huì)變化的。

第五，模式律（大衛(wèi)律）：數(shù)據(jù)中總含有模式。

這條規(guī)律最早由David Watkins提出。我們可能預(yù)料到一些數(shù)據(jù)挖掘項(xiàng)目會(huì)失敗，因?yàn)榻鉀Q業(yè)務(wù)問題的模式并不存在于數(shù)據(jù)中，但是這與數(shù)據(jù)挖掘者的實(shí)踐經(jīng)驗(yàn)并不相關(guān)。

前文的闡述已經(jīng)提到，這是因?yàn)椋涸谝粋€(gè)與業(yè)務(wù)相關(guān)的數(shù)據(jù)集中總會(huì)發(fā)現(xiàn)一些有趣的東西，以至于即使一些期望的模式不能被發(fā)現(xiàn)，但其他的一些有用的東西可能會(huì)被發(fā)現(xiàn)（這與數(shù)據(jù)挖掘者的實(shí)踐經(jīng)驗(yàn)是相關(guān)的）；除非業(yè)務(wù)專家期望的模式存在，否則數(shù)據(jù)挖掘項(xiàng)目不會(huì)進(jìn)行，這不應(yīng)感到奇怪，因?yàn)闃I(yè)務(wù)專家通常是對(duì)的。

然而，Watkins提出一個(gè)更簡單更直接的觀點(diǎn)：“數(shù)據(jù)中總含有模式。”這與數(shù)據(jù)挖掘者的經(jīng)驗(yàn)比前面的闡述更一致。這個(gè)觀點(diǎn)后來經(jīng)過Watkins修正，基于客戶關(guān)系的數(shù)據(jù)挖掘項(xiàng)目，總是存在著這樣的模式即客戶未來的行為總是和先前的行為相關(guān)，顯然這些模式是有利可圖的（Watkins的客戶關(guān)系管理定律）。但是，數(shù)據(jù)挖掘者的經(jīng)驗(yàn)不僅僅局限于客戶關(guān)系管理問題，任何數(shù)據(jù)挖掘問題都會(huì)存在模式（Watkins的通用律）。

Watkins的通用律解釋如下：

數(shù)據(jù)挖掘項(xiàng)目的業(yè)務(wù)目標(biāo)定義了興趣范圍（定義域），數(shù)據(jù)挖掘目標(biāo)反映了這一點(diǎn)；

與業(yè)務(wù)目標(biāo)相關(guān)的數(shù)據(jù)及其相應(yīng)的數(shù)據(jù)挖掘目標(biāo)是在這個(gè)定義域上的數(shù)據(jù)挖掘過程產(chǎn)生的；

這些過程受規(guī)則限制，而這些過程產(chǎn)生的數(shù)據(jù)反映了這些規(guī)則；

在這些過程中，數(shù)據(jù)挖掘的目的是通過模式發(fā)現(xiàn)技術(shù)（數(shù)據(jù)挖掘算法）和可以解釋這個(gè)算法結(jié)果的業(yè)務(wù)知識(shí)相結(jié)合的方法來揭示這個(gè)定義域上的規(guī)則；

數(shù)據(jù)挖掘需要在這個(gè)域上生成相關(guān)數(shù)據(jù)，這些數(shù)據(jù)含有的模式不可避免地受到這些規(guī)則的限制。

總結(jié)這一觀點(diǎn)：數(shù)據(jù)中總存在模式，因?yàn)樵谶@過程中不可避免產(chǎn)生數(shù)據(jù)這樣的副產(chǎn)品。為了發(fā)掘模式，過程從（你已經(jīng)知道它）—–業(yè)務(wù)知識(shí)開始。

利用業(yè)務(wù)知識(shí)發(fā)現(xiàn)模式也是一個(gè)反復(fù)的過程；這些模式也對(duì)業(yè)務(wù)知識(shí)有貢獻(xiàn)，同時(shí)業(yè)務(wù)知識(shí)是解釋模式的主要因素。在這種反復(fù)的過程中，數(shù)據(jù)挖掘算法簡單地連接了業(yè)務(wù)知識(shí)和隱藏的模式。

如果這個(gè)解釋是正確的，那么大衛(wèi)律是完全通用的。除非沒有相關(guān)的數(shù)據(jù)的保證，否則在每個(gè)定義域的每一個(gè)數(shù)據(jù)挖掘問題總是存在模式的。

第六，洞察律：數(shù)據(jù)挖掘增大對(duì)業(yè)務(wù)的認(rèn)知。

數(shù) 據(jù)挖掘是如何產(chǎn)生洞察力的？這個(gè)定律接近了數(shù)據(jù)挖掘的核心：為什么數(shù)據(jù)挖掘必須是一個(gè)業(yè)務(wù)過程而不是一個(gè)技術(shù)過程。業(yè)務(wù)問題是由人而非算法解決的。數(shù)據(jù)挖掘者和業(yè)務(wù)專家從問題中找到解決方案，即從問題的定義域上達(dá)到業(yè)務(wù)目標(biāo)需要的模式。數(shù)據(jù)挖掘完全或部分有助于這個(gè)認(rèn)知過程。數(shù)據(jù)挖掘算法揭示的模式通常不是人類以正常的方式所能認(rèn)識(shí)到的。綜合這些算法和人類正常的感知的數(shù)據(jù)挖掘過程在本質(zhì)上是敏捷的。在數(shù)據(jù)挖掘過程中，問題解決者解釋數(shù)據(jù)挖掘算法產(chǎn)生的結(jié) 果，并統(tǒng)一到業(yè)務(wù)理解上，因此這是一個(gè)業(yè)務(wù)過程。

這類似于“智能放大器”的概念，在早期的人工智能的領(lǐng)域，AI的第一個(gè)實(shí)際成果不是智能機(jī)器，而是被稱為“智能放大器”的工具，它能夠協(xié)助人類使用者提高獲取有效信息的能力。數(shù)據(jù)挖掘提供一個(gè)類似的“智能放大器”，幫助業(yè)務(wù)專家解決他們不能單獨(dú)完成的業(yè)務(wù)問題。

總之，數(shù)據(jù)挖掘算法提供一種超越人類以正常方式探索模式的能力，數(shù)據(jù)挖掘過程允許數(shù)據(jù)挖掘者和業(yè)務(wù)專家將這種能力融合在他們的各自的問題的中和業(yè)務(wù)過程中。

第七，預(yù)測(cè)律：預(yù)測(cè)提高了信息泛化能力。

“預(yù)測(cè)”已經(jīng)成為數(shù)據(jù)挖掘模型可以做什么的可接受的描述，即我們常說的“預(yù)測(cè)模型”和“預(yù)測(cè)分析”。這是因?yàn)樵S多流行的數(shù)據(jù)挖掘模型經(jīng)常使用“預(yù)測(cè)最可能的結(jié)果”（或者解釋可能的結(jié)果如何有可能）。這種方法是分類和回歸模型的典型應(yīng)用。

但是，其他類型的數(shù)據(jù)挖掘模型，比如聚類和關(guān)聯(lián)模型也有“預(yù)測(cè)”的特征。這是一個(gè)含義比較模糊的術(shù)語。一個(gè)聚類模型被描述為“預(yù)測(cè)”一個(gè)個(gè)體屬于哪個(gè)群體，一個(gè)關(guān)聯(lián)模型可能被描述為基于已知基本屬性“預(yù)測(cè)”一個(gè)或更多屬性。

同樣我們也可以分析“預(yù)測(cè)”這個(gè)術(shù)語在不同的主題中的應(yīng)用：一個(gè)分類模型可能被說成可以預(yù)測(cè)客戶行為—-更加確切的說它可以預(yù)測(cè)以某種確定行為的目標(biāo)客戶，即使不是所有的目標(biāo)個(gè)體的行為都符合“預(yù)測(cè)”的結(jié)果。一個(gè)詐騙檢測(cè)模型可能被說成可以預(yù)測(cè)個(gè)別交易是否具有高風(fēng)險(xiǎn)性，即使不是所有的預(yù)測(cè)的交易都有欺詐行為。

“預(yù)測(cè)”這個(gè)術(shù)語廣泛的使用導(dǎo)致了所謂的“預(yù)測(cè)分析”被作為數(shù)據(jù)挖掘的總稱，并且在業(yè)務(wù)解決方案中得到了廣泛的應(yīng)用。但是我們應(yīng)該意識(shí)到這不是日常所說的“預(yù)測(cè)”，我們不能期望預(yù)測(cè)一個(gè)特殊個(gè)體的行為或者一個(gè)特別的欺詐調(diào)查結(jié)果。

那么，在這個(gè)意義下的“預(yù)測(cè)”是什么？分類、回歸、聚類和關(guān) 聯(lián)算法以及他們集成模型有什么共性呢？答案在于“評(píng)分”，這是預(yù)測(cè)模型應(yīng)用到一個(gè)新樣例的方式。模型產(chǎn)生一個(gè)預(yù)估值或評(píng)分，這是這個(gè)樣例的新信息的一部分；在概括和歸納的基礎(chǔ)上，這個(gè)樣例的可利用信息得到了提高，模式被算法發(fā)現(xiàn)和模型具體化。值得注意的是這個(gè)新信息不是在“給定”意義上的“數(shù)據(jù)”，它僅有統(tǒng)計(jì)學(xué)意義。

第八，價(jià)值律：數(shù)據(jù)挖掘的結(jié)果的價(jià)值不取決于模型的穩(wěn)定性或預(yù)測(cè)的準(zhǔn)確性。

準(zhǔn)確性和穩(wěn)定性是預(yù)測(cè)模型常用的兩個(gè)度量。準(zhǔn)確性是指正確的預(yù)測(cè)結(jié)果所占的比例；穩(wěn)定性是指當(dāng)創(chuàng)建模型的數(shù)據(jù)改變時(shí)，用于同一口徑的預(yù)測(cè)數(shù)據(jù)，其預(yù)測(cè)結(jié)果變化有多大（或多小）。鑒于數(shù)據(jù)挖掘中預(yù)測(cè)概念的核心角色，一個(gè)預(yù)測(cè)模型的準(zhǔn)確性和穩(wěn)定性常被認(rèn)為決定了其結(jié)果的價(jià)值的大小，實(shí)際上并非如此。

體現(xiàn)預(yù)測(cè)模型價(jià)值的有兩種方式：一種是用模型的預(yù)測(cè)結(jié)果來改善或影響行為，另一種是模型能夠傳遞導(dǎo)致改變策略的見解（或新知識(shí)）。

對(duì)于后者，傳遞出的任何新知識(shí)的價(jià)值和準(zhǔn)確性的聯(lián)系并不那么緊密；一些模型的預(yù)測(cè)能力可能有必要使我們相信發(fā)現(xiàn)的模式是真實(shí)的。然而，一個(gè)難以理解的復(fù)雜的或者完全不透明的模型的預(yù)測(cè)結(jié)果具有高準(zhǔn)確性，但傳遞的知識(shí)也不是那么有見地；然而，一個(gè)簡單的低準(zhǔn)確度的模型可能傳遞出更有用的見解。

準(zhǔn)確性和價(jià)值之間的分離在改善行為的情況下并不明顯，然而一個(gè)突出問題是“預(yù)測(cè)模型是為了正確的事，還是為了正確的原因?” 換句話說，一個(gè)模型的價(jià)值和它的預(yù)測(cè)準(zhǔn)確度一樣，都源自它的業(yè)務(wù)問題。例如，客戶流失模型可能需要高的預(yù)測(cè)準(zhǔn)確度，否則對(duì)于業(yè)務(wù)上的指導(dǎo)不會(huì)那么有效。相反的是一個(gè)準(zhǔn)確度高的客戶流失模型可能提供有效的指導(dǎo)，保留住老客戶，但也僅僅是最少利潤客戶群體的一部分。如果不適合業(yè)務(wù)問題，高準(zhǔn)確度并不能提高模型的價(jià)值。

模型穩(wěn)定性同樣如此，雖然穩(wěn)定性是預(yù)測(cè)模型的有趣的度量，穩(wěn)定性不能代替模型提供業(yè)務(wù)理解的能力或解決業(yè)務(wù)問題，其它技術(shù)手段也是如此。

總之，預(yù)測(cè)模型的價(jià)值不是由技術(shù)指標(biāo)決定的。數(shù)據(jù)挖掘者應(yīng)該在模型不損害業(yè)務(wù)理解和適應(yīng)業(yè)務(wù)問題的情況下關(guān)注預(yù)測(cè)準(zhǔn)確度、模型穩(wěn)定性以及其它的技術(shù)度量。

第九，變化律：所有的模式因業(yè)務(wù)變化而變化。

數(shù)據(jù)挖掘發(fā)現(xiàn)的模式不是永遠(yuǎn)不變的。數(shù)據(jù)挖掘的許多應(yīng)用是眾所周知的，但是這個(gè)性質(zhì)的普遍性沒有得到廣泛的重視。

數(shù)據(jù)挖掘在市場(chǎng)營銷和CRM方面的應(yīng)用很容易理解，客戶行為模式隨著時(shí)間的變化而變化。行為的變化、市場(chǎng)的變化、競爭的變化以及整個(gè)經(jīng)濟(jì)形勢(shì)的變化，預(yù)測(cè)模型會(huì)因這些變化而過時(shí)，當(dāng)他們不能準(zhǔn)確預(yù)測(cè)時(shí)，應(yīng)當(dāng)定期更新。

數(shù)據(jù)挖掘在欺詐模型和風(fēng)險(xiǎn)模型的應(yīng)用中同樣如此，隨著環(huán)境的變化欺詐行為也在變化，因?yàn)樽锓敢淖冃袨橐员３诸I(lǐng)先于反欺詐。欺詐檢測(cè)的應(yīng)用必須設(shè)計(jì)為就像處理舊的、熟悉的欺詐行為一樣能夠處理新的、未知類型的欺詐行為。

某些種類的數(shù)據(jù)挖掘可能被認(rèn)為發(fā)現(xiàn)的模式不會(huì)隨時(shí)間而變化，比如數(shù)據(jù)挖掘在科學(xué)上的應(yīng)用，我們有沒有發(fā)現(xiàn)不變的普遍的規(guī)律？也許令人驚奇的是，答案是即使是這些模式也期望得到改變。理由是這些模式并不是簡單的存在于這個(gè)世界上的規(guī)則，而是數(shù)據(jù)的反應(yīng)—-這些規(guī)則可能在某些領(lǐng)域確實(shí)是靜態(tài)的。

然而，數(shù)據(jù)挖掘發(fā)現(xiàn)的模式是認(rèn)知過程的一部分，是數(shù)據(jù)挖掘在數(shù)據(jù)描述的世界與觀測(cè)者或業(yè)務(wù)專家的認(rèn)知之間建立的一個(gè)動(dòng)態(tài)過程。因?yàn)槲覀兊恼J(rèn)知在持續(xù)發(fā)展和增長，所以我們也期望模式也會(huì)變化。明天的數(shù)據(jù)表面上看起來相似，但是它可能已經(jīng)集合了不同的模式、（可能巧妙地）不同的目的、不同的語義；分析過程因受業(yè) 務(wù)知識(shí)驅(qū)動(dòng)，所以會(huì)隨著業(yè)務(wù)知識(shí)的變化而變化。基于這些原因，模式會(huì)有所不同。

總之，所有的模式都會(huì)變化，因?yàn)樗麄儾粌H反映了一個(gè)變化的世界，也反映了我們變化的認(rèn)知。

后記：

這九條定律是關(guān)于數(shù)據(jù)挖掘的簡單的真知。這九條定律的大部分已為數(shù)據(jù)挖掘者熟知，但仍有一些不熟悉（例如，第五、第六、第七）。大多數(shù)新觀點(diǎn)的解釋都和這九條定律有關(guān)，它試圖解釋眾所周知的數(shù)據(jù)挖掘過程中的背后的原因。

我們?yōu)槭裁春伪卦谝鈹?shù)據(jù)挖掘過程所采用的形式呢？除了知識(shí)和理解這些簡單的訴求，有實(shí)實(shí)在在的理由去探討這些問題。

數(shù)據(jù)挖掘過程以現(xiàn)在的形式存在是因?yàn)榧夹g(shù)的發(fā)展—-機(jī)器學(xué)習(xí)算法的普及以及綜合其它技術(shù)集成這些算法的平臺(tái)的發(fā)展，使得商業(yè)用戶易于接受。我們是否應(yīng)該期望因技術(shù)的改變而改變數(shù)據(jù)挖掘過程？最終它會(huì)改變，但是如果我們理解數(shù)據(jù)挖掘過程形成的原因，然后我們可以辨別技術(shù)可以改變的和不能改變的。

一些技術(shù)的發(fā)展在預(yù)測(cè)分析領(lǐng)域具有革命性的作用，例如數(shù)據(jù)預(yù)處理的自動(dòng)化、模型的重建以及在部署的框架里通過預(yù)測(cè)模型集成業(yè)務(wù)規(guī)則。數(shù)據(jù)挖掘的九條定律及其解釋說明：技術(shù)的發(fā)展不會(huì)改變數(shù)據(jù)挖掘過程的本質(zhì)。這九條定律以及這些思想的進(jìn)一步發(fā)展，除了有對(duì)數(shù)據(jù)挖掘者的教育價(jià)值之外，應(yīng)該被用來判別未來任何數(shù)據(jù) 挖掘過程革命性變化的訴求。

關(guān)鍵字：大數(shù)據(jù)定義域數(shù)據(jù)預(yù)處理

熱文

高端訪談更多