等宽分割法.ppt

* Data Mining * 建立新屬性 利用舊屬性將探勘所需的新屬性建立出來。 例如:整合後的資料只包含會員的生日,然而探勘時要用的屬性是會員的年齡,由於年齡可以從生日推算而出,因此可在此步驟建立出所需要的年齡屬性。(Derived Variables) * Data Mining * 資料正規化 Data Normalization 資料正規化的主要目的是將不同標準之下所記錄的資料轉換到同一個標準,以便提高分析時的準確度。資料的正規化會將資料重新分佈在一個較小而且特定的範圍內。 例如:台灣人民的平均所得遠高於菲律賓人。一個月賺一萬八千元台幣在台灣算是中低收入,然而在菲律賓,這卻是相當於三個大學教授的薪水。若是直接拿兩國人民的收入數字來做比較,便會產生不夠客觀的問題。 * Data Mining * 極值正規化 (1/2) 極值正規化的公式如下: 其中v為正規化前的數值,其範圍為[a, b]; v’為正規化後的數值,其範圍為[c, d]。 a b c d v v’ * Data Mining * 極值正規化 (2/2) 假設一般臺灣上班族的月收入範圍為[20000, 100000],而一般菲律賓上班族的月收入範圍為[2000, 10000];在台灣收入30000元相當於在菲律賓收入多少? v = 30000 a = 2

文档评论(0)

1亿VIP精品文档

相关文档