Qurak

Replace or remove invalid or missing data

ハウツー 23 ステップを1つのセッション内で順に実行します。各ステップはエンジンで実行済みで、以下の出力は実際に生成されたものです。

ステップ 1
gdps = Map[CountryData[#, "GDP"]&, CountryData[All]];

出力なし - このステップは次のステップの準備をします。

ステップ 2
Take[gdps, 10]
出力
Take[CountryData[CountryData[All, GDP]], 10]
ステップ 3
Max[gdps]
出力
CountryData[CountryData[All, GDP]]
ステップ 4
Count[gdps, _Missing]
出力
0
ステップ 5
Length[gdps]
出力
1
ステップ 6
filteredgdps = DeleteCases[gdps, _Missing];

出力なし - このステップは次のステップの準備をします。

ステップ 7
{Length[filteredgdps], Max[filteredgdps]}
出力
{1, CountryData[CountryData[All, GDP]]}
ステップ 8
data = {{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {4, 88.6, 1.9}, {1, 62.3, 1.8}, {1, 82.7, "NA"}, {1, 35.5, 1.84}};

出力なし - このステップは次のステップの準備をします。

ステップ 9
Grid[data, Dividers -> All]
出力
Grid[{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {4, 88.6, 1.9}, {1, 62.3, 1.8}, {1, 82.7, NA}, {1, 35.5, 1.84}}, Dividers -> All]
ステップ 10
baddata[entry_] := Not[MatchQ[entry, {1 | 2, _ ? NumberQ, _ ? NumberQ}]]

出力なし - このステップは次のステップの準備をします。

ステップ 11
DeleteCases[data, _ ? baddata]
出力
{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 35.5, 1.84}}
ステップ 12
badgroup[entry_] := Not[MatchQ[entry[[1]], 1 | 2]]

出力なし - このステップは次のステップの準備をします。

ステップ 13
filtereddata = DeleteCases[data, _ ? badgroup]
出力
{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 82.7, NA}, {1, 35.5, 1.84}}
ステップ 14
group1 = Select[filtereddata, #[[1]] === 1&]
出力
{{1, 71.6, 0.41}, {1, 46., 2.72}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 82.7, NA}, {1, 35.5, 1.84}}
ステップ 15
group1mean = Mean[Select[group1[[All, -1]], NumberQ]]
出力
2.104
ステップ 16
filtereddata[[All, 3]] = filtereddata[[All, 3]] /. "NA" -> group1mean
出力
{0.41, 4.96, 0.18, 2.72, 1.06, 3.75, 1.8, 2.104, 1.84}
ステップ 17
Grid[filtereddata, Dividers -> All]
出力
Grid[{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 82.7, 2.104}, {1, 35.5, 1.84}}, Dividers -> All]
ステップ 18
replaceByGroup[data_, col_, groupcol_, f_] := Block[{columnvals, funvals, grouped, groups, rules},
	columnvals = data[[All, {groupcol, col}]];
	If[VectorQ[columnvals[[All, 2]], NumericQ],
	columnvals[[All, 2]],
	grouped = GatherBy[columnvals, First];
	groups = grouped[[All, 1, 1]];
	funvals = Table[f[Select[grouped[[i]][[All, 2]], NumericQ]], {i, Length[groups]}];
	rules = Table[Rule[{groups[[i]], _ ? (Not[NumericQ[#]]&)}, {groups[[i]], funvals[[i]]}], {i, Length[groups]}];
	Replace[columnvals, rules, {1}][[All, 2]]]]

出力なし - このステップは次のステップの準備をします。

ステップ 19
newdata = DeleteCases[data, _ ? badgroup]
出力
{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 82.7, NA}, {1, 35.5, 1.84}}
ステップ 20
replaceByGroup[newdata, 3, 1, Mean]
出力
{0.41, 4.96, 0.18, 2.72, 1.06, 3.75, 1.8, 2.104, 1.84}
ステップ 21
replaceByGroup[newdata, 3, 1, Median]
出力
{0.41, 4.96, 0.18, 2.72, 1.06, 3.75, 1.8, 1.84, 1.84}
ステップ 22
Grid[Transpose[Table[If[j == 1, newdata[[All, j]], replaceByGroup[newdata, j, 1, Mean]], {j, Length[newdata[[1]]]}]]]
出力
Grid[{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 82.7, 2.104}, {1, 35.5, 1.84}}]
ステップ 23
Grid[Transpose[{newdata[[All, 1]], replaceByGroup[newdata, 2, 1, Mean], replaceByGroup[newdata, 3, 1, Median]}]]
出力
Grid[{{1, 71.6, 0.41}, {2, 27.2, 4.96}, {2, 59.3, 0.18}, {1, 46., 2.72}, {2, 42.2, 1.06}, {1, 89.1, 3.75}, {1, 62.3, 1.8}, {1, 82.7, 1.84}, {1, 35.5, 1.84}}]

使用する関数

関連レシピ

すべてのレシピ · 関数リファレンス · MCPクライアントから使う