| 変数 | 観察数 | 平均 | 標準偏差 | 最小値 | 最大値 |
|---|---|---|---|---|---|
| 体重 | 13 | 77.9 | 34.5 | 31.7 | 140.6 |
| ドーナツ | 13 | 5.4 | 6.9 | 0.0 | 20.5 |
現代政治分析入門1
2026-10-13

統計学およびR言語の基本を紹介する。平均や分散・標準偏差など基本的な記述統計量を復習する。科学の条件としての再現可能性を議論し、再現性を確保するための方法を紹介する。データ分析用のプログラミング言語であるR言語を紹介し、自分で使ってみる。
TBD
手元にあるデータの特徴をわかりやすく整理し、要約して表現すること
データを手に入れたら、まず以下を計算
加えて、散布図を作る(=プロットする)
\(n\)個のデータ\(X= \{ x_1, x_2, \cdots, x_n \}\)があるとする。
合計を観察で割った値 \[ \overline{X} = \frac{\sum_{i=1}^{n} x_i}{n} \]
データの散らばり具合を表す尺度
\[ SD = \sqrt{\frac{\sum{(x_i - \overline{X}})^2}{n}} \]
6人の駒大生が10点満点のテストを受け、その結果のデータは\(X = \{ 5, 6, 6, 8, 4, 9 \}\)になりました。
平均\(\overline{X}\)を求めると… \[ \overline{X} = \frac{5 + 6 + 6 + 8 + 4 + 9}{6} = \frac{38}{6} = 6.33... \]
標準偏差を求めると…
\[ \sqrt{\frac{(5 - \overline{X})^2 + (6 - \overline{X})^2 + (6 - \overline{X})^2 + (8 - \overline{X})^2 + (4 - \overline{X})^2 + (9 - \overline{X})^2}{6}} = 1.70... \]
| 変数 | 観察数 | 平均 | 標準偏差 | 最小値 | 最大値 |
|---|---|---|---|---|---|
| 体重 | 13 | 77.9 | 34.5 | 31.7 | 140.6 |
| ドーナツ | 13 | 5.4 | 6.9 | 0.0 | 20.5 |

同じ手順を踏めば、他人でも同様の結果や結論を得られること
例:
他人が研究結果を再現するために必要なファイル
| 変数名 | 説明 |
|---|---|
| wage96 | 1996年に報告された1時間あたりの賃金(ドル単位)(過去1年間の労働時間で給与と賃金を割ったもの) |
| height85 | 成人の身長(インチ単位)、1985年の自己申告による |
| height81 | 青年期の身長(インチ単位)、1981年の自己申告による |
| athletics | 高校で運動部に参加したか(1=参加、0=不参加) |
| clubnum | 高校で所属したクラブの数(運動部、優等生協会、職業クラブを除く) |
| male | 男性(1=男性、0=それ以外) |
統計、データ分析、作図に特化したプログラミング言語
Rを便利に動かすための統合開発環境
コンソールにコマンドを打ち込んで四則演算ができる。
ちなみに#記号より後は完全に無視されるので、コメントを残すのに使える。
コンソールに打ち込んだコマンドは保存されないので、Rスクリプトファイルを使用する。




Rのオブジェクトとは、数値やデータに名前をつけて保存する箱のようなもので、以下のように作れる。
作ったオブジェクトは右上の環境ペーンで確認可能であり、後から呼び出せる。
ベクトルは複数の数値を集めたもので、c()を使って作れる。
行列は複数のベクトルを集めたもので、matrix()を使って作れる(省略)
データフレームも複数のベクトルを集めたもので、Rでの主力になる。以下のようにdata.frame()関数を使って作成する。
# ベクトルを用意する
weight <- c(124.7, 64.0, 31.8, 34.0, 140.6,
36.3, 72.6, 119.3, 93.0, 83.9,
77.1, 70.3, 65.8) # 体重
donuts <- c(14, 0, 0, 5, 20.5,
0.75, 0.25, 16, 3, 2,
0.8, 4.5, 3.5) # ドーナツ
name <- c("ホーマー", "マージ", "リサ", "バート", "コミックブックガイ",
"バーンズ社長", "スミサーズ", "ウィガム署長", "スキナー校長", "ラブジョイ牧師",
"ネッド・フランダース", "パティ", "セルマ") #名前
# 注意:文字列は""で囲む必要がある。
# ベクトルをまとめる
dta <- data.frame(name, weight, donuts)データフレームの最初の6行を抜き出すにはhead()関数が使える。データの構造を見てみるのに便利。
データフレームの次元(行数と列数)はdim()関数で確認できる。
データフレームの特定のエントリを抜き出すには以下のようにする。
dta[1, 2] # 1行目2列目
## [1] 124.7
dta[6, ] # 6行目
## name weight donuts
## 6 バーンズ社長 36.3 0.75
dta[, 2] # 2列目
## [1] 124.7 64.0 31.8 34.0 140.6 36.3 72.6 119.3 93.0 83.9 77.1 70.3
## [13] 65.8
dta[dta[, 2] > 100, ] # 2列目のエントリが100より大きい、dtaの全ての行
## name weight donuts
## 1 ホーマー 124.7 14.0
## 5 コミックブックガイ 140.6 20.5
## 8 ウィガム署長 119.3 16.0外部からダウンロードをRでも使うには、まずPosit Cloudにアップロードする必要がある。




ダウンロードしたweightはポンド単位なので、キログラムに変換するためい忘れずに以下のコードを実行しておく。
平均を計算するにはmean()関数を使う。
標準偏差を計算するには、平方根を計算するsqrt()関数と分散を計算するvar()を組み合わせるか、単純にsd()関数を使う。
最小値はmin()、最大値はmax()を使う。
観察数は少し複雑。is.finite()関数で欠損していない場合に1となる変数を作成した上で、sum()関数で合計する。
ドーナツを\(x\)軸、体重を\(y\)軸にした散布図は以下で作れる。
統計学およびR言語の基本を紹介する。平均や分散・標準偏差など基本的な記述統計量を復習する。科学の条件としての再現可能性を議論し、再現性を確保するための方法を紹介する。データ分析用のプログラミング言語であるR言語を紹介し、自分で使ってみる。
統計学とR言語