今回は仕事で解析をしていて「おっと危ない」と思ったことについて書いてみます。結論からいうと「信頼区間と予測区間を混同しないように注意しましょう!」という話です*1。 課題:BODの値からTOCの値を推定したい 最近ややあってBOD(生物化学的酸素要求量)の値からTOC(全有機炭素量)の値を推定してみようと思いました*2。 試しに東京都の15地点から得られている水質データを用いてRで両者の散布図を描いてみると以下のようになりました(データはこちら:BOD-TOC.txt )。相関はあるものの、バラツキもかなりあります。 BOD2TOC.data <- read.table("BOD-TOC.txt",sep=",") TOC <- BOD2TOC.data$TOC BOD <- BOD2TOC.data$BOD plot(BOD,TOC,type="p",xlim=c(0,6),ylim=c