Regresión Beta (modelando la media y la precisión)
Author
Andrés Gutiérrez
Published
October 30, 2012
Si su variable de interés toma valores en el intervalo (0,1), puede ser correctamente modelada con la distribución Beta. Por ejemplo, las proporciones, tasas, y porcentajes que muchas veces se consideran distribuidas normales, deberían ser consideradas como realizaciones de variables aleatorias con distribución Beta. Ahora, según Cribari-Neto & Zeileis (2010), es natural que estas regresiones sean heterocedásticas pues los datos muestran más variación cerca de la media y menos dispersión en los límites del intervalo.
Luego, la media y la precisión se modelan de la siguiente manera, respectivamente:
\(g_1(\mu_i)=\mathbf{x}_i' \mathbf{\beta}\)
\(g_2(\phi_i)=\mathbf{z}_i' \mathbf{\gamma}\)
La inferencia de estos modelos puede hacerse de forma clásica, por ejemplo, utilizando el paquete betareg. Sin embargo, en la red también se encuentran algunos documentos de Cepeda & Garrido, que dan cuenta de la inferencia Bayesiana para esta misma configuración con algunos códigos en WinBUGS. A propósito de la inferencia Bayesiana, el enfoque de Cepeda está dado en términos de la creación de nuevas variables de trabajo para la implementación de un algoritmo híbrido MCMC.
El siguiente código realiza la estimación clásica para un conjunto de datos. La función de vínculo para el modelo de media es logit, y para el modelo de precisión es logarítmica.
library(betareg)data(FoodExpenditure)attach(FoodExpenditure)model.beta <-betareg(I(food/income) ~ income + persons| income, data = FoodExpenditure, link ="logit", link.phi ="log")summary(model.beta)
Call:
betareg(formula = I(food/income) ~ income + persons | income, data = FoodExpenditure,
link = "logit", link.phi = "log")
Quantile residuals:
Min 1Q Median 3Q Max
-2.5072 -0.4506 0.1752 0.6413 1.7985
Coefficients (mean model with logit link):
Estimate Std. Error z value Pr(>|z|)
(Intercept) -0.626613 0.223146 -2.808 0.004984 **
income -0.012396 0.003055 -4.058 4.95e-05 ***
persons 0.121050 0.035298 3.429 0.000605 ***
Phi coefficients (precision model with log link):
Estimate Std. Error z value Pr(>|z|)
(Intercept) 3.661300 0.710323 5.154 2.54e-07 ***
income -0.001498 0.011525 -0.130 0.897
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Type of estimator: ML (maximum likelihood)
Log-likelihood: 45.34 on 5 Df
Pseudo R-squared: 0.3878
Number of iterations: 10 (BFGS) + 1 (Fisher scoring)
Desde el punto de vista Bayesiano, se debe implementar un algoritmo híbrido. El siguiente código puede ser usado para encontrar las estimaciones con distribuciones previas planas y no informativas para los parámetros de regresión, tanto en la media, como en la precisión.