Mostrando entradas con la etiqueta análisis estadístico. Mostrar todas las entradas
Mostrando entradas con la etiqueta análisis estadístico. Mostrar todas las entradas

lunes, 29 de octubre de 2018

Precisión y Exactitud


Precisión y exactitud, son dos condiciones que deben reunir los datos y las conclusiones para dar como válido un estudio. Existen dos amenazas para la validez: el error aleatorio y el error sistemático.
El error aleatorio, se expresa en la diferencia que existe entre una medición y la media de todas las mediciones, y es que cada vez que se realiza una medida de la población a partir de una muestra, se encuentra un resultado distinto, mientras menor sea la distancia entre una medición y otra, se verificará que los resultados son más precisos.

La única forma de acercar estos resultados de cada medición es incrementando el tamaño de la muestra; la única forma de reducir el error aleatorio es incrementando el número de los elementos muestrales, incluso se puede eliminar el error aleatorio, si es que se estudia a toda la población.

La estimación de parámetros, que son características de la población, a partir de muestras requiere de identificar los límites donde se encontraría el valor verdadero. A esto se le conoce como intervalo de confianza, la distancia entre los límites del intervalo de confianza es más corta, si es que se incrementa el tamaño de la muestra y está distancia es puntual, es decir, es un valor único si es que se estudia a toda la población.

La precisión, es un atributo deseable, tanto en la medición puntual, como en la estimación de parámetros a partir de muestras. El error aleatorio de la estimación desaparece sólo en los casos en que se puede estudiar a toda la población.

El error sistemático, se expresa en la diferencia que existe entre la media de todas las mediciones y el verdadero valor, no porque todas las mediciones coincidan significa que se ha encontrado el verdadero valor, existe una distancia entre el valor real y la media de todas las mediciones. Esta distancia, es evaluada por el error sistemático.

Mientras más grande sea la distancia hay mayor error sistemático, mientras más corta sea la distancia, se dice que hay más exactitud. Pero para ello se requiere de antes haber contado con la precisión, no se puede hablar de que se está cerca al valor real, en términos de exactitud, si es que antes no se cuenta con el pre-requisito de la precisión. La reducción del error sistemático se logra mediante el método, controlando los sesgos de selección y de medición.

Sólo es posible estimar los límites donde se encontraría el valor verdadero, a partir de una medición, si se ha controlado el error sistemático, al cual se le denomina también como sesgo. Se ha generalizado al término “validez”, como la carencia de error sistemático, aunque esta no se pueda eliminar y que requiere de contar con la precisión antes de evaluar la exactitud.

Si las conclusiones obtenidas a partir de los sujetos que conforman la muestra, se pueda trasladar hacia los sujetos que pertenecen a la misma población pero que no fueron incluidos en la muestra, entonces el estudio tiene validez de inferencia, conocido también como validez interna.

Para asegurar la validez interna en un estudio, se debe realizar control y el control se plantea desde el punto de vista metodológico y desde el punto de vista estadístico; en un primer momento, el método trata de controlar el error sistemático, pero si no es posible identificar los elementos que integran el sesgo o no es posible eliminar aquellas características que están generando sesgo en las mediciones, entonces se incluyen al análisis estadístico, para ello se debe recolectar estas variables que interfieren con el estudio e incluirlas para realizar un análisis multivariado o de acuerdo a la naturaleza de las variables a las que correspondan los datos.

lunes, 22 de octubre de 2018

La relación entre variables


En la relación entre las variables, por lo menos se debe contar con dos de ellas, para realizar un estudio analítico.
De acuerdo a los niveles de la investigación, en el nivel descriptivo, se realiza un análisis estadístico univariado, en el nivel investigativo relacional un análisis bivariado, es decir, de dos variables y en el nivel investigativo explicativo se realiza el análisis multivariado o más de dos variables, es aquí donde surge la necesidad de clasificar a las variables según su relación; recordando que dentro del nivel explicativo se puede realizar estudios observacionales y experimentales. La estadística cumplirá el papel de realizar el control estadístico, agregando al control metodológico los criterios de causalidad.

Las variables según su relación son la variable independiente, la variable dependiente, la variable de confusión, la variable intermedia, la variable control, estas tres últimas son consideradas como variables intervinientes.

La variable independiente, representa los factores que constituirían la causa, debido a que previamente se ha demostrado ser factores de riesgo para el problema que se está estudiando en el nivel investigativo relacional. En los estudios observacionales se plantea solamente una variable independiente como estrategia para demostrar la relación de causalidad.

La variable dependiente, representa a la variable de estudio, mide o describe el problema que se está estudiando, para su existencia y desenvolvimiento depende de otra u otras variables independientes, pero su variabilidad está condicionada no solamente por la variable independiente, sino por el resto de las variables intervinientes.

La variable dependiente es la variable más importante del estudio, porque determina la línea de investigación.

La variable de confusión, aparece en los estudios observacionales, su aparición puede intensificar o antagonizar la relación aparente entre el problema y una posible causa, es decir, entre la variable independiente y la variable dependiente. Su influencia se percibe tanto sobre la variable independiente como en la variable dependiente, el control que debemos realizar en este caso es el análisis estadístico estratificado.

La variable intermedia, aparece de manera inesperada y por tanto es metodológicamente incontrolable entre el factor causal y el efecto, su naturaleza es aleatoria, es imposible conocer su distribución antes de ejecutar la recolección de datos, en los estudios observacionales se neutraliza su participación mediante el análisis multivariado y en los estudios experimentales mediante el análisis de la covarianza. En la mayoría de los casos la variable intermedia suele ser numérica.

La variable de control, posee fuerte influencia sobre la variable dependiente y ningún efecto reconocido sobre la variable independiente, se la identifica en el momento de la planeación. En los estudios observacionales su control se realiza mediante los criterios de elegibilidad, es decir, criterios de inclusión y criterios de exclusión. En los estudios experimentales el control se realiza mediante la construcción de bloques, es decir, se le Integra al análisis estadístico, pero en ningún caso se busca su interacción con la variable independiente, y aunque tiene influencia sobre la variable dependiente no se le estudia como factor causal.

lunes, 17 de septiembre de 2018

Minería de Datos


El concepto “Minería de Datos” es un término que engloba resultados de investigación, técnicas y herramientas usadas para extraer información de grandes bases de datos. La Minería de Datos es una parte del proceso completo de Knowledge Discovery in Databases (KDD, en español Proceso no trivial de identificación en los datos de patrones válidos), en mucha bibliografía los términos Minería de Datos y KDD se identifican como si fueran lo mismo. 
Concretamente, el término Minería de Datos es usado comúnmente por los estadísticos, analistas de datos, y por la comunidad de administradores de sistemas informáticos, mientras que el término KDD es utilizado más por los especialistas en Inteligencia Artificial.

El análisis de la información es habitual que sea un proceso manual, basado en técnicas estadísticas. Sin embargo, cuando la cantidad de datos que disponemos, dificulta el tratamiento manual, aquí entra en juego el conjunto de técnicas KDD de análisis automático al que nos referimos al hablar de Minería de Datos.

Los mayores éxitos en Minería de Datos se pueden atribuir directa o indirectamente a avances en bases de datos. No obstante, muchos problemas de representación del conocimiento y de reducción de la complejidad de la búsqueda necesaria (con conocimiento a priori) están aún por resolver.
Otras definiciones de Minería de Datos:
  • “La Minería de Datos es la extracción no trivial de información implícita, desconocida previamente, y potencialmente útil desde los datos”.
  • “La Minería de Datos es el proceso de extracción y refinamiento de conocimiento útil desde grandes bases de datos”.
  • “La Minería de Datos es el proceso de extracción de información previamente desconocida, válida y procesable desde grandes bases de datos para luego ser utilizada en la toma de decisiones”.
  • "La Minería de Datos es la exploración y análisis, a través de medios automáticos y semiautomáticos, de grandes cantidades de datos con el fin de descubrir patrones y reglas significativos".
  • "La Minería de Datos es el proceso de planteamiento de distintas consultas y extracción de información útil, patrones y tendencias previamente desconocidas desde grandes cantidades de datos posiblemente almacenados en bases de datos”.
  • “La Minería de Datos es el proceso de descubrir modelos en los datos”.

lunes, 20 de agosto de 2018

¿Media aritmética o Mediana?


La media aritmética y la mediana son las medidas de tendencia central más utilizadas que se conoce y que se obtienen de un conjunto de datos numéricos.
La media aritmética, es fácil de entender, de calcular y es muy utilizada. La mediana, es menos usada, pero tiene propiedades de las que carece la media, por lo que es un buen complemento para analizar los datos y en algunos casos puede ser más útil que la media. Estas propiedades son:

  • Es más robusta que la media aritmética frente a la presencia de anomalías, ya que no depende de los valores, sino de su posición, por tanto no interesa que existan valores extremos o anómalos.
  • La mediana divide al conjunto de datos en 50% de las observaciones por encima y otro 50% por debajo y esto le da unas ventajas que la media no tiene.

Si la distribución de los datos es simétrica, la media y la mediana coincidirán, entonces todo es ventaja.

Hoy en día se dispone de herramientas que permiten el cálculo fácil de los estadígrafos, de un conjunto de datos, debemos aprovechar esta ventaja y analizar las dos mediciones y tendremos un mejor análisis de los datos.

lunes, 23 de julio de 2018

El Análisis Exploratorio de Datos (AED)


El Análisis Exploratorio de Datos (AED) es un enfoque que prioriza el análisis de datos y sobre este particular existen múltiples criterios.
Monterde y Perea, menciona que el AED es, “por una parte, una perspectiva o actitud sobre el análisis de datos, en la que se exhorta a que el investigador adopte una actitud activa en y hacia el análisis de los mismos, como un medio para sugerir nuevas hipótesis de trabajo. Por otra parte, se compone de un renovado utillaje conceptual e instrumental respecto a lo que podríamos llamar Estadística Descriptiva “clásica”, con el fin de optimizar la cantidad de información que los datos recogidos puedan ofrecer al investigador, mediante representaciones gráficas, a base de reducir la influencia de las puntuaciones extremas en los estadísticos con el empleo de, los que por ello se ha convenido en llamar, “estadísticos resistentes”.

Ante lo mencionado surge una pregunta, ¿cómo se inserta lo que ya se conoce de estadística?  La respuesta no puede darse en pocos párrafos, se requiere la revisión y lectura, desde el desarrollo de la teoría y la ejemplificación correspondiente para comprender la concepción de AED y sus similitudes y diferencias con la estadística clásica.

Muchos coincidirán en que no se exagera si se dice que el objeto de la Estadística es el estudio de métodos científicos para organizar, presentar y analizar datos estadísticos, pero el problema está en cómo empezar a organizar los datos, todos los que han pasado  por un curso básico de Estadística recordará la prioridad que se da a las tablas de frecuencia, al estudio de la distribución normal o la correlación lineal que describen de una manera simple el comportamiento de los datos.

Estos temas, que la AED no los desecha, representan estructuras a gran escala que resumen las relaciones entre todos los datos y que liberan a los investigadores de la búsqueda minuciosa de modelos, para el entendimiento de las estructuras que subyacen en grandes conjuntos de datos; esta es una primera idea de la concepción del AED.

Desde su comienzo, el AED ha tenido como finalidad la revisión de los datos previo a la aplicación de cualquier técnica estadística para alcanzar primero un entendimiento básico de los mismos y de las relaciones existentes entre las variables analizadas. Es decir, cualquier cálculo, (promedios, desviaciones, correlaciones, etc.) debe estar precedido por un análisis visual de los datos, dicho de otro modo, mientras la Estadística Descriptiva clásica se ocupa de recoger, ordenar y representar los datos en forma de tablas, agrupándolos por intervalo y calculando estadísticos basados principalmente en la distancia y con datos centrados en la media (promedio); el AED se preocupa primero por detectar anomalías y errores en las distribuciones univariadas de los datos, intentando descubrir en ellos patrones o modelos, pero empleando variadas técnicas gráficas y buscando estimadores no paramétricos o estimadores libres de distribución o simplemente estimadores robustos, según el término acuñado por Box, tratando de llevar el estudio de la información que se tiene, hacia una modelización más completa que la establecida por la Estadística Clásica, basados principalmente en el orden y centrados en la mediana.

Los programas estadísticos como el SPSS, Minitab, Statgraphs, Statsoft, SAS, IDAMS y otros, ofrecen muchas posibilidades a partir de interaccione simples y amigables, con diálogos dinámicos tanto de la Estadística Clásica como las de AED, debiendo tener en cuenta que una buena gráfica informa más que un conjunto de números disgregados.

En resumen el AED, permite que hablen los datos y a partir de ellos encontrar los patrones y modelos indicados, con esto se logra que en muchas situaciones, el AED puede preceder a una situación de inferencia formal, mientras que en otras, puede sugerir preguntas y conclusiones que se podrían confirmar con un estudio adicional, por esto el AED es una herramienta de utilidad en la generación de hipótesis, conjeturas y preguntas de investigación acerca de una realidad que los datos fueron obtenidos.

En la investigación de diferentes áreas, donde intervienen numerosas variables y donde los datos no abundan, el AED bien utilizado se convierten en instrumento que complementan los diseños de investigación y dan validez, confiabilidad y rigor científico a los resultados.

lunes, 25 de junio de 2018

La Estadística y el Científico de Datos


Artículo de Enrique Saldivar, El Comercio 17/06/2018

La transformación digital exige una profunda re­flexión sobre la empresa, pero también plan­tea retos muy importantes para poder llevar con éxito el proceso y la comprensión de la tecno­logía que se requiere: Machine Learning, Internet of Things y Blockchain, teniendo como base el uso, ac­ceso y explotación de datos.
Según datos de Excelacom. firma de consultoría y análisis tecnológico, cada 60 segundos se envían 150 millones de correos electrónicos, se real izan 1.389 viajes en UBER, se efectúan 2.4 millones de búsquedas en Google, son publicadas 38.194 fotos en Instagram, se crean más de 120 nuevos perfiles en Linkedln y son descargadas 51.000 aplicaciones en dispositivos inteligentes.

Tiene sentido entonces que, hoy por hoy, el análisis del Big Data se haya vuelto el motor fundamental en la economía de la información. Sin embargo, pa­ra que las empresas obtengan el máximo valor de los datos, no solo se necesitan tener las herramien­tas adecuadas, sino también se requiere contar con personal capacitado. Es por esta razón que es de su­ma importancia potenciar el capital humano, prepa­rando a profesionales para transformarlos en lo que hoy se conoce como Científicos de Datos.

Aunque esta profesión no tiene una definición exacta, el Científico de Datos se centra en un profesional dedicado a analizar e interpretar grandes volúmenes de información, con el fin de diseñar una estra­tegia de inteligencia de negocios e identificar nue­vas oportunidades para las compañías. No es coincidencia entonces que, en el Perú, las carreras relacio­nadas con Estadística, Informática y Ciencias Mate­máticas hayan mostrado un crecimiento sostenido en los últimos años.

Lo expuesto supone un gran reto para las organiza­ciones, ya que deben identificar la necesidad de con­tar con científicos de datos y reconocer el potencial del Big Data, y abre una oportunidad para futuros profesionales que buscan nuevos campos laborales.

lunes, 28 de mayo de 2018

Estadística y Ciencias Sociales


El estudio de la realidad social y política se realiza cada vez con mayor frecuencia mediante análisis de encuestas y exploraciones de campo. En una investigación la Estadística se utiliza para: a) Diseñar el tamaño de la muestra; b) Decidir el tipo de muestreo en función de la población a investigar y c) Analizar los datos obtenidos. Además, nuevas preguntas, resultado del análisis de encuestas, ha llevado a nuevos desarrollos de modelos estadísticos.
Durante la mayor parte del siglo XX los investigadores, entre ellos los estadísticos trabajando en estas investigaciones, se concentraron en el análisis de datos de tablas de contingencia, que ha sido la forma más habitual para presentar los resultados de una encuesta.

A mediados del siglo XX, se desarrollaron técnicas de medición de la asociación entre variables categóricas que a través del coeficiente de correlación miden la dependencia en contextos más amplios. Los avances en el tratamiento estadístico de las variables cualitativas se han venido impulsado por las necesidades propias del análisis.

Un avance importante en este campo fue encontrar la relación entre el análisis de correspondencias, herramienta introducida por Benzecri para representar datos multivariantes de frecuencias. El Análisis de Correspondencias puede verse como una generalización para variables cualitativas de una técnica estadística clásica para reducir la dimensión de variables continuas, como la técnica de Componentes Principales, esta técnica tiene muchas aplicaciones en diferentes campos de la ciencia. Por ejemplo, los índices de desarrollo humano de la ONU, muchos sistemas de compresión de imágenes o video para su envío por Internet, o los factores que explican la inteligencia humana, utilizan esta herramienta introducida por Hotelling en 1933. Matemáticamente, se trata de buscar combinaciones lineales de un conjunto de variables, que contengan la máxima información, lo que se traduce en que tengan varianza máxima.

Goodman en 1985 relacionó los modelos log-lineales y el análisis de correspondencias, estableciendo una metodología unificada para el análisis de encuestas.

El modelo LISREL es otro desarrollo importante en el campo de la sociología, está técnica generaliza el modelo factorial clásico introducido por Spearman en Psicometría para analizar la inteligencia humana. Los modelos mencionados construyen un sistema de ecuaciones estructurales, similares a los modelos econométricos multiecuacionales, pero que en vez de relacionar variables observadas, relacionan variables no observadas o factores. Además, permite incorporar ecuaciones similares a un modelo factorial clásico para relacionar los factores con las variables observadas. Estos modelos se han convertido en una herramienta habitual en la sociología.

Otro aspecto que ha estimulado la investigación estadística es el análisis de datos faltantes. En alunas encuestas es frecuente que los entrevistados no respondan a parte de las preguntas y se debe enfrentar con el problema de cómo utilizar esta información incompleta. Este problema ha impulsado la creación de nuevos métodos de estimación, como los métodos de cadenas de Markov que permiten una utilización efectiva de toda la información disponible.

En resumen, se tiene que el papel de la estadística es un soporte para la adquisición de conocimiento científico en el mundo actual. En las ciencias sociales la Estadística,  es una herramienta que permite convertir los hechos observables en conocimiento e información, si bien es cierto su desarrollo cuantitativo es menor, así como en las humanidades, donde todavía se encuentra en sus inicios, es previsible que en este siglo se producirán avances importantes en la cuantificación de estas disciplinas.

lunes, 14 de mayo de 2018

Análisis Multivariado (I)


Cuando se requiere analizar situaciones complejas, muchas veces no basta una sola variable, es el caso para investigaciones en educación, salud, seguridad social, justicia o economía; entonces, en esta situación se hacer necesario utilizar múltiples variables, para lo cual se requiere utilizar el análisis multivariado.

El análisis multivariado es un conjunto de métodos, los cuales pueden analizar simultáneamente la relación existente entre variables correlacionadas.

Cuando se analizan varias características (variables) de un mismo individuo, estas variables por lo general están correlacionadas. El análisis estadístico univariado realizado separadamente para cada característica puede conducir a interpretaciones erróneas de los resultados, ya que se ignora la correlación entre variables.

Las técnicas multivariadas son herramientas eficaces para analizar los datos expresados en de muchas variables y permiten obtener la máxima información posible de los datos. En la actualidad existen programas estadísticos que permiten utilizar estas técnicas.

En el campo multivariado pueden utilizarse diferentes enfoques, tanto por las distintas situaciones que se presentan al obtener los datos, como por el objetivo específico del análisis. Entre las más importantes se tiene:

Clasificación
Este tipo de análisis permite ubicar las observaciones dentro de grupos o bien concluir que los individuos están dispersos de manera aleatoria en el espacio multivariable. También pueden agruparse variables. Las técnicas empleadas son: a) los métodos de clasificación jerárquicos, b) los métodos de clasificación no jerárquicos y c) el análisis discriminante.

Simplificación de la Estructura o Reducción de Datos.
El objetivo es encontrar una manera simplificada de representar el universo de estudio. Esto se logra mediante la transformación de un conjunto de variables interdependientes en otro conjunto de variables independientes o en otro conjunto de menor dimensión. Las técnicas que se utilizan con mayor frecuencia son: a) el análisis por componentes principales y b) el análisis factorial.

Dependencia entre variables
Para ello se seleccionan del conjunto ciertas variables (una o más) y se estudia su dependencia de las restantes. Entre los métodos para detectar dependencia comprenden a) el análisis de regresión múltiple, b) análisis de correlación canónica y c) análisis discriminante.

Análisis de la Interdependencia
El objetivo es analizar la interdependencia entre variables, la cual abarca desde la independencia total hasta la colinealidad, cuando alguna de ellas es combinación lineal de las otras. Entre las técnicas para analizar la interdependencia entre variables o individuos se incluyen el análisis de factores, clasificación, el análisis de correlación canónica, el análisis por componentes principales.

Formulación y Prueba de Hipótesis
A partir de un conjunto de datos es posible encontrar modelos que permitan formular hipótesis en función de parámetros estimables. La prueba de este nuevo modelo requiere una nueva recopilación de datos a fin de garantizar la necesaria independencia y validez de las conclusiones. Una de las técnicas empleadas es el MANOVA (Análisis Multivariado de la Variancia).

lunes, 7 de mayo de 2018

El buen uso de la Ciencia Estadística


Una elección adecuada de las pruebas estadísticas según las variables de interés, un correcto análisis de datos y una adecuada presentación de los resultados, ajustadas al contexto del área de conocimiento y los objetivos del estudio tendrán un impacto positivo en los trabajos que se lleven a cabo en una investigación científica.
La aplicación de los conceptos de la ciencia estadística es un tema  común en la mayoría de las investigaciones científicas cuantitativas, ya que permiten establecer parámetros poblacionales, determinar el compartimiento temporal y espacial de los fenómenos sociales y económicos y sus factores críticos, entre otros aspectos; entendiendo que la mala selección de una determinada prueba o una interpretación errada de los resultados puede desencadenar consecuencias negativas para la población, sea esta la sociedad, los clientes, usuarios o pacientes.

Los investigadores jóvenes tienden a prescindir de la estadística en sus investigaciones, debido a la falta de conocimiento acerca del tema y la importancia que reviste su uso como un soporte matemático de los resultados que busca obtener. Este poco uso de la estadística, los lleva a pensar que no es necesario.

Entre los aspectos que llevan al poco uso de las estadísticas se cuentan: a) la dificultad para seleccionar las pruebas adecuadas según las variables de estudio, b) mala interpretación de los resultados obtenidos por los programas estadísticos o c) no saber manejar los programas estadísticos.

Es necesario definir cuáles serán las variables a estudiar y tener un claro conocimiento del tipo de cada una de ellas. Esto permitirá seleccionar adecuadamente las pruebas estadísticas a aplicar y evitar un mal uso de las pruebas estadísticas.

La falta de asesoramiento por parte de un estadístico o de un investigador experimentado puede ocasionar la elección de pruebas por ejemplo, analizar variables cuantitativas con la prueba de Chi cuadrado de Pearson; aplicar comparaciones de medias a variables cualitativas binomiales; realizar análisis de variancia cuando no se cumplan el supuesto de normalidad de las variables, etc.

Algunos investigadores emplean de manera adecuada análisis de inferencia estadística en los datos obtenidos en sus investigaciones; sin embargo, hay un cierto abuso de la estadística, cuando enfatizan la presentación de sus resultados con las salidas de los paquetes estadísticos, restándole importancia a los resultados reales del estudio.

Es común que en los trabajos de investigación, se presenten como resultados tablas o cuadros con valores de la prueba t de Student, valores F, de Chi cuadrado, grados de libertad, etc.; aunque lo interesante para cualquier investigador y más aún, para los futuros lectores  del trabajo que se presenta, son los valores obtenidos en el contexto del área de conocimiento específico, como serian por ejemplo: promedios, frecuencias de casos con determinada característica según la procedencia, frecuencia del consumo de sustancias o tipos de alimento entre la población, etc. Está claro que no se debe dejar de indicar el valor de significancia estadística (p-valor), colocando las salidas del programa estadístico en un anexo.

También es necesario indicar si los resultados obtenidos corresponden a una muestra o una población, indicando el tamaño respectivo. Haciendo la diferencia con un dato estadístico obtenido en un periodo de tiempo, que no necesariamente es toda la población, sobre todo cuando se trata de los servicios públicos (acceso a la salud, educación y programas sociales), ya que podrían dar a entender que es toda la población, cuando sólo es una parte.

lunes, 30 de abril de 2018

Metodología Estadística en una Investigación Cuantitativa




Los elementos estadísticos más utilizados para realizar una investigación con enfoque cuantitativo, son las siguientes:
El análisis de los datos se efectúa utilizando una matriz de datos.

Las pruebas estadísticas a realizar dependen del nivel de medición de las variables, las hipótesis y el interés del investigador.

Los análisis estadísticos pueden realizarse a nivel descriptivo para cada variable, y a nivel de la estadística inferencial (pruebas paramétricas y no paramétricas) y análisis multivariados.

Las principales medidas de tendencia central son la moda, mediana y media.

Las principales medidas de la variabilidad son el rango, la desviación estándar y la varianza.

Otras estadísticas descriptivas de utilidad son las asimetría y la curtosis.

Una razón es la relación entre dos categorías y una tasa es la relación entre el número de casos de una categoría y el número total de casos.

La estadística inferencial permite generalizar las estimaciones de la muestra. Se utiliza para probar hipótesis y estimar parámetros. Se basa en el concepto de distribuciones de probabilidad teórica como la Normal, t, F y Chi-cuadrado.

La distribución normal es un modelo teórico sumamente útil.

El nivel de significancia es el nivel de probabilidad de cometer un error en la prueba de hipótesis y estimación de parámetros. Los niveles más comunes son el 0.05 y 0.01.

Los análisis o pruebas estadísticas paramétricas más utilizadas son:
  • Coeficiente de correlación de Pearson.
  • Regresión lineal simple y múltiple.
  • Prueba “t” para deferencia de grupos.
  • Contraste de la diferencia de proporciones Diferencia de grupos.
  • Análisis de varianza (ANOVA).
  • Análisis de covarianza (ANCOVA).

Para las pruebas estadísticas paramétricas las variables deben estar medidas en un nivel por intervalos o razón.

Las pruebas estadísticas no paramétricas más utilizadas son:

  • Chi_cuadrado.
  • Coeficiente de correlación e independencia de Pearson.
  • V de Cramer.
  • Lamda.
  • Gamma.
  • Tau b.
  • D de Somers y Eta.

Las pruebas no paramétricas utilizan variables nominales u ordinales.

Los análisis multivariados más utilizados son:

  • Análisis de regresión múltiple.
  • Análisis de Factores.
  • Análisis multivariado de variancias (MANOVA) y correlación canónica.
  • Análisis discriminante.
  • Análisis de Jerarquización.

Los análisis estadísticos se llevan a cabo mediante computadora, utilizando programas estadísticos, los programas más conocidos son: SPSS, Minitab, Statgraphics y SAS.

lunes, 23 de abril de 2018

Margen de Error



Hice una apuesta con el presidente. Él estimó que la población del Perú llega a 32 millones; yo que apenas somos 30 millones. La apuesta se dio durante una exposición ante el Consejo de Ministros acerca del censo nacional que se realizará el próximo 22 de octubre.


Tramposamente, me aproveché de información que aún no es de dominio público. Habiendo transcurrido casi diez años desde el último censo, nadie sabe a ciencia cierta el tamaño exacto de la población, pero los expertos saben que se vive una desaceleración, consecuencia de una reducción en la natalidad. La familia peruana promedio ya no consiste en cinco sino en tres y medio personas pero el efecto de esa tendencia no se ha incorporado aún en las estimaciones de población publicadas. En Internet, por ejemplo, hay afirmaciones oficiales recientes que respaldan la apuesta del presidente, y señalan una población del orden de 32 millones.

Hace dos o tres décadas, el dato poblacional era interesante pero poco relevante en la vida nacional. Hoy, gracias a las nuevas tecnologías de procesamiento digital los datos están en el centro de la conducción, tanto del Estado como de los negocios. Los medios se llenan de números, los censos y las encuestas se multiplican, y no sorprende entonces que el censo motive una larga discusión por parte del Gabinete. Hoy, los planes y presupuestos de cada sector del Gobierno se formulan y se aprueban en base a diversas estadísticas que, en su mayoría, son provistas por el INEI, y que en gran parte se sustentan en los datos del censo.

Ese nuevo apetito por los datos nos obliga a una reflexión acerca de su calidad, en especial acerca del famoso “margen de error”. Este término aparece cada vez que se publican encuestas, creando una impresión de exactitud. Pero es engañoso porque induce a pensar que el pequeño error técnico que dicen medir es el único posible error. Sin embargo, las encuestas pueden contener una variedad de errores no sospechados por el lector, derivados de un inadecuado diseño del cuestionario o de un trabajo de campo imperfecto. La posibilidad del error no se limita a las encuestas sino que abarca todo tipo de estadística, y la guerra para minimizarlo es una parte central del oficio de los expertos estadísticos.

Un resultado del esfuerzo continuo de perfeccionamiento es que la exactitud de cada dato no se logra de inmediato sino gradualmente, según se va obteniendo información adicional que permite afinar las estimaciones originales. De allí la incómoda necesidad de publicar continuas revisiones de los números, práctica común de los INEI de la mayoría de los países. Estados Unidos, por ejemplo, publica revisiones anuales de sus cifras del PBI de años anteriores, sorprendiendo al público que debe reacomodar sus explicaciones teóricas y políticas.

La nueva importancia de la estadística plantea un reto de gobernanza. Cada día es más necesaria la calidad y la autonomía de los proveedores de datos. El público debe comprender las limitaciones técnicas de ese oficio y respetar la honestidad de los técnicos, así como respeta a los meteorólogos que predicen la ruta de un huracán, aunque sabemos que también pueden equivocarse y deben estar continuamente revisando sus proyecciones.

lunes, 16 de abril de 2018

Consideraciones Metodológicas en la Investigación


A fin de lograr una aceptable organización en una investigación, se debe tener en cuenta los pasos del método científico y los elementos de la metodología que la describirá con detalle y claridad, ya que el proceso de investigación nunca es rígido.
Existen diferencias entre la investigación cualitativa y la cuantitativa. En la investigación cualitativa, el investigador da mayor énfasis a la descripción minuciosa de los antecedentes, hasta las posibles raíces del problema que se estudia. Se formula un marco teórico que fundamenta el método y desarrollo de la investigación, ajustando los datos y averiguaciones, en un proceso de retroalimentación entre el investigador y los investigados; su participación en la investigación, no los involucra en la etapa previa o planificación del estudio.

La investigación cuantitativa presenta un largo desarrollo y se aplica en forma general al estudio de las ciencias tanto naturales como humanas. En la actualidad, estas dos ramas de la investigación no se consideran antagónicas sino complementarias.

El primer paso del proceso investigativo, es la pregunta que identifica el problema y la definición específica del mismo; para establecer una relación entre las variables identificadas.

El paso siguiente consiste en realizar una lista de términos o descriptores, que permitan al investigador profundizar en la revisión de fuentes y antecedentes adecuadas, y determinar un marco teórico. Plantearse preguntas que surgen al tener un conocimiento más completo del problema a investigar.

Existe una relación entre los pasos descritos anteriormente. Al revisar la teoría y los estudios de investigación pertinentes se puede reafirmar la teoría o elaborar una nueva. El investigador puede plantear una hipótesis que debe probar. La investigación se fundamenta en el conocimiento teórico para plantear hipótesis y la comprobación de ésta significa un avance del conocimiento con una permanente evolución y dependencia entre ambos.

Luego de formular el problema, propósitos y objetivos, e hipótesis del estudio, el paso siguiente es determinar las técnicas e instrumentos necesarios para obtener datos que contribuyan al logro de los propósitos y objetivos, y permitan aceptar o rechazar (estadísticamente) la hipótesis planteada.

A continuación, el investigador seleccionará el diseño más apropiado para el estudio. Estos pasos se describen secuencialmente, pero requieren un cuidadoso análisis de las relaciones lógicas que existen entre ellos.

lunes, 9 de abril de 2018

Estadísticas y Sistema de Justicia

Para conocer el alcance de un sistema de justicia penal, se requiere identificar a los usuarios y los usos de los datos estadísticos. ¿Quiénes son los usuarios potenciales, actuales y pasados del sistema? ¿Cuáles son las cuestiones políticas claves que deberían incluirse en un programa de mejoramiento de las estadísticas sobre justicia penal? ¿Quiénes deberían remitir datos al sistema nacional? ¿Quién debería recibir los datos? ¿Qué datos deberían remitirse, en qué forma, en qué intervalos y, para qué fines?
Los datos estadísticos se reúnen para contestar preguntas, entonces para la elaboración de un programa de mejoramiento del sistema nacional de estadísticas sobre justicia penal se deben determinar las interrogantes más importantes que deben ser respondidas. A continuación se sugieren algunas posibles preguntas:
¿Cuál es la prevalencia o frecuencia de los diversos delitos?
¿Cuál es la tasa de criminalidad? ¿Qué regiones del país tienen los mayores índices de delincuencia?
¿Algunos tipos de delitos están aumentando o disminuyendo?
¿Cuál es el grado de prevalencia de la violencia doméstica?
¿Cuántos delincuentes hay?
¿En qué medida hay una correspondencia entre los delincuentes y las víctimas?
¿Quién es el delincuente “típico”?
¿Qué tipos de delitos se cometen y por qué delincuentes?
¿Cuáles son las características de los delincuentes habituales?
¿Qué parte de la delincuencia es atribuible a los jóvenes?
¿En qué medida participan en la delincuencia personas de distintos grupos étnicos?
¿Se está incrementando la participación de la mujer en la delincuencia?
¿Cuáles son los antecedentes familiares, socioeconómicos y educacionales de los reclusos?
¿Cuál es el papel de las drogas y el alcohol en la vida de los delincuentes?
¿Cómo tramita los casos el sistema de justicia penal?
¿Qué es la discrecionalidad y cómo se ejerce en la tramitación de los casos penales?
¿Qué relaciones hay entre la cantidad de funcionarios policiales en las distintas partes del país?
¿Cuál es la relación entre la cantidad de policías y la delincuencia en una región?
¿Cuántas personas son detenidas en un año y por qué delitos?
¿Qué porcentaje de los delitos dan lugar a una detención?
¿Qué efectos tiene sobre las detenciones la tardanza de la víctima en formular la denuncia?
¿Cuál es el papel del fiscal?
¿Cuántas detenciones dan lugar a enjuiciamiento?
¿Cuántos enjuiciamientos culminan en declaración de culpabilidad?
¿Cuál es la proporción de procesados que obtienen la libertad provisional?
¿Cuántos procesados liberados provisionalmente no comparecen en el juicio o cometen nuevos delitos?
¿Los infractores juveniles reciben un tratamiento distinto al de los adultos?
¿Cómo están organizados los tribunales?
¿Qué grado de interacción existe entre los diversos tribunales?
¿Cuáles son las principales diferencias entre los tribunales de adultos y de menores?
¿En cuántos casos en que el fiscal pide el procesamiento se declara culpable el acusado? ¿Cuántos casos culminan con una determinación de culpabilidad?
¿Cuánto tiempo dura la tramitación completa de una causa penal en el sistema de justicia penal?
¿Son parecidas las condenas que se imponen para delitos análogos?
¿Se está incrementando la cantidad de causas sometidas a los tribunales de apelación?
¿Cuántas personas están sometidas a alguna forma de supervisión penal?
¿Qué diferencia existe entre la duración de las penas que se imponen y el tiempo de cumplimiento efectivo de la condena?
¿Cuántos presos están recluidos en establecimientos penales?
¿Se está incrementando la población carcelaria?
¿Cuántas personas están cumpliendo sus condenas en libertad vigilada?
¿En qué tipo de establecimientos están recluidos los presos?
¿Cuántas personas puestas en libertad condicional regresan a la cárcel?
¿Cuánto gasta el gobierno en la justicia penal?
¿Cuál es el costo del sistema policial, del ministerio público, los tribunales y del sistema carcelario?
¿Qué se compra con los fondos destinados a la justicia?
¿Cómo se gastan esos fondos?
¿Cuánto cuesta mantener a una persona en la cárcel o en libertad vigilada?
¿Cuánto cuesta construir una prisión o una cárcel?
¿Cuánto se gasta por cápita en el sistema de justicia penal?
¿Cuáles son las relaciones entre el gasto por cápita en justicia y la tasa de criminalidad de un país?
¿Qué proporción del gasto total del gobierno se dedica a la policía, los tribunales y el sistema carcelario?
¿Cómo ha variado esa proporción anualmente?

Además de las prioridades en información estadística sobre la delincuencia y la justicia penal del país, es importante que se puedan hacer comparaciones con países relativamente similares de la región o del mundo y considerar la situación nacional en un contexto mundial.

Con la potencialidad que tiene las técnicas estadísticas, permitirán que estos datos sirvan para elaborar diagnósticos cada cierto tiempo, tendencias, simulaciones y proyecciones, que ayudaran a tomar decisiones, a fin de combatir la delincuencia y garantizar la seguridad ciudadana.

lunes, 2 de abril de 2018

Datos individuales vs. Datos agregados


Los datos cuantitativos implícitamente brindan mayor información respecto a los datos categóricos o cualitativos. Por eso es necesario precisar la diferencia de trabajar los datos agregados y datos unitarios o individuales.
Por ejemplo, qué información podríamos obtener de una base de datos si se quisiera saber cuál es el tiempo que tarda un caso en el sistema judicial.

Con un enfoque de datos agregados se dispondría de la cantidad de casos comprendidos en las distintas categorías de tiempo predeterminados, si por ejemplo, supongamos que se definieron tres categorías de tiempo: menos de seis meses, de seis meses a un año y más de un año. Con esas tres categorías es posible determinar la distribución del tiempo que duraría los casos según las categorías definidas.

En otras palabras, habría una cantidad total de casos que concluyeron en menos de seis meses, pero no sería posible determinar cuántos concluyeron en un mes, o cuántos demoraron cinco meses antes de concluir. Análogamente, habría una cantidad total de casos que demoraron más de un año en concluir, pero no sería posible determinar cuántos demoraron dos o tres años.

A diferencia de los datos agregados, los datos individuales contienen información sobre cada uno de los registros. Siguiendo con el ejemplo del tiempo que tarda cada caso, el enfoque de datos individuales permitiría reunir información sobre la fecha de inicio a la primera comparecencia ante los tribunales y la fecha de la decisión final del caso.

Al disponerse de esas dos fechas respecto de todos los casos en proceso en los tribunales, sería posible calcular el tiempo que tardó cada caso y luego el total de casos en cualquier período que se desee, basta con definir los períodos que interesan y luego determinar los casos comprendidos en diferentes categorías que se tenga un interés particular.

En caso se requiera información sobre la distribución de casos resueltos en seis meses o menos, se podría hacer una consulta a la base de datos para encontrar la cantidad de casos concluidos dentro de un, dos, tres, cuatro, cinco y seis meses; incluso si se necesitaran más detalles, mediante una consulta se podría averiguar la cantidad de casos concluidos en cinco, en diez, o en 15 días.

Del mismo modo se puede proceder con datos individuales referidos a las edades, ingresos, ahorros, talla, peso, etc.; es decir a datos cuantitativos continuos que se requieren sean agregados o categorizados en cualquier momento en varios grupos, y en diferentes rangos.

Una de las ventajas de los datos individuales radica en que facilita la verificación de los datos y la calidad de los mismos. Ésta consideración es importante para el logro de la confiabilidad de las estadísticas obtenidas. El mejor mecanismo para promover la confianza en la generación de datos, consiste en facilitar la verificación y el análisis de los datos al nivel más detallado posible.

lunes, 26 de marzo de 2018

Estadística y Decisiones


Hace apenas unas décadas, disponer de los datos y luego analizarlos eran actividades costosas y laboriosas, ya que se basaba en labores manuales. Hoy se cuenta con computadoras veloces y económicas, y existe software y aplicaciones potentes y flexibles, por lo cual las organizaciones obtienen diferencia competitiva en relación a su competencia, y podrán mejorar continuamente la performance de sus indicadores de los procesos y las actividades que se gestionan en una organización.
Pero no se puede gestionar lo que no se mide. Si no se puede medir, no se puede controlar. Si no se puede controlar, no se puede gestionar. Si no se puede gestionar, no se puede mejorar. La falta de estadísticas en las organizaciones impide su administración. Decidir en base a datos del pasado, predecir por intuición o en simples extrapolaciones, y tomar decisiones desconociendo las probabilidades de ocurrencia, son sólo algunos de los problemas más comunes que ocurren en las organizaciones.

Cuando los procesos de cambios eran lentos, los cuales resultaban casi imperceptibles en el tiempo, se podía administrar una organización con pocos datos estadísticos. Hoy, en una era de profundos y veloces cambios en todos los órdenes, ya no es posible actuar con desinterés. Hoy un tomador de decisiones necesita predecir a tiempo diversos indicadores, necesita reconocer a tiempo los cambios de tendencia.

Para negociar, para corregir problemas de calidad, para aumentar la productividad, para fijar precios, para eliminar los “cuellos de botella”, para invertir, para contratar nuevo personal, para diseñar y evaluar políticas públicas, para elaborar presupuestos, para priorizar proyectos, etc., se requiere contar con datos estadísticos. Toda decisión, todo análisis, está en el aire si no se cuenta con datos estadísticos suficientes y fiables.

Toda organización pública o privada, de avanzada, son aquellas que hicieron de las estadísticas una herramienta fundamental. Sin estadísticas una organización carece de capacidad para reconocer qué actividades o productos se cumplen a tiempo y cuáles no. No gestionar datos ni interpretarlos correctamente es para los administradores como caminar a oscuras. Gestionar datos, permite ver lo que está aconteciendo y en consecuencia tomar las medidas más eficientes y oportunas.

Cada día se exige ser más productivos y eficientes, ello es posible a partir de información estadística debidamente analizada.

Pretender dirigir una organización como hace un par de décadas atrás ya no es posible. El tomador de decisiones tiene en sus manos la decisión de mejorar su institución a través de una gestión moderna con base en datos estadísticos o seguir en la oscuridad.

lunes, 26 de febrero de 2018

Dar Sentido a los Datos


La estadística, es la ciencia de dar sentido a los datos. En la década de los ochenta se empezó a tomar conciencia de que el pensamiento estadístico es una de las claves para la administración y la gerencia. 
Cuando un grupo de directivos tiene que decidir cómo elaborar un nuevo producto, puede guiarse por sus gustos e intuición, u obtener datos de una encuesta acerca de las preferencias de los consumidores. Cuando las piezas de una fábrica se rechazan debido a problemas con la calidad, los directores de los departamentos de diseño, ingeniería, compras y producción pueden discutir tratando de culparse los unos a los otros, o pueden obtener datos para determinar qué es lo que ocasiona el problema. Obtener y utilizar datos en forma inteligente resuelve muchos problemas.

Todo gerente o directivo tiene la necesidad y la ocasión de tratar con datos. La necesidad puede ser obvia, como en el caso de las empresas crediticias que deben analizar el comportamiento de cientos de clientes a los que se les han hecho préstamos, o de una Clínica que tiene que conocer día a día la disponibilidad de camas y salas de operación. En otros casos, la necesidad puede ser menos obvia; por ejemplo, los administradores de un hotel, con el registro anticipado de huéspedes para reducir las colas y los tiempos de espera en la recepción; o una cadena de tiendas de equipos de cómputo podrían pasar por alto que al combinar los datos relativos a las ventas con los del inventario se pone de manifiesto que el afán por alcanzar su cuota mensual de ventas está provocando problemas periódicos con el inventario, que se pueden evitar.

El pensamiento estadístico es indispensable para todo decisor, tanto al tratar con las operaciones cotidianas como al buscar oportunidades para mejorar. El pensamiento estadístico se encuentra en torno a los siguientes temas: cómo recabar datos útiles; cómo hacer los datos una forma comprensible; cómo utilizar los conceptos de la teoría de la probabilidad; cómo inferir y hacer predicciones con base en la limitada información disponible y cómo utilizar las computadoras en el proceso.

Para ser útiles, los datos se deben recopilar y poner a nuestra disposición, ya sea a través del muestreo, de una experimentación o de archivos públicos o privados disponibles.

Una larga lista de números y datos no son de mucha utilidad. Se les debe resumir o sintetizar para que se pueda entender, interpretar o utilizar en el hecho que se estudia. Si pueden ser graficados, mejor.

Dar sentido a los datos implica comprender la variabilidad aleatoria, ya que donde hay aleatoriedad hay incertidumbre, por lo que los resultados de una muestra o de un proceso no se puede predecir con precisión absoluta, por lo que se requiere conocer los conceptos de probabilidad.

Al usar los datos, un decisor ha de inferir algunas características de la población subyacente basándose en la limitada información que se cuenta, esta inferencia contiene un grado de incertidumbre, que el decisor o investigador conoce.

Con el advenimiento de las computadoras personales el dar sentido a los datos se ha hecho más fácil. Existen cientos de paquetes de software estadístico. De manera que ahora uno se puede concentrar más en los resultados y en su presentación, más que en el procesamiento de los datos.

Reiteramos lo que se mencionó  anteriormente en este blog: a pesar de los avances logrados en estadística a la actualidad, aún las empresas y las instituciones tutelares del gobierno no han llegado a incorporar a la práctica el pensamiento estadístico necesario, a pesar que las TICs, permiten que este sea más alcanzable.