Metodología de investigación en educación médica
eISSN 2007-5057
Investigación educ. médica Vol. 15, no. 59, México, julio-septiembre 2026
https://doi.org/10.22201/fm.20075057e.2026.59.26791
Estimación por máxima verosimilitud
en la teoría de respuesta al ítem:
II. Parámetros de los ítems
Iwin Leenena,‡,*, José J. Navejab,§, Ramsés Vázquez-Liraa,¶
a Facultad de Psicología, Universidad Nacional Autónoma de México, Cd. Mx., México
b 3er Departamento de Medicina Interna y Centro Oncológico, Universidad Johannes Gutenberg de Mainz, Alemania.
ORCID ID:
‡ https://orcid.org/0000-0003-4807-540X
§ https://orcid.org/0000-0001-8640-6690
¶ https://orcid.org/0000-0003-0936-6327
Recibido: 10-febrero-2026. Aceptado: 25-marzo-2026.
*Autor para correspondencia: Iwin Leenen.
Correo electrónico: iwin.leenen@gmail.com
Este es un artículo Open Access bajo la licencia CC BY-NC-ND (http://creativecommons.org/licenses/by-nc-nd/4.0/).
Resumen
La teoría de respuesta al ítem (TRI) proporciona un marco conceptual para explicar las respuestas a instrumentos psicológicos mediante modelos matemáticos que incluyen parámetros tanto para las personas que responden como para los ítems que conforman el instrumento. Este artículo, que es el segundo en una serie de tres dedicada a revisar los principios de la estimación de parámetros en modelos TRI, se centra en los procedimientos para estimar los parámetros de los ítems. En particular, revisamos tres variantes del método de estimación por máxima verosimilitud: máxima verosimilitud conjunta, máxima verosimilitud condicional y máxima verosimilitud marginal. Para cada variante resaltamos sus características principales, así como sus ventajas y limitaciones. Finalmente, ilustramos los procedimientos mediante un ejemplo de un análisis de respuestas en un examen de opción múltiple.
Palabras clave: Estimación de parámetros; máxima verosimilitud; modelo de Rasch; psicometría; teoría de respuesta al ítem.
Este es un artículo Open Access bajo la licencia CC BY-NC-ND (http://creativecommons.org/licenses/by-nc-nd/4.0/).
Maximum likelihood estimation in models from item response theory: II. Item parameters
Abstract
Item response theory (IRT) offers a conceptual framework for explaining the responses on psychological tests through mathematical models that include parameters for the respondents as well as for the items that make up the test. This article, which is the second in a series of three that review the principles underlying parameter estimation in IRT models, focuses on the procedures used to estimate the item parameters. In particular, we review three variants of maximum likelihood estimation: joint maximum likelihood, conditional maximum likelihood, and marginal maximum likelihood. For each variant, we highlight its main characteristics, together with its advantages and limitations. Finally, we illustrate these procedures with an example of an analysis of the responses to a multiple-choice test.
Keywords: Parameter estimation; maximum likelihood; Rasch model; psychometrics; item response theory.
This is an Open Access article under the CC BY-NC-ND license (http://creativecommons.org/licenses/by-nc-nd/4.0/).
INTRODUCCIÓN
Para el análisis psicométrico de pruebas que miden rasgos psicológicos latentes (como habilidades cognitivas, competencias, actitudes, rasgos de personalidad), el enfoque de la Teoría de Respuesta al Ítem (TRI) se ha consolidado como una herramienta central. Específicamente, en el contexto de la evaluación educativa y, sobre todo, para pruebas a gran escala y de alto impacto, las ventajas conceptuales y metodológicas de la TRI han convertido este enfoque en el marco predominante para el análisis de los datos de evaluación1-6.
La aplicación de un modelo TRI requiere programas informáticos especializados que permiten, entre otros aspectos, obtener estimaciones de los parámetros del modelo, evaluar la precisión de dichas estimaciones y examinar el ajuste del modelo a los datos observados. Con respecto al método de estimación, el más utilizado en este contexto es la estimación por máxima verosimilitud (MLE, maximum likelihood estimation). En el número anterior de esta revista7 presentamos una revisión de los principios que subyacen a la MLE y mostramos cómo se aplican para la estimación de los parámetros de las personas en el caso particular del modelo de Rasch8. En este desarrollo, se asumió que los parámetros de los ítems eran conocidos; sin embargo, en la práctica, también es necesario estimarlos. El presente trabajo se centra en los procedimientos de MLE para estimar los parámetros de los ítems.
En la siguiente sección retomamos brevemente la notación y las ecuaciones básicas del modelo de Rasch, así como el concepto de verosimilitud, que resulta necesario para las secciones subsecuentes. Posteriormente, explicamos las tres principales variantes de MLE para los parámetros de los ítems: máxima verosimilitud conjunta, máxima verosimilitud condicional y máxima verosimilitud marginal. Tras presentar estas tres aproximaciones, ofrecemos una síntesis comparativa, destacando las principales ventajas y limitaciones de cada una. Asimismo, incluimos una breve revisión de software libre y un ejemplo de su aplicación en datos empíricos. El artículo concluye con algunos comentarios finales.
EL MODELO DE RASCH Y EL CONCEPTO DE VEROSIMILITUD
Cuando en la práctica se quiere ajustar el modelo de Rasch a datos empíricos, generalmente se dispone de las respuestas de 𝑛 personas a 𝑚 ítems. Estos datos pueden organizarse en una matriz 𝒚 de dimensiones 𝑛 × 𝑚 con valores dicotómicos (unos y ceros para respuestas correctas e incorrectas, respectivamente). El modelo de Rasch incluye para cada persona p un parámetro θp (su nivel en el rasgo latente que se quiere medir) y para cada ítem 𝑖 un parámetro β𝑖 (su dificultad). La relación entre estos parámetros y la probabilidad de las posibles respuestas de la persona en el ítem se expresa mediante la siguiente ecuación:
En esta ecuación, 𝑌p𝑖 es la variable que representa la respuesta de la persona p en el ítem 𝑖 y 𝑦p𝑖 corresponde al valor concreto de esta variable.
La ecuación 1 describe la probabilidad de la respuesta en un ítem individual. El modelo de Rasch también permite calcular la probabilidad de un patrón completo de respuestas, 𝒚p = (𝑦p1, 𝑦p2, ..., 𝑦p𝑖, ..., 𝑦p𝑚); es decir, la probabilidad conjunta de las respuestas de la persona p a todos los 𝑚 ítems de la prueba. Para ello, el modelo asume independencia local, lo cual implica que la probabilidad conjunta se obtiene multiplicando las probabilidades de las respuestas en los ítems individuales:
El problema de estimación consiste esencialmente en asignar valores a los
parámetros de las personas,
Es decir, la verosimilitud del valor específico del parámetro θp es, por definición, la probabilidad de observar los datos 𝒚p para dicho valor de θp (según la ecuación 2). Para obtener el estimador por máxima verosimilitud se considera la verosimilitud como una función de θp y se busca aquel valor del parámetro que maximice ℒ(θp; 𝒚p, 𝛃). De manera equivalente, se puede buscar también el valor θp que maximice la logverosimilitud, ℓ(θp; 𝒚p) ≝ log ℒ(θp; 𝒚p, 𝛃). Dado que el logaritmo es una función estrictamente creciente, ambas funciones, ℓ(θp; 𝒚p, 𝛃) y ℒ(θp; 𝒚p, 𝛃) , alcanzan su máximo en el mismo valor de θp. En la práctica, analizar la logverosimilitud suele ser más conveniente y ofrece ventajas computacionales.
Para una explicación más extensa de los conceptos introducidos en esta sección, véase nuestro artículo publicado en el número anterior de esta revista. En las siguientes secciones presentamos los procedimientos para estimar los parámetros de los ítems en el vector 𝛃 utilizando los principios de MLE.
MÁXIMA VEROSIMILITUD CONJUNTA (JML)
La verosimilitud definida en la ecuación 3 es una función de un solo parámetro (θp). Encontrar el valor del parámetro donde esta función alcanza su máximo es relativamente directo. Sin embargo, los mismos principios de máxima verosimilitud pueden extenderse para estimar simultáneamente los 𝑛 + 𝑚 parámetros del modelo de Rasch: esto implica buscar entre todos los posibles valores para los parámetros del vector (𝝷, 𝛃) = (θ1, θ2, ..., θ𝑛, β1, β2, ..., β𝑚). aquella combinación que resulta más verosímil a la luz de los datos observados 𝒚.
La función de verosimilitud conjunta de los 𝑛 + 𝑚 parámetros se obtiene multiplicando las probabilidades de los patrones de respuesta de las distintas personas en la Ecuación 2:
Esta multiplicación se base en el supuesto de independencia experimental, lo cual quiere decir que, condicional a los parámetros 𝛃, las respuestas de una persona no aportan información sobre las respuestas de otras personas. Este supuesto es distinto del de independencia local, pero es igualmente fundamental para la verosimilitud conjunta.
Al tomar el logaritmo de ambos lados de la ecuación anterior se obtiene la función de logverosimilitud conjunta:
donde , el número de respuestas correctas de la persona p en los m ítems, y , el número de respuestas correctas en el ítem i por las n personas. La ecuación anterior implica que (x1, x2, ..., xn, s1, s2, ..., sm) son estadísticos suficientes para estimar los n + m parámetros en (). Sin embargo, solo se requieren n + m – 1 de estos estadísticos suficientes y solo hay n + m – 1 parámetros libres, lo cual es consecuencia de que el modelo de Rasch no está identificado. En efecto, un análisis de la función de verosimilitud en la ecuación 4 muestra que para cualquier constante c se cumple:
Es decir, sumar la misma constante a todos los parámetros θp y β𝑖, no cambia las probabilidades de acertar o fallar (en la ecuación 1) ya que las diferencias entre los parámetros no cambian: (θp + 𝑐) – (β𝑖 + 𝑐) = (θp – β𝑖 ). Por lo tanto, existen múltiples soluciones para () que maximizan la función de verosimilitud. A esto se refiere cuando se dice que el modelo no está identificado. Una forma estándar de resolver esta falta de identificación (y seleccionar una solución particular entre todas las posibles) consiste en fijar el valor de uno de los parámetros; por ejemplo, se impone β1 = 0. Esto implica que no se estima β1 y se estiman, en total, 𝑛 + 𝑚 – 1 parámetros del modelo.
Los estimadores por máxima verosimilitud se obtienen generalizando el procedimiento de MLE de θp. Dado que ahora se trata de múltiples parámetros, se calculan las derivadas parciales de la función de logverosimilitud en la ecuación 5 con respecto a cada uno de ellos (θ1, θ2, ..., θ𝑛, β2, β3, ..., β𝑚), se igualan las derivadas parciales a cero y se buscan los valores de los parámetros que satisfagan simultáneamente el sistema de ecuaciones que resulta. De esta manera, se obtiene el siguiente sistema de 𝑛 + 𝑚 – 1 ecuaciones (con 𝑛 + 𝑚 – 1 incógnitas; recuérdese que se fijó β1 = 0):
Una solución analítica para este sistema de ecuaciones no existe; sin embargo, se puede encontrar aplicando algoritmos iterativos.
Es importante señalar dos problemas con la estimación por JML. El primero es idéntico a un problema mencionado en nuestro artículo previo sobre la estimación de θp: si, para una persona p, 𝓍p = 0 o 𝓍p = 𝑚, entonces no existe la MLE ; de manera similar, si, para un ítem 𝑖, 𝑠𝑖 = 0 o 𝑠𝑖 = 𝑛 (es decir, nadie lo acierta o todos lo aciertan), entonces no existe la MLE β̂1
MÁXIMA VEROSIMILITUD CONDICIONAL (CML)
Como hemos comentado en varias ocasiones, 𝓍p, el número de ítems que acertó la persona p, es un estadístico suficiente para estimar su parámetro θp en el modelo de Rasch. Esto implica que todas las personas con el mismo número de aciertos tendrán la misma estimación
CML explota esta propiedad del modelo de Rasch definiendo una función de verosimilitud condicional a los puntajes observados de las 𝑛 personas en el vector 𝔁 = (𝓍1, 𝓍2, ..., 𝓍𝑛). Esta función ya no incluye los parámetros de las personas, sino únicamente los parámetros de los ítems. El siguiente ejemplo ilustra cómo se logra eliminar los parámetros de las personas de la función de verosimilitud. Nuestra exposición aquí sigue, en lo esencial, la presentación de Verhelst10.
Considérese una prueba con 𝑚 = 3 ítems y el patrón de respuestas 𝒚p = (1,0,1) de la persona p; entonces, el puntaje observado de esta persona es 𝓍p = 2. A continuación, derivamos la probabilidad de observar este patrón de respuesta 𝒚p condicional al puntaje observado 𝓍p, es decir, la probabilidad de que la persona p tenga el patrón de respuesta (1,0,1), si se sabe que tiene dos aciertos. Nótese que el puntaje 𝓍p = 2 solo ocurre con tres patrones de respuesta: (1,1,0), (1,0,1) y (0,1,1) . Por lo tanto, dicha probabilidad condicional es la siguiente:
El símbolo 𝗏 en la primera ecuación denota una disyunción (y se lee como “o”). Las probabilidades del lado derecho de la ecuación 6 se obtienen a partir de la ecuación 3. P. ej., la probabilidad del patrón (1,0,1) está dada por: