ejora de la Confiabilidad en el Conteo de
M
Piezas en Almacenes: Un Análisis del Estado
del Arte desde la Metrología hasta el
Machine Learning Avanzado
Parte I: Fundamentos del Conteo Gravimétrico y Control Estadístico de Procesos
Esta primera parte establece el problema fundamental. Se argumentará que el conteo por
pesaje, aunque aparentemente simple, es un problema metrológico complejo plagado de variabilidad.
Se presentará el Control Estadístico de Procesos (SPC) como el método canónico para entender y
estabilizar esta variabilidad, pero se concluirá que el SPC, por sí solo, es insuficiente para resolver el
problema de la estimación del conteo, sentando así las bases para la necesidad de un enfoque de
modelado predictivo.
Sección 1: Principios Metrológicos del Conteo de Piezas por Pesaje
El conteo de piezas mediante el uso de básculas es una práctica industrial extendida, valorada
por su simplicidad y rapidez en operaciones de recepción, almacenamiento, producción y expedición.1
Sin embargo, la aparente sencillez de este método gravimétrico oculta una serie de desafíos
metodológicos que, si no se abordan con rigor, pueden conducir a errores significativos en la gestión de
inventarios, afectando la eficiencia operativa y la confiabilidad como proveedor.2 La transición de un
conteo manual, lento y propenso a errores, a un sistema basado en el peso representa una mejora
sustancial, pero exige una comprensión profunda de los principios subyacentes y los factores que
gobiernan su exactitud.3
1.1. El Método Fundamental: Peso Promedio de Pieza (APW)
El pilar de todo sistema de conteo por pesaje es el cálculo del Peso Promedio de Pieza,
conocido por su acrónimo en inglés, APW (Average Piece Weight). El procedimiento estándar,
implementado en la mayoría de las balanzas contapiezas comerciales, consiste en dos pasos
secuenciales. Primero, se determina el APW pesando una pequeña muestra de referencia, típicamente
de 10 piezas, y dividiendo el peso total de la muestra por el número de piezas.1 La balanza almacena
este valor en su memoria. Segundo, se coloca el lote completo de piezas en la plataforma de pesaje, y
la balanza calcula la cantidad total dividiendo el peso neto del lote por el APW previamente
almacenado.4
La exactitud de todo el proceso depende críticamente de la representatividad y la medición
precisa de esta muestra de referencia. Cualquier error introducido en la determinación del APW no es
un error aislado; se convierte en un factor de escala que se propaga y magnifica a lo largo de todo el
proceso de conteo. Un APW incorrecto funciona como un error sistemático que afectará a cada lote
medido posteriormente con esa referencia.1 Por esta razón, las buenas prácticas de pesaje dictan que
se debe determinar un nuevo APW para cada nuevo lote de producción. Las variaciones en las
materias primas, los ajustes en la maquinaria de fabricación o el desgaste de los moldes pueden alterar
sutilmente el peso promedio de las piezas, haciendo que un APW previamente almacenado quede
obsoleto y se convierta en una fuente de inexactitud.1
El método APW, aunque práctico, introduce una simplificación fundamental que es la raíz de su
inherente fragilidad. Colapsa una distribución de probabilidad de pesos —la variabilidad real y natural
que existe entre las piezas individuales— en un único estimador puntual: el promedio de la muestra. La
realidad física es que cada pieza i posee un peso pique es una variable aleatoria extraída de una
distribución con una media poblacional μ y una desviación estándar poblacional σ>0.1 El APW
calculado a partir de una muestra finita es, en sí mismo, solo unaestimaciónde μ, sujeta a su propio
error de muestreo. Incluso si se lograra obtener un APW perfectamente igual a μ, la fórmula de conteo,
Cantidad=Peso Total/APW, seguiría siendo una aproximación. El Peso Totalno es N×μ, sino la suma
de N variables aleatorias, ∑i=1Npi. Esta distinción es crucial: el problema del conteo por pesaje no es
meramente un desafío demedición(obtener un valorde peso preciso), sino un problema de
estimación estadística(inferir una cantidad discretaa partir de una medición continua y variable). Esta
perspectiva justifica la transición de una fórmula determinista simplificada a modelos de machine
learning, que están diseñados para aprender la relación estocástica subyacente entre el peso total y la
cantidad de piezas.
1.2. Factores Críticos que Afectan la Exactitud del Conteo
La fiabilidad del conteo gravimétrico está influenciada por una interacción de factores
relacionados con el producto, el equipo y el procedimiento. La comprensión y el control de estos
factores son esenciales para minimizar los errores.
Variación del Peso de la pieza:El factor más determinante es la variabilidad inherente en el
peso de las piezas individuales. Esta variabilidad se cuantifica mediante la desviación estándar. La
experiencia práctica en la industria indica que la desviación estándar del peso de las piezas suele oscilar
entre el 0.5% y el 1.5% del peso promedio.1 Sin embargo, para ciertos productos, como piezas
moldeadas en plástico, esta desviación puede ser considerablemente mayor. Existe una relación directa
e inequívoca: a mayor sea la desviación estándar de los pesos de las piezas, mayor será el error
potencial en el conteo final. Por lo tanto, al especificar un sistema de conteo, es imperativo considerar
las piezas más críticas, que son aquellas muy ligeras o con una gran desviación en su peso.1
Resolución de la Báscula:La capacidad del instrumento de pesaje para detectar pequeños
cambios de peso, conocida como su resolución, debe ser adecuada para la tarea. Para lograr
resultados de conteo exactos, la resolución de la báscula utilizada para determinar el APW debe ser
significativamente mayor que la variabilidad del peso de una sola pieza. Cuando se cuentan piezas muy
ligeras o con una alta variabilidad, la resolución requerida para la muestra de referencia puede exceder
la capacidad necesaria para pesar el lote a granel. En tales casos, la solución óptima es un sistema de
dos balanzas: una báscula de referencia de alta resolución conectada a una báscula de granel de mayor
capacidad. Este sistema dual asegura que el APW se determine con la máxima precisión posible,
minimizando el error de propagación.1
Tamaño de la Muestra de Referencia:El número de piezas utilizadas para calcular el APW
tiene un impacto directo en la exactitud del conteo. Una muestra más grande proporciona una
estimación más fiable de la media del peso poblacional, reduciendo el error de muestreo. El efecto es
particularmente pronunciado cuando las piezas exhiben una alta desviación estándar. Por ejemplo, se ha
demostrado que aumentar el tamaño de la muestra de referencia de 10 a 30 piezas puede reducir a la
mitad el error de conteo resultante en estas condiciones.1 Esta simple medida procedimental es una de
las formas más efectivas y económicas de mejorar la fiabilidad del proceso.
1.3. Justificación Industrial del Conteo por Pesaje
La adopción de sistemas de conteo por pesaje en entornos industriales y logísticos no es una
mera conveniencia, sino una decisión estratégica con profundas implicaciones económicas y operativas.
Un sistema de conteo fiable y eficiente genera beneficios tangibles en toda la cadena de valor.
En primer lugar, permite una gestión de inventario precisa y en tiempo real. Al eliminar el conteo
manual, se evitan errores humanos y se libera tiempo valioso del personal, que puede ser reasignado a
tareas de mayor valor añadido.2 Un inventario exacto previene tanto las roturas de stock, que conducen
a ventas perdidas y clientes insatisfechos, como el exceso de stock, que inmoviliza capital y ocupa un
valioso espacio de almacén.
En segundo lugar, el conteo por pesaje funciona como un mecanismo de control de calidad.
Asegura que los clientes reciban la cantidad exacta de piezas solicitadas, lo cual es fundamental para
mantener la confianza y la reputación como proveedor fiable.2 Este nivel de precisión en el empaque y
la expedición es crucial para construir relaciones comerciales duraderas y competitivas.
Finalmente, la agilización de los procesos de conteo y empaque conduce a una mayor
productividad general. Los procesos se vuelven más rápidos, repetibles y fiables, permitiendo que las
entregas se realicen a tiempo y cumpliendo con las expectativas del cliente.2 En resumen, la inversión en
un sistema de conteo por pesaje preciso se traduce directamente en una reducción de costes (menos
desperdicio, menos errores, menos mano de obra), un aumento de la eficiencia y, en última instancia,
una mayor rentabilidad.3
Sección 2: Análisis Exhaustivo de Fuentes de Variación y Error en el Pesaje Industrial
Para desarrollar un modelo predictivo robusto, es imperativo primero comprender y
caracterizar todas las fuentes potenciales de variabilidad y error que pueden afectar la medición del
peso. El peso medido por la balanza no es un valor puro, sino el resultado de un proceso físico
influenciado por el entorno, el instrumento y el operador. Un análisis sistemático de estos factores es el
primer paso para controlarlos o, en el caso de un modelo de machine learning, para enseñarle al modelo
a compensarlos.
2.1. Taxonomía de Errores en el Análisis Cuantitativo
En la metrología y el análisis cuantitativo, los errores de medición se clasifican en tres categorías
distintas, cada una con sus propias causas y métodos de mitigación.6
Errores Gruesos o Accidentales:Estos son errores de gran magnitud que invalidan una
medición. Son "fatales" en el sentido de que sus resultados se desvían tan drásticamente del valor
esperado que deben ser descartados. Las causas suelen ser fallos humanos o malfuncionamientos
evidentes del equipo, como olvidar tarar la balanza antes de una pesada, transcribir incorrectamente un
valor o una interrupción de energía durante la medición. La única forma de corregir un error grueso es
desechar la observación y repetir el procedimiento desde el principio.6
Errores Sistemáticos (Sesgo):Estos errores afectan laexactitudde la medición,
introduciendo una desviación constante y predecible en una dirección específica. Un error sistemático
hará que todas las mediciones sean consistentemente más altas o más bajas que el valor verdadero. Las
causas comunes incluyen una calibración incorrecta del instrumento, un sesgo personal constante en la
lectura de una escala analógica, o un factor ambiental no corregido que influye de manera constante en
el sistema. Los errores sistemáticos, una vez identificados, pueden ser corregidos o minimizados. Por
ejemplo, una balanza que consistentemente pesa 2 gramos por debajo del valor real puede ser
recalibrada o sus lecturas pueden ser corregidas matemáticamente.6
Errores Aleatorios (Imprecisión):Estos errores afectan laprecisiónde la medición,
causando fluctuaciones impredecibles y no direccionales alrededor del valor real. Son inherentes a
cualquier proceso de medición y provienen de la imposibilidad de replicar las condiciones exactas de
una medición a otra. Fuentes de error aleatorio incluyen las limitaciones en la resolución del instrumento,
fluctuaciones electrónicas en los sensores, vibraciones ambientales sutiles y la variabilidad en la técnica
del operador. A diferencia de los errores sistemáticos, los errores aleatorios no pueden eliminarse por
completo, pero su efecto puede reducirse mediante la repetición de las mediciones y el cálculo de un
promedio, ya que tienden a anularse entre sí a largo plazo.6
2.2. Fuentes de Error Específicas del Proceso Gravimétrico
Más allá de la clasificación teórica, en un entorno de pesaje industrial, los errores se manifiestan
a través de factores concretos del entorno, el equipo y la operación.
Factores Ambientales:El entorno de un almacén o una planta de producción es a menudo
hostil para los instrumentos de precisión. Lasvibraciones de baja frecuencia, generadas por
maquinaria pesada o el tránsito de vehículos, pueden causar inestabilidad en las lecturas de la balanza.7
Lascorrientes de aire, provenientes de sistemas de ventilación o puertas abiertas, ejercen una fuerza
sobre la plataforma de pesaje, introduciendo errores, especialmente con objetos ligeros.8 Loscambios
bruscos de temperatura y humedadpueden afectar tantoa la electrónica del sensor como a las
propiedades físicas del objeto que se pesa, especialmente si es higroscópico (absorbe humedad del
aire).6 Laradiación solar directatambién puede calentar el equipo y causar deriva en las mediciones.7
Factores Instrumentales:Cada instrumento de pesaje tiene sus propias fuentes de error. Laderiva
instrumentales el cambio gradual en las características de la balanza con el tiempo, lo que hace
necesaria una calibración periódica.7 Lafalta de calibraciónes una de las fuentes más comunes de
error sistemático.1 Las ensibilidaddel equipo y suvariabilidad intrínsecacontribuyen al error
aleatorio.9 En aplicaciones específicas, como la calibración de micropipetas por método gravimétrico, la
e vaporacióndel líquido puede ser una fuente significativa de error, aunque es menos relevante para el
conteo de piezas sólidas, a menos que estas estén húmedas o recubiertas con sustancias volátiles.10
Factores Operativos:El factor humano sigue siendo una fuente importante de variabilidad. Los
errores en la lectura de los displays, la manipulación incorrecta del equipo (por ejemplo, colocar el lote
de forma descentrada en la plataforma), o la falta de estandarización en los procedimientos (por
ejemplo, no esperar a que la lectura se estabilice) introducen tanto errores aleatorios como
sistemáticos.6
Estas fuentes de error no actúan de forma aislada, sino que interactúan de manera compleja y a
menudo no lineal. Por ejemplo, un aumento de la temperatura puede alterar la viscosidad de los
lubricantes en los componentes mecánicos de una balanza, lo que a su vez modifica su respuesta a las
vibraciones. Modelar analíticamente estas interacciones requeriría un conocimiento profundo de la física
del sensor y del entorno, lo cual es a menudo inviable. Aquí reside una oportunidad clave para el
machine learning. Un modelo, como una red neuronal, puede funcionar como un "aproximador universal
de funciones".11 Si se le alimenta con datos de entrada que incluyen no solo el peso bruto, sino también
lecturas de sensores ambientales (termómetros, acelerómetros para vibración, etc.), el modelo puede
aprender la función de mapeo compleja f(peso bruto,temp,vib,...)→cantidad real. Esta función captura
implícitamente las interacciones y efectos no lineales, actuando como un sistema de corrección de
errores en tiempo real que sería extremadamente difícil de programar explícitamente.
2.3. Estrategias de Minimización de Errores
La mitigación de errores en el pesaje industrial requiere un enfoque multifacético que aborde el
entorno, el equipo y los procedimientos.
Para contrarrestar losfactores ambientales, se deben implementar controles como la
instalación de balanzas en áreas con el mínimo tránsito y ruido posible, protegidas de corrientes de aire
y luz solar directa, y en entornos con temperatura y humedad controladas.7
Para losfactores instrumentales, la estrategia principal es un programa de mantenimiento y
calibración riguroso y regular.1 La calibración asegura la exactitud (minimiza el sesgo), mientras que el
mantenimiento preventivo asegura la fiabilidad. Además, para reducir el impacto del error aleatorio del
instrumento, se puede aumentar el número de pesadas y promediar los resultados, una técnica que
ayuda a disminuir la variabilidad instrumental.9
Para losfactores operativos, la formación adecuada de los operarios es fundamental. Deben
comprender el funcionamiento del equipo, la importancia de seguir procedimientos estandarizados y los
factores que pueden influir en la exactitud de las mediciones.1
Un concepto avanzado para la gestión de la precisión es el "factor de seguridad" propuesto por
fabricantes como Mettler Toledo. Este enfoque define una tolerancia de proceso de pesaje y luego la
ajusta mediante un factor de seguridad (típicamente entre 2 y 4, dependiendo de la severidad del
entorno industrial) para garantizar que, incluso con las fluctuaciones e influencias externas, las
mediciones se mantengan dentro de las especificaciones requeridas. Este método proporciona un marco
cuantitativo para gestionar el riesgo de mediciones fuera de tolerancia.8
Sección 3: El Paradigma del Control Estadístico de Procesos (SPC) para la Garantía de
Calidad
Antes de que se pueda aplicar cualquier modelo predictivo avanzado para estimar el conteo de
piezas, el proceso de medición en sí debe ser estable y predecible. El Control Estadístico de Procesos
(SPC, por sus siglas en inglés) es la metodología industrial estándar para lograr este estado de control.
El SPC no resuelve directamente el problema de la estimación del conteo, pero establece la base de un
proceso fiable y datos de alta calidad, que son prerrequisitos indispensables para el éxito de cualquier
iniciativa de machine learning.
3.1. Objetivos del SPC en la Industria
El objetivo fundamental del SPC es lograr la estabilidad del proceso y reducir su variabilidad.12
Un proceso se considera estable si es reproducible y su comportamiento futuro es predecible dentro de
unos límites conocidos.12 Esta predictibilidad es la esencia del control estadístico. El SPC permite a las
organizaciones pasar de un modo reactivo de "inspección y corrección" a un modo proactivo de
"monitorización y prevención". Al analizar los datos del proceso en tiempo real, se pueden detectar
desviaciones y aplicar acciones correctivas antes de que se produzcan productos no conformes.13
Los beneficios de implementar SPC son significativos. Conduce a una mejora en la calidad del
producto, una reducción de los costes asociados con desperdicios, reprocesos y reclamaciones, y un
aumento general de la eficiencia operativa.14 Además, proporciona una base cuantitativa para las
iniciativas de mejora continua, permitiendo a los equipos comprender mejor la capacidad de sus
procesos y tomar decisiones basadas en datos.13
3.2. Herramientas Clave del SPC
El SPC se basa en un conjunto de herramientas estadísticas para analizar y visualizar la
variabilidad del proceso. Las dos herramientas más importantes en este contexto son los gráficos de
control y los estudios de capacidad.
Gráficos de Control:Un gráfico de control es una representación gráfica de una característica
de calidad medida a lo largo del tiempo. Consiste en una línea central (CL), que representa el promedio
del proceso, y dos límites de control, uno superior (UCL) y otro inferior (LCL), calculados
estadísticamente a partir de los datos históricos del proceso.15 El propósito principal de un gráfico de
control es ayudar a distinguir entre dos tipos de variación:
● Causas Comunes de Variación:Son las fuentes de variabilidad inherentes y naturales de un
proceso que está funcionando correctamente. Son el resultado acumulativo de muchas pequeñas
causas inevitables. Un proceso en el que solo actúan causas comunes se dice que está "en estado
de control estadístico" o "estable".12
● Causas Especiales (o Asignables) de Variación:Son fuentes de variabilidad no inherentes al
diseño del proceso. Surgen de factores específicos e identificables, como un mal ajuste de una
máquina, un lote de materia prima defectuosa o un error del operador. Estas causas son
impredecibles y hacen que el proceso sea inestable.12
Si todos los puntos de datos en el gráfico de control se encuentran dentro de los límites de
control y no muestran patrones no aleatorios (como rachas, tendencias o ciclos), se considera que el
proceso está bajo control. Si un punto cae fuera de los límites o se observa un patrón inusual, es una
señal de que una causa especial ha afectado al proceso, y se debe investigar y eliminar.17
Estudios de Capacidad de Proceso (Cp y Cpk):Una vez que un proceso está en estado de
control estadístico, el siguiente paso es evaluar si escapazde cumplir con las especificaciones del
cliente o los requisitos de ingeniería. Para esto se utilizan los índices de capacidad.
● Índice de Capacidad Potencial (Cp):Este índice mide la dispersión del proceso en relación con
la dispersión permitida por las especificaciones. Se calcula como la diferencia entre el límite de
especificación superior (LSE) y el límite de especificación inferior (LIE), dividida por la dispersión
natural del proceso (generalmente asumida como 6σ).12 La fórmula es:Cp=6σLSE−LIEEl Cp
indica si el proceso es potencialmente capaz de producir dentro de las especificaciones, pero no
tiene en cuenta si el proceso está centrado. Un valor de Cpalto con un proceso descentrado aún
puede generar productos defectuosos.12
● Índice de Capacidad del Proceso (Cpk): Este índice supera la limitación del CP al tener en cuenta
tanto la dispersión como el centrado del proceso. Mide la distancia desde la media del proceso
hasta el límite de especificación más cercano, en unidades de 3σ. Se calcula como el mínimo de
dos valores:Cpk=min(3σLSE−μ,3σμ−LIE)donde μ es la media del proceso. El Cpk
proporciona una medida más realista de la capacidad real del proceso. Generalmente, se
considera que un proceso es capaz si su Cpkes superior a 1.33, y excelente si es superior a
2.00.12
3.3. Aplicación del SPC al Proceso de Pesaje
En el contexto del conteo de piezas por pesaje, el SPC se aplica para asegurar que el sistema
de medición en sí mismo sea fiable y consistente. Se pueden utilizar gráficos de control para monitorear
el peso de patrones de calibración a lo largo del tiempo. Si el peso medido del patrón se mantiene
estable dentro de los límites de control, se puede confiar en que la balanza no está sujeta a causas
especiales de variación, como una deriva significativa o descalibraciones repentinas.18
Los estudios de capacidad se pueden utilizar para verificar si la balanza tiene la precisión y la
exactitud necesarias para la aplicación. Por ejemplo, se pueden definir límites de especificación muy
estrechos alrededor del peso conocido de un patrón y calcular el Cpkdel proceso de medición. Un
Cpkalto indicaría que la balanza es altamente capaz de medir consistentemente dentro de las
tolerancias requeridas.
La implementación de SPC es una condición necesaria pero no suficiente para un conteo
preciso. El SPC establece una línea de base de estabilidad operativa, asegurando que las mediciones de
peso sean consistentes y que la variabilidad observada se deba a causas "comunes" y no a fallos
esporádicos del sistema. Sin embargo, el SPC no resuelve el problema de estimación fundamental
causado por la variación del peso de las propias piezas. De hecho, una vez que el SPC ha eliminado las
causas especiales de variación, la variabilidad restante (la "causa común") se convierte en la señal
principal que un modelo de machine learning debe aprender a interpretar. Por lo tanto, la salida de un
proceso de SPC bien implementado —un flujo de datos de un proceso estable y caracterizado— es la
entrada ideal para entrenar un modelo de ML fiable. Intentar aplicar ML a un proceso que no está bajo
control estadístico es una receta para el fracaso, ya que el modelo intentaría aprender tanto de la señal
real como del ruido impredecible de las causas especiales, lo que resultaría en un rendimiento pobre y
una incapacidad para generalizar a nuevas situaciones.
Parte II: Modelado Predictivo para la Estimación del Conteo de Piezas
Esta segunda parte constituye el núcleo técnico del informe. Se construirá un argumento
progresivo, comenzando con los modelos de regresión básicos y demostrando sus limitaciones teóricas
y prácticas para este problema específico. A continuación, se introducirán modelos estadísticos más
sofisticados, diseñados explícitamente para datos de conteo. Finalmente, se presentará un espectro de
modelos de machine learning avanzados, argumentando que su flexibilidad y capacidad para capturar
relaciones complejas y no lineales los convierten en la solución de vanguardia para la estimación precisa
y fiable del conteo de piezas.
Sección 4: Modelos de Regresión para la Predicción de Conteo a Partir del Peso
Los modelos de regresión lineal y polinomial son a menudo los primeros enfoques que se
consideran para modelar la relación entre dos variables cuantitativas debido a su simplicidad e
interpretabilidad. Aunque son herramientas poderosas en muchos contextos, su aplicación al problema
del conteo de piezas por peso revela importantes deficiencias teóricas que limitan su utilidad. Sin
embargo, su análisis es un paso crucial, ya que sirven como un modelo de referencia (baseline)
fundamental contra el cual se pueden medir y justificar las mejoras obtenidas con enfoques más
avanzados.
4.1. Regresión Lineal Simple: El Modelo Base
El enfoque más directo para modelar la relación entre el peso total de un lote y la cantidad de
piezas es la regresión lineal simple. El modelo se formula matemáticamente de la siguiente manera19:
Cantidad_Piezas=β0+β1×PesoTotal+ϵ
Donde:
● Cantidad_Piezas es la variable dependiente que se desea predecir.
● PesoTotales la variable independiente o predictora.
● β0es el intercepto, que representa el conteo predicho cuando el peso es cero. Teóricamente, β0
debería ser cero.
● β1es la pendiente, que representa el cambio en el número de piezas por cada unidad de aumento
en el peso. Este coeficiente está teóricamente relacionado con el inverso del Peso Promedio de
Pieza (APW).22
● ϵ es el término de error, que captura la variabilidad no explicada por el modelo.
El modelo de regresión lineal clásico se basa en varios supuestos clave sobre el término de
error ϵ: debe tener una media de cero, una varianza constante (homocedasticidad), no debe haber
correlación entre los errores (independencia) y deben seguir una distribución normal.19
La aplicación de este modelo al problema del conteo de piezas es problemática porque es muy
probable que se violen varios de estos supuestos fundamentales. La variable de resultado,
Cantidad_Piezas, es por naturaleza un número entero no negativo. Un modelo de regresión lineal, al
tratarla como una variable continua, puede generar predicciones no enteras (p. ej., 152.3 piezas) e
incluso negativas, lo cual es físicamente imposible.23 Además, es muy probable que la varianza del error
de conteo no sea constante; el error absoluto al contar un lote de 10,000 piezas será probablemente
mayor que al contar un lote de 100 piezas. Esta condición, conocida como heterocedasticidad, viola el
supuesto de varianza constante y puede llevar a estimaciones ineficientes y a inferencias estadísticas
incorrectas.24
4.2. Regresión Polinomial: Capturando la No Linealidad
Cuando la relación entre la variable predictora y la dependiente no es una línea recta, la
regresión polinomial ofrece una extensión de la regresión lineal para capturar esta curvatura. El modelo
introduce términos de potencias superiores de la variable predictora25:
Cantidad_Piezas=β0+β1(Peso)+β2(Peso2)+...+βh(Pesoh)+ϵ
Donde h es el grado del polinomio. Un polinomio de grado 2 (h=2) se denomina cuadrático y
puede modelar una única curva (p. ej., una parábola), mientras que grados superiores pueden modelar
relaciones más complejas.27 A pesar de modelar una relación no lineal entre el peso y la cantidad, este
modelo sigue siendolineal en los coeficientesβ, lo que significa que puede ser estimado utilizando los
mismos métodos de Mínimos Cuadrados Ordinarios (OLS) que la regresión lineal simple.26
En el contexto del pesaje, un modelo polinomial podría ser útil para capturar fenómenos físicos
no lineales. Por ejemplo, en lotes muy grandes, la compactación de las piezas en el fondo del
contenedor podría afectar la lectura del peso de una manera no proporcional. De manera similar, los
sensores de las básculas (celdas de carga) pueden exhibir respuestas no lineales en los extremos de su
rango operativo. Un modelo polinomial podría aprender y corregir estas no linealidades.28
Sin embargo, la regresión polinomial comparte las mismas debilidades fundamentales que la
regresión lineal simple cuando se aplica a datos de conteo: sigue tratando la variable de resultado como
continua y es susceptible de violar los supuestos de homocedasticidad y normalidad de los residuos.
Adicionalmente, introduce un nuevo riesgo: el sobreajuste (overfitting). Un polinomio de grado
demasiado alto puede ajustarse perfectamente a los datos de entrenamiento, capturando no solo la
relación subyacente sino también el ruido aleatorio. Esto resulta en un modelo que funciona mal con
datos nuevos y que puede producir extrapolaciones extremadamente poco fiables y sin sentido físico
fuera del rango de los datos de entrenamiento.26
En conclusión, tanto la regresión lineal como la polinomial son teóricamente inadecuadas para el
problema del conteo. Su valor dentro de un proyecto de tesis no reside en su capacidad para resolver
el problema de forma definitiva, sino en su función como un punto de partida simple e interpretable. Al
implementar estos modelos y analizar rigurosamente sus fallos (predicciones no enteras, residuos
heterocedásticos, etc.), se construye un argumento sólido y basado en evidencia para justificar la
necesidad de recurrir a los modelos estadísticos y de machine learning más avanzados que se describen
en las siguientes secciones.
Sección 5: Modelos Estadísticos Avanzados para Datos de Conteo
Dadas las limitaciones de los modelos de regresión estándar, la estadística ofrece una clase de
modelos diseñados específicamente para variables de resultado que representan conteos. Estos
modelos, que pertenecen a la familia de los Modelos Lineales Generalizados (GLM), abordan
directamente la naturaleza discreta y no negativa de los datos de conteo y hacen supuestos más realistas
sobre su distribución de probabilidad y su estructura de varianza.
5.1. Regresión de Poisson
La regresión de Poisson es el punto de partida estándar para el modelado de datos de
conteo.21 Se basa en la distribución de Poisson, que modela la probabilidad de que un número dado de
eventos ocurra en un intervalo fijo de tiempo o espacio, asumiendo que estos eventos ocurren con una
tasa promedio conocida e independientemente del tiempo transcurrido desde el último evento.
El supuesto fundamental del modelo de Poisson es lae quidispersión, lo que significa que la
media de la variable de conteo es igual a su varianza (E=Var(Y)).23 Para conectar los predictores (en
este caso, el peso) con el conteo esperado, el modelo de Poisson utiliza unafunción de enlace
logarítmica (log link).2 4 Esto significa que el modelo no predice directamente el conteo Y, sino el
logaritmo de su media esperada λ: ln(λ)=ln(E)=β0+β1X1+...+βkXk
Esta función de enlace tiene dos ventajas cruciales:
1. Asegura que la media predicha, λ=exp(β0+β1X1+...), sea siempre positiva, lo cual es coherente
con una variable de conteo.
2. Implica una relación multiplicativa entre los predictores y la media del conteo. La exponenciación
de un coeficiente, exp(βj), se interpreta como el factor por el cual la media del conteo se multiplica
por cada aumento de una unidad en el predictor Xj, manteniendo los demás predictores
constantes.24
5.2. Regresión Binomial Negativa: Manejando la Sobredispersión
Aunque el modelo de Poisson es teóricamente sólido, su supuesto de equidispersión es a
menudo demasiado restrictivo para los datos del mundo real. En muchas aplicaciones prácticas, la
varianza de los datos de conteo es significativamente mayor que su media, un fenómeno conocido como
s obredispersión (overdispersion).2 3 Ignorar la sobredispersión y aplicar un modelo de Poisson de
todos modos puede llevar a errores estándar subestimados, valores p incorrectamente pequeños y, en
última instancia, a conclusiones estadísticas erróneas sobre la significancia de los predictores.29
La regresión Binomial Negativa (NB) es una extensión directa del modelo de Poisson diseñada
para manejar la sobredispersión. Puede considerarse como un modelo de Poisson donde la tasa media
λ no es fija, sino que sigue una distribución Gamma. El resultado es un modelo que incluye un
parámetro de dispersión adicional (α) que permite que la varianza sea mayor que la media.24 La relación
se modela como: Var(Y)=E+αE2 Cuando α=0, el modelo Binomial Negativo se reduce al modelo de
Poisson. Por lo tanto, el modelo NB es más flexible y a menudo proporciona un mejor ajuste a los
datos de conteo del mundo real.24
La elección entre un modelo de Poisson y uno Binomial Negativo no debe ser arbitraria. Es una
hipótesis comprobable sobre la naturaleza de la variabilidad del proceso. En el contexto del conteo de
piezas, la presencia de sobredispersión en los datos de conteo es un reflejo directo y medible de una
alta variabilidad en los pesos de las piezas individuales. Si las piezas fabricadas tienen una distribución
de pesos amplia, es natural que lotes con un mismo peso total puedan corresponder a un rango más
amplio de posibles conteos, lo que se manifiesta como sobredispersión en la variable de resultado. Por
lo tanto, realizar una prueba estadística de sobredispersión no es solo un paso técnico para la selección
del modelo, sino un diagnóstico cuantitativo del proceso de fabricación subyacente. El parámetro de
dispersión α podría incluso proponerse como un nuevo Indicador Clave de Rendimiento (KPI) para el
control de calidad del proveedor, vinculando directamente la calidad del modelo predictivo con la
calidad del producto físico.
5.3. Modelos de Cero-Inflado (Zero-Inflated Models)
En algunos conjuntos de datos de conteo, puede haber un número de ceros mucho mayor de lo
que predeciría una distribución de Poisson o Binomial Negativa. Esta situación se conoce como
cero-inflación.2 4 En el contexto de un almacén, esto podría ocurrir si el proceso de pesaje incluye
rutinariamente contenedores que se sabe que están vacíos.
Los modelos de cero-inflado, como el ZIP (Zero-Inflated Poisson) y el ZINB (Zero-Inflated Negative
Binomial), están diseñados para manejar este escenario. Son modelos de mezcla de dos partes24:
1. Unmodelo logístico (logit)que predice si una observación pertenece al grupo de "ceros
seguros" (p. ej., un contenedor vacío) o al grupo de "en riesgo" de tener un conteo positivo.
2. Unmodelo de conteo estándar (Poisson o NB)que modela los conteos para las observaciones
en el grupo "en riesgo". Este segundo grupo también puede generar ceros, pero lo hace a través
del proceso de conteo normal.
Estos modelos son particularmente útiles cuando existen dos procesos distintos que generan los ceros
en los datos. Producen dos conjuntos de coeficientes, uno para predecir la probabilidad de ser un "cero
seguro" y otro para predecir el conteo esperado dado que la observación no es un "cero seguro".24
Sección 6: Paradigmas de Machine Learning para una Predicción Robusta y No Lineal
Si bien los modelos estadísticos de la sección anterior ofrecen un marco teóricamente sólido
para los datos de conteo, los modelos de machine learning (ML) modernos proporcionan una
flexibilidad y un poder predictivo aún mayores. La transición de los modelos estadísticos a los de ML
representa un cambio fundamental de un enfoque "basado en supuestos" a uno "basado en datos".
Mientras que los modelos como Poisson o Binomial Negativa requieren que los datos se ajusten a una
distribución teórica predefinida, los modelos de ML no paramétricos pueden aprender la forma de la
relación entre predictores y resultado directamente de los datos. Esto los hace excepcionalmente
robustos en situaciones donde los supuestos teóricos no se cumplen a la perfección o donde existen
interacciones complejas y no lineales entre las variables.
6.1. Métodos de Conjunto (Ensemble Methods)
Los métodos de conjunto combinan las predicciones de múltiples modelos más simples
(llamados "aprendices débiles") para producir una predicción final más robusta y precisa que la de
cualquiera de los modelos individuales.
Random Forests (RF):Desarrollado por el influyente estadísticoLeo Breiman, el algoritmo
de Random Forest construye un gran número de árboles de decisión durante el entrenamiento.31 Cada
árbol se entrena con una muestra aleatoria con reemplazo (bootstrap) de los datos de entrenamiento.
Además, en cada nodo del árbol, solo se considera un subconjunto aleatorio de características para
decidir la división. La predicción final es el promedio (para regresión) de las predicciones de todos los
árboles individuales. Este doble proceso de aleatorización reduce drásticamente la varianza y hace que
el modelo sea muy resistente al sobreajuste. Los RF son excelentes para capturar interacciones
complejas y relaciones no lineales sin necesidad de especificarlas explícitamente. Existen
implementaciones, como el paquete distRforest en R, que permiten construir árboles de regresión
basados en la devianza de Poisson, adaptando directamente el algoritmo a datos de conteo.32
Gradient Boosting Machines (GBM):A diferencia del enfoque paralelo de Random
Forests, Gradient Boosting es un método de conjunto secuencial. Fue desarrollado principalmente por
Jerome H. Friedman.3 4 El proceso comienza con un modelo simple (p. ej., un pequeño árbol de
decisión) y, en cada iteración subsiguiente, se entrena un nuevo modelo para corregir los errores
(residuos) del modelo anterior.34 Cada nuevo árbol se ajusta al gradiente de la función de pérdida con
respecto a las predicciones del conjunto actual. Este enfoque iterativo permite que el modelo se
enfoque progresivamente en las observaciones más difíciles de predecir, lo que a menudo conduce a
una precisión predictiva de vanguardia. Implementaciones modernas y altamente optimizadas como
XGBoost y LightGBM son herramientas estándar en la ciencia de datos competitiva e industrial.35
6.2. Máquinas de Vectores de Soporte para Regresión (SVR)
Las Máquinas de Vectores de Soporte (SVM), originalmente desarrolladas para clasificación,
tienen una contraparte para la regresión conocida como SVR. El principio de SVR es diferente al de los
modelos de mínimos cuadrados. En lugar de minimizar el error para todos los puntos de datos, SVR
intenta encontrar una función que se ajuste a los datos de tal manera que el error para cada punto sea
menor que un margen predefinido, ϵ. Los errores que caen dentro de este "tubo" de ϵ no se penalizan.
Solo los puntos fuera del margen influyen en la decisión final; estos puntos se denominan vectores de
soporte.30
La principal fortaleza de SVR es su capacidad para modelar relaciones no lineales de manera
eficiente a través del"truco del kernel" (kernel trick). Mediante el uso de funciones de kernel
(como el lineal, polinomial o de base radial - RBF), SVR mapea implícitamente los datos de entrada a
un espacio de características de mayor dimensión donde la relación se vuelve lineal, sin incurrir en el
costo computacional de realizar explícitamente esta transformación.30 Esto hace que SVR sea una
herramienta muy potente para capturar patrones complejos.
6.3. Redes Neuronales Artificiales (ANN)
Las Redes Neuronales Artificiales son modelos computacionales inspirados en la estructura y
función de las redes neuronales biológicas. Están compuestas por capas de "neuronas" o nodos
interconectados, donde cada conexión tiene un "peso" asociado.11 El modelo aprende ajustando estos
pesos a través de un proceso llamado retropropagación (backpropagation), que minimiza una función
de costo (la diferencia entre las predicciones y los valores reales).11
La gran ventaja de las ANN, y en particular de las redes de aprendizaje profundo (Deep
Learning) con múltiples capas ocultas, es su capacidad para funcionar comoaproximadores
universales de funciones. Teóricamente, una red neuronal con suficientes neuronas puede aproximar
cualquier función continua con cualquier grado de precisión deseado. Esto las hace extremadamente
flexibles y capaces de modelar relaciones de una complejidad arbitraria, superando a menudo a otros
modelos en tareas de alta dimensionalidad como el reconocimiento de imágenes o el procesamiento del
lenguaje natural.11
Para el problema del conteo por pesaje, se puede proponer una adaptación innovadora: el uso
deRedes Neuronales con Retardo de Tiempo (Time Delay Neural Networks - TDNN).
Aunque originalmente diseñadas para procesar datos dinámicos o secuencias temporales (como el
habla o las señales de pesaje en movimiento - WIM)37, el concepto puede adaptarse a un contexto de
pesaje estático. La "dimensión temporal" podría reinterpretarse de varias maneras:
● Como unas ecuencia de mediciones rápidasdel mismo lote estático, permitiendo que la red
aprenda a filtrar el ruido del sensor y los efectos de estabilización.
● Como un vector de mediciones contextuales (peso, temperatura, vibración, humedad) tomadas
simultáneamente durante la pesada. La estructura de la TDNN podría aprender las relaciones
dinámicas entre estas variables y su impacto en la medición final.
Esta adaptación transformaría el problema de una simple regresión estática a un problema de
modelado dinámico contextual, permitiendo al modelo aprender a corregir activamente los errores
instrumentales y ambientales.37
6.4. Comparativa de Modelos y Justificación de Selección
La selección de un modelo para una aplicación industrial no debe ser arbitraria. Requiere una
evaluación cuidadosa de las fortalezas y debilidades de cada enfoque en el contexto específico del
problema. La siguiente tabla proporciona una comparación estructurada que puede guiar la selección
del modelo para la tesis.
Tabla 1: Comparativa de Modelos de Regresión para el Conteo de Piezas
Modelo
Tipo
Supuestos
Ventajas
Desventajas
Autores/Trab
Clave
para el
para el
ajos Clave
Conteo
Conteo
Regresión
Lineal-Para
Normalidad,
Simplicidad,
Teóricament
Lineal
métrico
Homocedasti
interpretabili
e incorrecto
cidad de
dad, buen
(continuo,
residuos
baseline.
no-negativo),
-
viola
supuestos.
Regresión
No
Normalidad,
Capacidad
Mismas que
Polinomial
Lineal-Para
Homocedasti
para modelar
lineal, alto
-
métrico
cidad de
curvatura
riesgo de
residuos
simple.
sobreajuste y
mala
extrapolació
n.
Regresión
GLM-Param
Distribución
Teóricament
Supuesto de
de Poisson
étrico
de Poisson,
e correcto
equidispersió
Equidispersi
para
n a menudo
ón.
conteos,
violado
predicciones
(sobredisper
no negativas.
sión).
Regresión
GLM-Param
Distribución
Maneja la
Puede ser
Binomial
étrico
Binomial
sobredispersi
menos
Negativa,
ón, más
preciso que
Sobredispers
flexible que
modelos de
ión.
Poisson.
ML si la
Neg.
24
23
relación es
muy
compleja.
Random
Ensemble
Muy pocos
Robusto a
Menos
Leo Breiman
Forest
No
supuestos.
Paramétrico
outliers e
interpretable
interacciones
("caja
, maneja no
negra"),
linealidad,
requiere
bajo riesgo
ajuste de
de
hiperparámet
sobreajuste.
ros.
32
Gradient
Ensemble
Muy pocos
Generalment
Sensible a
Jerome H.
Boosting
No
supuestos.
e la más alta
hiperparámet
Friedman34
precisión
ros, puede
predictiva,
sobreajustar
muy flexible.
si no se
Paramétrico
regulariza.
SVR
Kernel No
Muy pocos
Robusto a
Requiere
Paramétrico
supuestos.
outliers
escalado de
(debido al
característica
margen ϵ),
s, la elección
eficiente con
del kernel y
el truco del
sus
kernel.
parámetros
30
es crítica.
ANN
No
Muy pocos
Aproximado
Requiere
Paramétrico
supuestos.
r universal de
grandes
funciones,
cantidades
máxima
de datos,
flexibilidad
computacion
para
almente
relaciones
intensivo,
complejas.
"caja negra".
11
Esta tabla justifica una trayectoria de investigación que comienza con los modelos más simples
como referencia, progresa hacia los modelos estadísticamente apropiados para validar supuestos clave
como la sobredispersión, y culmina en la implementación de modelos de ML avanzados para maximizar
la precisión predictiva y la robustez.
Parte III: Implementación Práctica y Validación de un Sistema de Conteo Inteligente
La transición de la teoría de modelos a un sistema funcional y fiable en un entorno industrial
requiere un enfoque sistemático que abarca todo el ciclo de vida de los datos, desde su adquisición y
preparación hasta una evaluación rigurosa del rendimiento del modelo. Esta parte detalla el plan de
acción práctico para la implementación, con un énfasis particular en la confiabilidad y la cuantificación
de la incertidumbre, aspectos cruciales para la aceptación y el éxito de una solución de machine learning
en la industria.
Sección 7: El Ciclo de Vida de los Datos para la Implementación del Modelo
Un modelo de machine learning es tan bueno como los datos con los que se entrena. Un
proceso de gestión de datos bien definido es, por lo tanto, la piedra angular de cualquier proyecto de
ciencia de datos exitoso.
7.1. Adquisición y Estructuración de Datos
El primer paso es la creación de un conjunto de datos de alta calidad y debidamente
etiquetado. Esto implica un esfuerzo operativo para recopilar sistemáticamente pares de observaciones:
● Características (Variables Predictoras, X):La característica principal será el peso total
medido de un lote de piezas. Sin embargo, para construir un modelo más robusto, es fundamental
capturar datos contextuales adicionales que puedan influir en la medición. Estos pueden incluir la
temperatura y la humedad ambiente, lecturas de un acelerómetro colocado en la base de la
báscula para medir vibraciones, el identificador del operario que realiza la pesada, el identificador
de la báscula utilizada (si hay varias), y la fecha y hora de la medición.7
● Etiqueta (Variable Objetivo, Y):Para cada conjunto de características medido, se debe
determinar el conteo real y exacto de piezas en el lote. Durante la fase de creación del conjunto de
datos, esto requerirá un conteo manual verificado, que servirá como la "verdad fundamental"
(ground truth) para entrenar y evaluar el modelo.
Este conjunto de datos debe ser lo suficientemente grande y diverso como para capturar la variabilidad
inherente al proceso, incluyendo diferentes lotes de producción, diferentes condiciones ambientales y, si
es posible, diferentes operarios y equipos.
7.2. Preprocesamiento de Datos (Data Preprocessing)
Los datos brutos del mundo real rara vez están listos para ser utilizados directamente en un
modelo de machine learning. El preprocesamiento es el paso crítico de limpiar y transformar los datos
en un formato adecuado, un proceso que a menudo consume la mayor parte del tiempo en un proyecto
de ciencia de datos.38
Limpieza de Datos (Data Cleaning):Este subproceso implica identificar y corregir errores o
inconsistencias. Las tareas clave incluyen el manejo devalores faltantes, que pueden ser el resultado
de errores de sensores o de entrada de datos. Las estrategias van desde la eliminación de las filas con
datos faltantes (si son pocas) hasta laimputación, que consiste en rellenar los valores faltantes con una
estimación estadística como la media, la mediana o la moda de la columna correspondiente.38 También
es crucial identificar ye liminar entradas duplicadaspara evitar sesgos en el modelo.40
M anejo de Outliers:Los outliers o valores atípicos son puntos de datos que se desvían
significativamente del resto. Pueden representar errores de medición genuinos o eventos raros pero
legítimos (p. ej., un lote que contiene piezas defectuosas mucho más pesadas). La detección se puede
realizar visualmente (con gráficos de caja o histogramas) o estadísticamente (p. ej., utilizando el rango
intercuartílico - IQR).39 El tratamiento de los outliers depende de su causa: si son errores, deben
corregirse o eliminarse; si son eventos reales, se pueden utilizar transformaciones de datos (como la
logarítmica) o modelos que son inherentemente más robustos a su influencia, como los basados en
árboles de decisión o SVR.39
Ingeniería de Características (Feature Engineering):Este es el proceso creativo de utilizar
el conocimiento del dominio para crear nuevas características a partir de las existentes, con el objetivo
de mejorar el rendimiento del modelo. Por ejemplo, en lugar de utilizar una única lectura de peso, se
podrían tomar cinco lecturas rápidas y calcular su media y su desviación estándar. La media sería una
medida de peso más robusta al ruido, mientras que la desviación estándar podría servir como una
característica proxy para la vibración o la inestabilidad de la balanza en ese momento.
Escalado de Características (Feature Scaling):Muchos algoritmos de ML, especialmente
los que se basan en medidas de distancia como SVR o los que utilizan descenso de gradiente como las
redes neuronales, funcionan mejor cuando las características numéricas están en una escala similar.
Técnicas como lanormalización(escalar los datos a un rango de ) o lae standarización(transformar
los datos para que tengan una media de 0 y una desviación estándar de 1) son pasos estándar para
asegurar una convergencia más rápida y un mejor rendimiento del modelo.38
El preprocesamiento no es una mera formalidad técnica; es una forma de codificar el
conocimiento del dominio físico y operativo en el modelo. Al medir y crear características que
representan fuentes de perturbación (temperatura, vibración), se transforma un problema de modelado
simple (Peso→Cantidad) en uno más sofisticado y robusto: f(Peso,Perturbaciones)→Cantidad. Esto
permite que el modelo aprenda a descontar activamente el efecto de estas perturbaciones, lo que
constituye una contribución metodológica clave.
7.3. Estrategia de Entrenamiento y Validación
Para construir un modelo que generalice bien a datos no vistos, es crucial dividir el conjunto de
datos en al menos tres subconjuntos38:
● Conjunto de Entrenamiento (Training Set):La mayor parte de los datos, utilizada para que el
modelo aprenda los patrones y ajuste sus parámetros.
● Conjunto de Validación (Validation Set):Utilizado durante el entrenamiento para ajustar los
hiperparámetros del modelo (p. ej., el número de árboles en un Random Forest o la tasa de
aprendizaje en una red neuronal) y para tomar decisiones sobre la arquitectura del modelo.
● Conjunto de Prueba (Test Set):Mantenido completamente al margen durante todo el proceso
de entrenamiento y validación. Se utiliza una sola vez al final para evaluar el rendimiento del
modelo final en datos completamente nuevos, proporcionando una estimación imparcial de su
rendimiento en el mundo real.
Para obtener una estimación aún más robusta del rendimiento y reducir la dependencia de una
única división de datos, se utiliza lavalidación cruzada (cross-validation). La técnica más común,
k-fold cross-validation, divide el conjunto de entrenamiento en k pliegues (folds), entrena el modelo k
veces utilizando k-1 pliegues para entrenar y el pliegue restante para validar, y luego promedia los
resultados. Este método proporciona una evaluación de rendimiento más estable y es el estándar de oro
para el ajuste de hiperparámetros.42
Sección 8: Evaluación del Rendimiento y Confiabilidad Estadística del Modelo
Una vez entrenado un modelo, es fundamental evaluar su rendimiento de manera cuantitativa y
rigurosa. Para una aplicación industrial, la evaluación va más allá de una simple métrica de error; debe
abarcar la confiabilidad, la robustez y una comprensión clara de la incertidumbre asociada a sus
predicciones.
8.1. Métricas de Evaluación para Modelos de Regresión
Existen varias métricas estándar para evaluar el rendimiento de los modelos de regresión, cada
una con sus propias fortalezas y debilidades. Es aconsejable utilizar un conjunto de ellas para obtener
una visión completa del rendimiento del modelo.
Tabla 2: Métricas de Evaluación para Modelos de Regresión y Conteo
Métrica
Fórmula
Interpretació
Ventajas
Desventajas
n
Contexto de
Aplicación
en Conteo
M AE
$\frac{1}{n}
y_i -
(Mean
\sum_{i=1}^
\hat{y}_i
Absolute
{n}
$
Error)
Error
Intuitiva, fácil
promedio
de
absoluto en
interpretar,
el número de
robusta a
piezas.
outliers.
M SE(Mean
n1∑i=1n(yi−
Error
Penaliza
No está en
Útil durante
Squared
y^i)2
cuadrático
fuertemente
las unidades
el
medio.
los errores
originales,
entrenamient
grandes.
sensible a
o del modelo
outliers.
como
Error)
función de
pérdida.
RMSE
n1∑i=1n(yi−
Raíz del
En las
Más sensible
Bueno para
(Root Mean
y^i)2
error
unidades
a outliers que
entender la
Squared
cuadrático
originales,
el MAE.
magnitud
Error)
medio, en
sensible a
típica del
número de
errores
error, con
piezas.
grandes.
énfasis en los
errores
grandes.
R²
1−∑(yi−yˉ)2
Proporción
Escala
Puede ser
Útil para
(R-cuadrado
∑(yi−y^i)2
de la
relativa (0 a
engañosame
comparar el
varianza
1), popular y
nte alto,
poder
explicada
fácil de
aumenta con
explicativo
por el
entender.
más
general de
predictores.
diferentes
)
modelo.
modelos.
M APE
$\frac{100%
\frac{y_i -
(Mean
}{n}\sum_{i
Absolute
=1}^{n}\left
Percentage
Error)
$
Error
Relativo al
\hat{y}_i}{y
porcentual
tamaño del
_i}\right
absoluto
conteo, útil
medio.
para
comparar
errores en
lotes de
diferentes
tamaños.
La comparación de estas métricas proporciona un diagnóstico más profundo. Por ejemplo, si el
RMSE es significativamente mayor que el MAE, indica que el modelo está cometiendo algunos errores
muy grandes, que son magnificados por la operación de cuadratura en el RMSE.43
8.2. Confiabilidad y Robustez del Modelo de ML
Laconfiabilidad de un modelose define como su capacidad para generar resultados
consistentes, precisos y fiables a lo largo del tiempo, incluso cuando se enfrenta a datos nuevos o a
cambios sutiles en el entorno operativo.41 La confiabilidad de los datos de entrada es un prerrequisito:
deben ser válidos (formateados correctamente), completos y únicos.44
Las principales amenazas para la confiabilidad del modelo incluyen:
● Sobreajuste (Overfitting):El modelo aprende el ruido de los datos de entrenamiento en lugar de
la señal subyacente. Se desempeña bien en los datos de entrenamiento pero mal en los datos de
prueba. Se combate con técnicas de regularización, más datos o modelos más simples.41
● Subajuste (Underfitting):El modelo es demasiado simple para capturar la complejidad de los
datos. Se desempeña mal tanto en el entrenamiento como en la prueba.41
● Deriva de los Datos (Data Drift):La distribución estadística de los datos de producción
cambia con el tiempo (p. ej., un nuevo proveedor de piezas con una distribución de peso
diferente), haciendo que el rendimiento del modelo se degrade. Requiere monitoreo continuo y
reentrenamiento periódico del modelo.41
● Sesgos (Bias):Si los datos de entrenamiento no son representativos de la población real, el
modelo aprenderá sesgos que pueden llevar a un rendimiento injusto o incorrecto para ciertos
subgrupos.41
8.3. Cuantificación de la Incertidumbre en las Predicciones
Para una aplicación industrial crítica, una predicción puntual (p. ej., "el conteo es 542 piezas")
es a menudo insuficiente. Es igualmente importante saber cuán seguro está el modelo de esa predicción.
Lacuantificación de la incertidumbre (UQ)busca responder a esta pregunta, proporcionando un
rango de valores probables en lugar de un solo número.46
Se distinguen dos tipos principales de incertidumbre48:
● Incertidumbre Aleatoria (Aleatoric Uncertainty):Es la incertidumbre inherente al proceso de
generación de datos, el "ruido" que no se puede reducir incluso con más datos (p. ej., la
variabilidad natural del peso de las piezas).
● Incertidumbre Epistémica (Epistemic Uncertainty):Es la incertidumbre debida a las
limitaciones del propio modelo. Puede reducirse con más datos o con un modelo mejor.
Existen varias técnicas para estimar la incertidumbre y generarintervalos de predicción. Un
enfoque práctico es utilizar la propia naturaleza de losmodelos de conjunto. La dispersión o el
desacuerdo entre las predicciones de los modelos individuales dentro del conjunto (p. ej., los diferentes
árboles en un Random Forest) puede usarse como una medida de la incertidumbre del modelo.46 Si
todos los árboles predicen un conteo muy similar, la confianza es alta. Si las predicciones varían
ampliamente, la confianza es baja.
La verdadera ventaja de un sistema industrial no reside únicamente en una métrica de error
baja, sino en la combinación de un alto rendimiento predictivo con una cuantificación honesta de la
incertidumbre. Sabercuándo el modelo no está seguroes tan valioso como obtener una predicción
correcta. Un modelo que predice "542 piezas con un intervalo de predicción del 95% de " es mucho
más útil que uno que simplemente predice "542". Si, para otro lote, el modelo predice "1020 piezas con
un intervalo de ", el amplio intervalo es una señal clara de baja confianza. Esto puede activar un
protocolo de negocio, como una alerta para una verificación manual. Este enfoque permite el diseño de
un sistema híbrido humano-máquina, donde el modelo de ML automatiza la gran mayoría de los
conteos de alta confianza y deriva eficientemente los casos de alta incertidumbre a la atención humana,
optimizando así la eficiencia sin sacrificar la fiabilidad en los casos críticos.
Sección 9: Aplicaciones de Vanguardia y Estudios de Caso Relevantes
Para contextualizar la investigación y demostrar su relevancia industrial, es útil examinar cómo el
machine learning se está aplicando en la logística y en dominios análogos que enfrentan problemas de
conteo similares. Estos ejemplos no solo validan el enfoque, sino que también pueden proporcionar
inspiración para soluciones metodológicas novedosas.
9.1. ML en la Logística y Gestión de Almacenes
El machine learning está transformando la logística y la gestión de la cadena de suministro. Las
empresas utilizan modelos de ML para laprevisión de la demanda, analizando datos históricos de
ventas y factores externos para anticipar las necesidades futuras de inventario con mayor precisión.49 En
lagestión de inventarios, los algoritmos pueden optimizar los niveles de stock y los puntos de pedido
para minimizar los costes de almacenamiento y evitar roturas de stock.49
Más directamente relacionado con el conteo, existen estudios de caso sobre la automatización
de inventarios en almacenes. Por ejemplo, se han desarrollado sistemas que utilizanvisión por
computadora y robots autónomospara contar palets, logrando una precisión del 99% y reduciendo
significativamente los costes de mano de obra y los errores humanos.50 Otras soluciones utilizan IA para
optimizar elconteo cíclico de inventario, donde los modelos predicen qué ubicaciones o artículos
tienen una mayor probabilidad de tener discrepancias, dirigiendo los esfuerzos de conteo manual de
manera más eficiente.51 Aunque estos casos no se basanen el pesaje, demuestran el valor probado del
ML para resolver problemas de conteo en entornos de almacén, validando la relevancia y el potencial
de la tesis propuesta.
9.2. Análogos en Otros Dominios
El problema de "contar objetos pequeños y numerosos por un medio indirecto" no es exclusivo
de los almacenes industriales. Enmarcar el problema de esta manera más general permite recurrir a una
literatura mucho más amplia en busca de técnicas y soluciones.
Un ejemplo notable esLarvia, una aplicación que utiliza Deep Learning (un subcampo de las
redes neuronales) para contar y analizar larvas de camarón a partir de imágenes.52 El conteo manual de
larvas es un proceso extremadamente lento, tedioso y propenso a errores, análogo al conteo manual de
tornillos o componentes electrónicos. Larvia automatiza este proceso, proporcionando no solo un
conteo en segundos, sino también un análisis de la distribución de tamaños y pesos, demostrando cómo
el ML puede extraer información rica más allá de un simple número.52
La investigación académica también ha explorado enfoques multimodales. Un estudio propuso
un método que combina elpesaje con el procesamiento de imágenespara mejorar la precisión del
conteo de objetos. El sistema utiliza el peso para una estimación inicial y luego refina esta estimación
utilizando características extraídas de una imagen, como el área total y el perímetro de los objetos,
fusionando las estimaciones a través de lógica difusa.53 Otro trabajo conceptualmente interesante utiliza
Reinforcement Learningpara el conteo de multitudes en imágenes, formulando el problema
como un proceso de "pesaje" secuencial. Un agente aprende a "añadir pesos" de una caja de pesos
predefinida a una balanza virtual hasta que se equilibra con el "peso" de la multitud en la imagen, una
analogía creativa que podría inspirar nuevos enfoques algorítmicos.54
Estos ejemplos de dominios análogos revelan una verdad más profunda: el problema del
"conteo de piezas por peso" es una instancia de una clase más amplia de problemas de "estimación de
cantidad a partir de datos de sensores". El sensor puede ser una celda de carga (peso), una cámara
(imagen) o un conjunto de sensores dinámicos. Todos estos problemas comparten desafíos comunes
como el ruido en los sensores, la variabilidad en los objetos a contar y la necesidad de modelos
robustos. Por lo tanto, una técnica exitosa en un dominio, como el uso de Redes Neuronales
Convolucionales (CNN) para analizar patrones espaciales en imágenes, podría inspirar una nueva
arquitectura para el problema del pesaje. Por ejemplo, se podría transformar una secuencia de
mediciones de peso en un "espectrograma" 1D y aplicar una CNN 1D para extraer características
robustas al ruido antes de la predicción final. Esta transferencia de conocimiento entre dominios es una
característica de la investigación de alto nivel y una vía prometedora para la innovación en la tesis.
Parte IV: Síntesis, Autores Clave y Direcciones Futuras
Esta parte final consolida el conocimiento presentado en las secciones anteriores y lo traduce en
una guía estratégica para el desarrollo de la tesis. Se identificarán los pensadores, trabajos y grupos de
investigación clave que forman el canon de la literatura relevante, y se ofrecerán recomendaciones
concretas para el diseño de la investigación, destacando las oportunidades para realizar una
contribución original y significativa al campo.
Sección 10: Autores, Grupos de Investigación y Trabajos Fundamentales
Una tesis rigurosa se construye sobre los hombros de gigantes. La siguiente es una lista curada
de autores, textos y grupos de investigación cuyo trabajo es fundamental para los dominios de la
inteligencia artificial, el machine learning, sus aplicaciones industriales y la metrología de la IA.
10.1. Fundamentos de IA y Machine Learning
● Stuart Russell y Peter Norvig:Son los autores de" Inteligencia Artificial: Un Enfoque
Moderno", considerado universalmente como el texto definitivo y canónico en el campo de la IA.
Su obra proporciona el marco teórico completo sobre el que se construyen todas las aplicaciones
modernas.55
● Aurélien Géron:Su libro" Aprende Machine Learning con Scikit-Learn, Keras y
TensorFlow"es una guía práctica inmensamente influyente que ha formado a una generación de
científicos de datos. Es esencial para comprender la implementación práctica de los algoritmos.55
● Andreas C. Müller y Sarah Guido:Autores de" Introduction to Machine Learning with
Python", otro texto fundamental que se centra en la aplicación intuitiva y práctica de los modelos
de ML utilizando la biblioteca Scikit-Learn.55
● Ian H. Witten, Eibe Frank, Mark A. Hall:Su obra" Data Mining: Practical Machine
Learning Tools and Techniques"es un clásico que ofrece una introducción accesible pero
profunda a los conceptos de minería de datos y machine learning, junto con consejos prácticos
para su aplicación.55
10.2. Pioneros de Modelos Específicos
● Leo Breiman:Un estadístico de la Universidad de California, Berkeley, es ampliamente
reconocido por su trabajo fundamental en árboles de decisión y, sobre todo, por ser el creador del
algoritmoRandom Forests, uno de los métodos de conjunto más robustos y utilizados.32
● Jerome H. Friedman:Un estadístico de la Universidad de Stanford, es uno de los inventores
clave del algoritmo deGradient Boosting, así como de otras técnicas como MARS y el análisis
discriminante regularizado. Su trabajo sentó las bases para los modelos predictivos de mayor
rendimiento en la actualidad.34
● Tom Dietterich:Considerado uno de los "padres" del Machine Learning, es un investigador
pionero en el campo de los métodos de conjunto (ensemble methods) y la inteligencia artificial
robusta. Su perspectiva sobre la interacción persona-máquina y la aplicación industrial es de gran
relevancia.57
10.3. Autores en Aplicaciones Industriales y Metrología de IA
● M . Bertolini et al.:Autores de una revisión sistemática y exhaustiva sobre las aplicaciones del
machine learning en entornos industriales, proporcionando un mapa completo del estado del arte
en el campo.58
● Daniele Mazzei y Reshawn Ramjattan:Realizaron una revisión sistemática sobre el uso de
ML en el contexto de la Industria 4.0, utilizando técnicas de Deep Learning para analizar la
literatura académica y extraer temas clave.59
● AI Measurement Science & Engineering (AIMSEC) Cooperative Research Center:Una
colaboración entre laUniversidad Carnegie Mellon (CMU)y elInstituto Nacional de
Estándares y Tecnología (NIST)de EE. UU. Este grupo de investigación se encuentra en la
vanguardia de la creación de una ciencia de la medición rigurosa para los sistemas de IA
modernos, abordando la evaluación, el testeo y la fiabilidad de los modelos de ML. Su trabajo es
directamente relevante para establecer la confiabilidad estadística de la solución propuesta en la
tesis.60
10.4. Trabajos de Tesis Relevantes
Aunque la aplicación directa de ML al conteo por pesaje es un área de investigación
emergente, el análisis de tesis previas sobre la optimización de procesos en almacenes es crucial.
Trabajos que abordan la optimización de la gestión de almacenes, la reducción de errores en el
inventario mediante metodologías como 5S o el análisis de KPI, y la optimización logística en general,
proporcionan el contexto operativo y los desafíos del mundo real que la solución de ML debe
abordar.61 Estos trabajos ayudan a enmarcar la contribución novedosa de un enfoque de ciencia de
datos frente a los métodos de ingeniería industrial más tradicionales.
Sección 11: Recomendaciones y Trayectoria de Investigación para el Desarrollo de la Tesis
Basado en el análisis exhaustivo del estado del arte, se propone la siguiente trayectoria de
investigación estructurada para el desarrollo de la tesis, diseñada para asegurar el rigor metodológico y
maximizar el potencial de una contribución original.
11.1. Propuesta de Enfoque Metodológico
Se recomienda un enfoque por etapas, donde cada etapa construye sobre la anterior,
permitiendo una comparación clara y una justificación sólida de las decisiones tomadas:
1. Establecer una Línea de Base (Baseline):El primer paso experimental debe ser la
implementación y evaluación del método APW tradicional y de los modelos de regresión lineal
simple y polinomial. Esto cuantificará el rendimiento de los métodos actuales y teóricamente más
simples, estableciendo un punto de referencia claro contra el cual se medirán todas las mejoras
posteriores.
2. M odelado Estadístico Riguroso:A continuación, se deben implementar los modelos de
Regresión de Poisson y Binomial Negativa. Un paso crítico en esta fase es realizar pruebas
estadísticas formales de sobredispersión en los datos de conteo. El resultado de esta prueba
proporcionará una justificación basada en datos para la elección entre los dos modelos y ofrecerá
una primera visión de la estructura de variabilidad del proceso.
3. M odelado Avanzado con ML:En esta fase, se deben implementar, ajustar y evaluar al menos
dos modelos de machine learning de alto rendimiento, como Gradient Boosting (utilizando una
biblioteca como XGBoost) y una Red Neuronal Artificial. La comparación de su rendimiento
(utilizando las métricas de la Sección 8.1) con los modelos de las etapas 1 y 2 demostrará
cuantitativamente el valor añadido del enfoque de ML.
4. Cuantificación de la Incertidumbre:Para el modelo de ML que demuestre el mejor
rendimiento, el paso final y más avanzado es implementar un método para generar intervalos de
predicción, no solo predicciones puntuales. Técnicas como el bootstrapping, el dropout de Monte
Carlo para redes neuronales, o el uso de la varianza de las predicciones en un modelo de
conjunto, pueden ser exploradas para cuantificar la confianza del modelo en cada predicción
individual.
11.2. Identificación de Contribuciones Novedosas Potenciales
La tesis tiene el potencial de realizar contribuciones originales en varias áreas:
● Contribución 1 (Metodológica):La adaptación de arquitecturas de modelos de dominios
análogos al problema del pesaje estático. Esto podría incluir el diseño de una Red Neuronal con
Retardo de Tiempo (TDNN) o una Red Neuronal Convolucional 1D (CNN 1D) que procese no
solo una única lectura de peso, sino una secuencia de mediciones o un vector de datos de sensores
contextuales (peso, temperatura, vibración). Esto representaría un nuevo enfoque para la
corrección de errores de medición en tiempo real.
● Contribución 2 (Aplicada):El diseño y la propuesta de uns istema de decisión híbrido
humano-máquina. En este sistema, el modelo de ML no solo predice el conteo, sino que también
genera una puntuación de confianza o un intervalo de predicción. Las predicciones de alta
confianza (intervalos estrechos) se aceptan automáticamente, mientras que las de baja confianza
(intervalos amplios) se marcan para una revisión humana. Este enfoque pragmático optimiza la
eficiencia de la automatización sin sacrificar la fiabilidad en los casos más difíciles o ambiguos, lo
que representa un alto valor para la industria.
● Contribución 3 (Diagnóstica):Utilizar las propiedades internas del modelo de ML como una
herramienta de diagnóstico para el proceso físico. Por ejemplo, el análisis de la importancia de las
características en un modelo de Random Forest podría revelar que la vibración de una máquina
cercana es un predictor sorprendentemente importante de los errores de conteo. De manera
similar, el parámetro de sobredispersión de un modelo Binomial Negativo podría ser monitoreado
a lo largo del tiempo como un KPI de la consistencia del proceso de fabricación de las piezas.
Esta contribución cierra el ciclo, utilizando el modelo no solo para predecir, sino para generar
conocimiento y guiar la mejora continua del proceso físico.
11.3. Conclusión Final
La implementación exitosa de un modelo de machine learning para mejorar la confiabilidad del
conteo de piezas por pesaje es un desafío que trasciende la simple aplicación de un algoritmo. Requiere
una síntesis disciplinada de principios de metrología, un control estadístico riguroso del proceso de
medición, una selección de modelo teóricamente justificada y una validación que se centre no solo en la
exactitud, sino también en la confiabilidad y la cuantificación de la incertidumbre. La trayectoria de
investigación propuesta en este informe proporciona un camino claro para abordar estos desafíos. Al
hacerlo, la tesis resultante tiene el potencial de hacer una contribución significativa y práctica, cerrando
la brecha entre los principios establecidos del control de calidad industrial y las capacidades
transformadoras de la ciencia de datos moderna.
Obras citadas
1. Contaje - Espinosa Paez, fecha de acceso: septiembre 10, 2025,
https://espinosapaez.com/wp-content/uploads/2020/03/WP_GWP_Counting_BestPractices_ES
_130130-1.pdf
2. El conteo más confiable, pesaje de piezas - VerifID |, fecha de acceso: septiembre 10, 2025,
https://www.verifid.net/blog/articulo/el-conteo-mas-confiable-pesaje-de-piezas140907
3. PORQUE NECESITA UNA BALANZA DE CONTEO DE PIEZAS PARA HACER SU
INVENTARIO - Balanças Marques - Fabricación por más de 50 años., fecha de acceso:
septiembre 10, 2025,
https://www.balancasmarques.pt/blog/porque-necesita-una-balanza-de-conteo-de-piezas-para-h
acer-su-inventario/196?sitelang=es_ES
4. Balanzas cuenta piezas :Aspectos que debes conocer - Puchades Gimeno, fecha de acceso:
septiembre 10, 2025,
https://www.puchadesgimeno.com/noticias/aspectos-balanzas-cuenta-piezas/
5. Pesaje en procesos industriales | Sensor de peso | Reparación de basculas - Byasa, fecha de
acceso: septiembre 10, 2025,https://www.byasa.com.mx/pesaje-en-procesos-industriales/
6. ERRORES EN EL ANÁLISIS CUANTITATIVO - WEB DEL PROFESOR, fecha de acceso:
septiembre 10, 2025,
http://www.webdelprofesor.ula.ve/ingenieria/lauraitm/wp-content/uploads/2017/01/02_Errores_E
xperimentales.pdf
7. Especificaciones Técnicas de Gravimetría - Instituto Geográfico Agustín Codazzi, fecha de
acceso: septiembre 10, 2025,
https://www.igac.gov.co/sites/default/files/listadomaestro/in-geo-pc-01-01_especificaciones_tecni
cas_de_gravimetria.pdf
8. Mejoras de la calidad en el pesaje con tolerancia y seguridad - Espinosa Paez, fecha de acceso:
septiembre 10, 2025,
https://espinosapaez.com/wp-content/uploads/2020/03/Tolerancia-y-Seguridad.pdf
9. Detección de fuentes de error y minimización de su efecto en las determinaciones gravimétricas
de materia particulada, fecha de acceso: septiembre 10, 2025,
https://www.insst.es/documents/94886/362212/Detecci%C3%B3n+de+fuentes+de+error+y+mi
nimizaci%C3%B3n+de+su+efecto+en+las+determinaciones+gravim%C3%A9tricas+de+materi
a+particulada+%282009%29.pdf/6139d84a-4d12-4f05-bf53-533f5059a9b5?t=16850967544
28
10.Redalyc.Evaluación del error debido a la evaporación en el método gravimétrico de calibración
de micro pipetas, fecha de acceso: septiembre 10, 2025,
https://www.redalyc.org/pdf/6061/606166693003.pdf
11.What is a Neural Network? | IBM, fecha de acceso: septiembre 10, 2025,
https://www.ibm.com/think/topics/neural-networks
12.Redalyc.Aplicación del control estadístico de procesos (CEP) en el ..., fecha de acceso:
septiembre 10, 2025,https://www.redalyc.org/pdf/4455/445543786011.pdf
13.¿Qué es el control estadístico de procesos SPC? ¿Cómo mejoran la ..., fecha de acceso:
septiembre 10, 2025,
https://www.tcmetrologia.com/blog/cual-es-el-objetivo-del-spc-en-la-industria/
14.Control estadístico de procesos - Puchades Gimeno, fecha de acceso: septiembre 10, 2025,
https://www.puchadesgimeno.com/control-estadistico-procesos/
15.Control Estadístico de Procesos: qué es y beneficios - Mapex, fecha de acceso: septiembre 10,
2025,https://mapex.io/news/control-estadistico-de-procesos-definicion-y-beneficios/
16.¿Qué es el control de calidad estadístico? - Checklist Fácil, fecha de acceso: septiembre 10,
2025,https://es.checklistfacil.com/blog/control-calidad-estadistico/
17.El Control Estadístico de la Calidad en los procesos de producción - Tests and Trials, fecha de
acceso: septiembre 10, 2025,
https://www.testsandtrials.com/blog/control-estadistico-de-la-calidad/
18.Reducción de las desviaciones de peso en la producción industrial de galletas, fecha de acceso:
septiembre 10, 2025,
https://kaizen.com/es/insights-es/reduccion-desviaciones-peso-produccion-industrial-galletas-es/
19.Regresión lineal - Wikipedia, la enciclopedia libre, fecha de acceso: septiembre 10, 2025,
https://es.wikipedia.org/wiki/Regresi%C3%B3n_lineal
20.6 Linear Regression – Interpretable Machine Learning, fecha de acceso: septiembre 10, 2025,
https://christophm.github.io/interpretable-ml-book/limo.html
21.Linear regression - Wikipedia, fecha de acceso: septiembre 10, 2025,
https://en.wikipedia.org/wiki/Linear_regression
22.Linear Regression in Machine learning - GeeksforGeeks, fecha de acceso: septiembre 10, 2025,
https://www.geeksforgeeks.org/machine-learning/ml-linear-regression/
23.Regression Models for Count Data - The Analysis Factor, fecha de acceso: septiembre 10,
2025,https://www.theanalysisfactor.com/regression-models-for-count-data/
24.Tutorial on Using Regression Models with Count Outcomes ... - ERIC, fecha de acceso:
septiembre 10, 2025,https://files.eric.ed.gov/fulltext/EJ1090064.pdf
25.Rev. 4/25/2007 © 2005 por StatPoint, Inc. Regresión Polinomial, fecha de acceso: septiembre
10, 2025,
https://www.statgraphics.net/wp-content/uploads/2011/12/tutoriales/Regresion%20Polinomial.pd
f
26.9.7 - Polynomial Regression | STAT 501, fecha de acceso: septiembre 10, 2025,
https://online.stat.psu.edu/stat501/lesson/9/9.7
27.Understanding Polynomial Regression Model - Analytics Vidhya, fecha de acceso: septiembre
10, 2025,
https://www.analyticsvidhya.com/blog/2021/10/understanding-polynomial-regression-model/
28.“Mastering Polynomial Regression for Non-Linear Data” | by Gayatri Nikam - Medium, fecha de
acceso: septiembre 10, 2025,
https://medium.com/@gayatrinikam5103/mastering-polynomial-regression-for-non-linear-data-2f
ef8b42a397
29.Count Data Regression Analysis: Concepts, Overdispersion Detection, Zero-inflation
Identification, and Applications with R - UMass ScholarWorks, fecha de acceso: septiembre 10,
2025,
https://scholarworks.umass.edu/bitstreams/6a069766-d8c9-4f79-a36b-df49bdc186f9/downloa
d
30.Machine Learning Episode 12 — SVR, ARIMA, and Poisson Regression - Medium, fecha de
acceso: septiembre 10, 2025,
https://medium.com/@paushi213/machine-learning-episode-12-svr-arima-and-poisson-regressio
n-93093844329e
31.The Random Forests statistical technique: An examination of its value for the study of reading -
PMC, fecha de acceso: septiembre 10, 2025,
https://pmc.ncbi.nlm.nih.gov/articles/PMC4710485/
32.rfPoisson in fpechon/rfCountData: Random Forests for Count Data - rdrr.io, fecha de acceso:
septiembre 10, 2025,https://rdrr.io/github/fpechon/rfCountData/man/rfPoisson.html
33.Distribution-based Random Forest • distRforest - Roel Henckaerts, fecha de acceso: septiembre
10, 2025,https://henckr.github.io/distRforest/
34.Gradient boosting - Wikipedia, fecha de acceso: septiembre 10, 2025,
https://en.wikipedia.org/wiki/Gradient_boosting
35.What is Gradient Boosting? | IBM, fecha de acceso: septiembre 10, 2025,
https://www.ibm.com/think/topics/gradient-boosting
36.Common statistical concepts in the supervised Machine Learning arena - PMC, fecha de acceso:
septiembre 10, 2025,https://pmc.ncbi.nlm.nih.gov/articles/PMC9949554/
37.Improving measurements accuracy in weight-in ... - CEUR-WS.org, fecha de acceso: septiembre
10, 2025,https://ceur-ws.org/Vol-3790/paper42.pdf
38.Data Preprocessing in Machine Learning - Kaggle, fecha de acceso: septiembre 10, 2025,
https://www.kaggle.com/code/alirezahasannejad/data-preprocessing-in-machine-learning
39.What Is Data Preprocessing for Machine Learning? | Pure Storage, fecha de acceso: septiembre
10, 2025,https://www.purestorage.com/uk/knowledge/what-is-data-preprocessing.html
40.Data Preprocessing in Data Mining - GeeksforGeeks, fecha de acceso: septiembre 10, 2025,
https://www.geeksforgeeks.org/dbms/data-preprocessing-in-data-mining/
41.What Is Model Reliability and Why Does It Matter? - Pecan AI, fecha de acceso: septiembre
10, 2025,https://www.pecan.ai/blog/what-is-model-reliability-and-why-does-it-matter/
42.What is Variance reduction | AI Basics - Ai Online Course, fecha de acceso: septiembre 10,
2025,https://www.aionlinecourse.com/ai-basics/variance-reduction
43.What are the Best Metrics for the Regression Model? - Deepchecks, fecha de acceso:
septiembre 10, 2025,
https://www.deepchecks.com/question/what-are-the-best-metrics-for-the-regression-model/
44.¿Qué es la confiabilidad de los datos? - IBM, fecha de acceso: septiembre 10, 2025,
https://www.ibm.com/mx-es/think/topics/data-reliability
45.www.pecan.ai, fecha de acceso: septiembre 10, 2025,
https://www.pecan.ai/blog/what-is-model-reliability-and-why-does-it-matter/#:~:text=A%20relia
ble%20machine%20learning%20model,of%20course%2C%20a%20major%20criterion.
46.Uncertainty Quantification | IBM, fecha de acceso: septiembre 10, 2025,
https://www.ibm.com/think/topics/uncertainty-quantification
47.Uncertainty Quantification for Machine Learning - OSTI, fecha de acceso: septiembre 10, 2025,
https://www.osti.gov/servlets/purl/1733262
48.[R] Sources of Uncertainty in Machine Learning -- A Statisticians' View : r/statistics - Reddit,
fecha de acceso: septiembre 10, 2025,
https://www.reddit.com/r/statistics/comments/19amqnd/r_sources_of_uncertainty_in_machine_le
arning_a/
49.Machine learning en logística: ¿Vale la pena invertir? - Maplink, fecha de acceso: septiembre 10,
2025,https://maplink.global/blog/es/machine-learning-logistica/
50.Case Studies : Warehouse Automation - predictml.ai, fecha de acceso: septiembre 10, 2025,
https://predictml.ai/ai-warehouse-automation-case-study/
51.AI-Powered Cycle Counting Success Story - CBC, fecha de acceso: septiembre 10, 2025,
https://cbcinc.ai/case-study/ai-in-cycle-counting/
52.Larvia una app de análisis de larva de camarón que usa Deep Learning | fAIrLAC, fecha de
acceso: septiembre 10, 2025,
https://fairlac.iadb.org/larvia-una-app-de-analisis-de-larva-de-camaron-que-usa-deep-learning
53.(PDF) Determination of the Number of Objects through Weight and ..., fecha de acceso:
septiembre 10, 2025,
https://www.researchgate.net/publication/338477699_Determination_of_the_Number_of_Objec
ts_through_Weight_and_Image_Processing
54.Weighing Counts: Sequential Crowd Counting by Reinforcement Learning | Request PDF -
ResearchGate, fecha de acceso: septiembre 10, 2025,
https://www.researchgate.net/publication/346740692_Weighing_Counts_Sequential_Crowd_Co
unting_by_Reinforcement_Learning
55.Los 15 mejores libros sobre machine learning para leer en 2023 - DataCamp, fecha de acceso:
septiembre 10, 2025,
https://www.datacamp.com/es/blog/the-15-best-data-machine-learning-books-to-read-in-2022
56.Machine learning en anestesia. Avances de hoy para la anestesia del mañana, fecha de acceso:
septiembre 10, 2025,https://revistachilenadeanestesia.cl/revchilanestv52n6-04/
57.Tom Dietterich, padre del 'machine learning': "El Data in Motion se moverá en lugar de nosotros"
- Atlas Tecnológico, fecha de acceso: septiembre 10, 2025,
https://atlastecnologico.com/tom-dietterich-padre-del-machine-learning-el-data-emotion-se-mov
era-en-lugar-de-nosotros/
58.Machine Learning for industrial applications: A comprehensive literature review, fecha de acceso:
septiembre 10, 2025,
https://www.semanticscholar.org/paper/Machine-Learning-for-industrial-applications%3A-A-Ber
tolini-Mezzogori/aea01e42dc0df177b7b4580fbf920a043b2b4417
59.Machine Learning for Industry 4.0: A Systematic Review Using Deep Learning-Based Topic
Modelling - PMC, fecha de acceso: septiembre 10, 2025,
https://pmc.ncbi.nlm.nih.gov/articles/PMC9697770/
60.AI Measurement Science & Engineering (AIMSEC) - CMU-NIST Cooperative Research
Center, fecha de acceso: septiembre 10, 2025,https://www.cmu.edu/aimsec/research/index.html
61.Optimización de la asignación de mercancías en un centro de distribución usando un modelo
multiobjetivo para la minimización del - Repositorio Institucional - UNAL, fecha de acceso:
septiembre 10, 2025,
https://repositorio.unal.edu.co/bitstreams/477ab085-b01b-4ca6-83e3-589d0936f367/download
62.propuesta de mejora de la gestion de almacenes para la optimizacion de kpi´s en la empresa
latinoamericana de envases eirl - CORE, fecha de acceso: septiembre 10, 2025,
https://core.ac.uk/download/pdf/198121157.pdf
63.FACULTAD DE CIENCIAS EMPRESARIALES OPTIMIZACIÓN DE LA GESTIÓN DE
ALMACENES BASADO EN EL MODELO DE LAS 5S, QUE GENERA ORDEN Y C -
Repositorio Institucional USS - Universidad Señor de Sipán, fecha de acceso: septiembre 10,
2025,
https://repositorio.uss.edu.pe/bitstream/handle/20.500.12802/4213/Farro%20Ramon%20-%20
Huancas%20Caicedo.pdf?sequence=1&isAllowed=y
64.Propuesta: optimización logística en un almacén de repuestos Proposal: logistics optimization in a
spare parts warehouse - Dialnet, fecha de acceso: septiembre 10, 2025,
https://dialnet.unirioja.es/descarga/articulo/8534713.pdf
0
Puede agregar este documento a su colección de estudio (s)
Iniciar sesión Disponible sólo para usuarios autorizadosPuede agregar este documento a su lista guardada
Iniciar sesión Disponible sólo para usuarios autorizados(Para quejas, use otra forma )