Banco Central del Ecuador - Subgerencia de Información Estadística
Quito, Ecuador
Información
Recibido:
30 de septiembre de 2025
Aceptado:
28 de noviembre de 2025
Palabras clave:
Análisis de sentimiento
Procesamiento de lenguaje natural
Indicadores de confianza
Economía ecuatoriana
JEL:
C5, E37, E70, O54
DOI:
https://doi.org/10.47550/RCE/35.2.1
1ORCID: 0009-0009-0658-6923. CRediT: Investigación, Análisis formal, Metodología, Redacción - Revisión y edición, Redacción - Borrador original, Supervisión, Validación, Conceptualización. Correo electrónico: crdavila@bce.ec.
2ORCID: 0009-0003-1813-2618. CRediT: Investigación, Análisis formal, Metodología, Redacción - Borrador original, Redacción - Revisión y edición, Visualización, Curación de datos. Correo electrónico: andrechna@gmail.com.
Copyright © 2025 Dávila y Chasi. Los autores conservan los derechos de autor del artículo. El artículo se distribuye bajo la licencia Creative Commons Attribution 4.0 License.
Resumen
Esta investigación desarrolla un índice de sentimiento económico (ISE) para Ecuador a partir de noticias económicas diarias publicadas en plataformas web nacionales, cubriendo el periodo de 2019 a 2025. El indicador se genera mediante un proceso reproducible que aplica modelos de análisis de sentimiento en español, combinando enfoques léxicos y de aprendizaje profundo. Los resultados muestran que el modelo PySentimiento presenta el mejor desempeño y que el ISE mantiene correlaciones significativas con los principales indicadores de confianza, expectativas empresariales y actividad económica. El estudio resalta el valor del análisis de noticias como herramienta de alta frecuencia y bajo costo para el seguimiento macroeconómico en economías emergentes.
Central Bank of Ecuador - Statistical Information Department
Quito, Ecuador
Article Info
Received:
30th September 2025
Accepted:
28th November 2025
Keywords:
Sentiment analysis
Natural language processing
Confidence indicators
Ecuadorian economy
JEL:
C5, E37, E70, O54
DOI:
https://doi.org/10.47550/RCE/35.2.1
1 ORCID: 0009-0009-0658-6923. CRediT: Research, Formal analysis, Methodology, Writing - Review and editing, Writing - Original draft, Supervision, Validation, Conceptualization. Email: crdavila@bce.ec.
2 ORCID: 0009-0003-1813-2618. CRediT: Research, Formal analysis, Methodology, Writing - Original draft, Writing - Review and editing, Visualization, Data curation. Email: andrechna@gmail.com.
Copyright © 2025 Dávila and Chasi. Authors retain the copyright of this article. This article is published under the terms of the Creative Commons Attribution Licence 4.0.
Abstract
This research develops an Economic Sentiment Index (ESI) for Ecuador, based on daily economic news published on national web platforms between 2019 and 2025. The indicator is generated through a reproducible process that applies sentiment analysis models in Spanish, combining lexical and deep learning approaches. The results show that the PySentimiento model achieves the best performance and that the ESI exhibits significant correlations with key indicators of consumer confidence, business expectations, and economic activity. The study highlights the value of news analysis as a high-frequency and low-cost tool for macroeconomic monitoring in emerging economies.
La economía contemporánea reconoce que las percepciones y sentimientos de los agentes constituyen un determinante autónomo de la dinámica macroeconómica. Angeletos y La’O (2013) muestran que las expectativas colectivas pueden generar fluctuaciones agregadas que condicionan el consumo, la inversión y el ahorro, otorgándoles un papel decisivo en los ciclos económicos.
En paralelo, la interrelación entre la economía y las ciencias computacionales ha experimentado un crecimiento significativo en las últimas décadas, impulsada por la disponibilidad masiva de datos no estructurados en medios digitales y por el desarrollo de técnicas avanzadas de procesamiento de lenguaje natural (NLP, por sus siglas en inglés) y de aprendizaje automático (Algaba et al., 2023; Gentzkow et al., 2019). En este marco, el análisis de sentimientos aplicado a textos provenientes de noticias y redes sociales se ha consolidado como una herramienta innovadora para aproximar las percepciones y expectativas de los agentes económicos.
La evidencia empírica reciente confirma que las emociones expresadas en el espacio digital mantienen vínculos estrechos con variables macroeconómicas como el crecimiento, la inflación o la confianza del consumidor (Baker et al., 2016; Shapiro, Sudhof & Wilson, 2020). Asimismo, experiencias como el News Sentiment Index de la Reserva Federal de San Francisco y trabajos recientes de Van Binsbergen et al. (2024) y Cajner et al. (2024) demuestran que el sentimiento extraído de noticias posee un elevado poder predictivo. Estos desarrollos constituyen un punto de inflexión al evidenciar que la información no estructurada puede transformarse en un insumo riguroso, sistemático y de bajo costo para el análisis coyuntural de la actividad económica.
En este contexto, el presente artículo propone la construcción de un índice de sentimiento económico (ISE) para Ecuador a partir de un corpus de noticias nacionales del periodo 2019-2025, recopilado mediante un flujo reproducible de recolección y depuración de contenidos web. La propuesta integra y compara enfoques de NLP representativos de dos familias: (i) métodos léxicos (VADER) y (ii) modelos de deep learning (mBERT y PySentimiento), con el fin de evaluar su idoneidad relativa en textos económicos y su coherencia en la clasificación multiclase (negativo, neutro y positivo).
De este modo, la contribución del artículo es doble. En el plano metodológico, se presenta un pipeline transparente y replicable que combina web scraping, extracción semántica y clasificación multienfoque, acompañado de criterios de evaluación que incluyen desempeño por clase y calibración probabilística. En el plano empírico, se documentan los hechos estilizados del sentimiento noticioso en Ecuador desde 2019, su reacción ante episodios de elevada incertidumbre y su relación con indicadores de confianza y actividad.
Finalmente, el artículo se organiza de la siguiente manera. La sección 2 ofrece una revisión de la literatura sobre el uso de PLN en la construcción de índices económicos. La sección 3 describe la metodología de recolección y procesamiento de noticias, así como los modelos implementados. La sección 4 presenta los resultados de clasificación, la construcción del índice y su relación con episodios coyunturales y variables macroeconómicas. La sección 5 concluye con implicaciones y líneas de investigación futura.
El papel de las percepciones y sentimientos en la dinámica macroeconómica ha sido ampliamente discutido en la literatura. Desde una perspectiva teórica, Angeletos y La’O (2013) muestran que los sentimientos agregados pueden originar fluctuaciones económicas incluso en ausencia de cambios fundamentales, otorgando a las expectativas colectivas un rol autónomo en los ciclos. Este planteamiento se enlaza con la evidencia empírica que documenta cómo la confianza y las percepciones subjetivas inciden en las decisiones de consumo, inversión y ahorro, de manera análoga a lo captado por las encuestas tradicionales de expectativas empresariales y del consumidor.
Los primeros intentos por cuantificar estos sentimientos a través del análisis de medios se encuentran en el Recession Index, basado en el conteo de menciones de recesión en periódicos como The New York Times o The Washington Post. Con el avance de la interpretación semántica, Shapiro, Sudhof y Wilson (2020) desarrollaron el News Sentiment Index de la Reserva Federal de San Francisco, construido a partir de más de 238.000 artículos publicados entre 1980 y 2015. Su índice presenta una alta capacidad predictiva respecto al consumo, la producción y la evolución de las tasas de interés. Este enfoque marcó un hito al demostrar que el sentimiento extraído de noticias económicas es un indicador válido y de bajo costo para la evaluación coyuntural.
En América Latina, un esfuerzo similar ha sido implementado por el Banco Central de Reserva del Perú [BCRP] (2022), cuyo índice de sentimiento de noticias nacionales refleja la utilidad de estas métricas en contextos emergentes y evidencia su complementariedad respecto a los indicadores de confianza tradicionales. En esta misma línea, el Banco Central de Chile ha desarrollado un indicador de confianza económica en tiempo real a partir del análisis automatizado de noticias nacionales (Del Pilar Cruz et al., 2022). Este índice presenta una alta correlación con las encuestas tradicionales de confianza y muestra capacidad predictiva frente a choques económicos.
Con el desarrollo de técnicas de procesamiento de lenguaje natural (NLP) y aprendizaje automático (ML), la literatura más reciente ha ampliado las aplicaciones del análisis de texto en economía. Van Binsbergen et al. (2024) construyen series históricas de casi dos siglos de sentimiento económico en Estados Unidos a partir de 200 millones de páginas de periódicos, mostrando que estas medidas predicen con robustez el PIB, el consumo y el empleo. En la misma línea, Cajner et al. (2024) analizan respuestas textuales en encuestas manufactureras y demuestran que los modelos de aprendizaje profundo superan a los enfoques basados en diccionarios al anticipar la producción industrial. Por su parte, Zhao (2025) combina FinBERT con modelos secuenciales tipo LSTM y Transformer, logrando mejoras significativas en la predicción del índice S&P 500 a partir de 1,2 millones de artículos financieros. Asimismo, Zhang (2025) desarrolla un índice global diario de noticias utilizando FinBERT, XGBoost y técnicas de interpretabilidad como SHAP, lo que resalta la importancia de dotar de transparencia a los modelos de predicción económica. Finalmente, Grob-Klubmann (2024) propone el uso de autoencoders supervisados para extraer representaciones latentes de sentimiento noticioso, aplicables al nowcasting del PIB y a la predicción de retornos de activos.
En economías emergentes, la evidencia aún es limitada, pero creciente. Nguyen (2025) construye un índice de sentimiento lexicográfico para Vietnam y muestra que este indicador anticipa con éxito la inflación (CPI), lo cual refuerza la relevancia de este enfoque en contextos con limitaciones de datos de alta frecuencia. En el caso de Ecuador, el U-Index de Kahneman et al. (2004) mide la proporción de tiempo en que las personas experimentan emociones negativas y se ha planteado como un indicador de resiliencia en contextos de incertidumbre. Este tipo de resultados sugiere que las aproximaciones basadas en información contextual y percepciones pueden aportar información valiosa para el análisis económico en países en desarrollo.
En síntesis, la literatura converge en señalar que los índices derivados de noticias, construidos mediante técnicas de NLP y ML, ofrecen medidas de alta frecuencia, bajo costo y elevada correlación con variables macroeconómicas. A diferencia de los métodos lexicográficos tradicionales, los modelos de aprendizaje profundo1, como BERT, LSTM o autoencoders, han demostrado un mayor poder predictivo y una mejor capacidad para capturar matices semánticos en el lenguaje económico. A pesar de estos avances, la región latinoamericana aún presenta escasa evidencia, siendo Perú y Chile sus referentes. En este vacío se inscribe la presente investigación, que propone la construcción de un índice de sentimiento económico basado en noticias nacionales ecuatorianas, con el objetivo de evaluar su utilidad y potencial como predictor de variables macroeconómicas.
El primer paso en la construcción del índice de sentimiento económico (ISE) consistió en recopilar un conjunto representativo de noticias económicas provenientes de portales web ecuatorianos. Para asegurar la diversidad geográfica, temática y editorial, se seleccionaron once medios digitales nacionales y regionales que cubren tanto la esfera pública como la privada: Primicias, Expreso, El Telégrafo, Diario Extra, La República, Diario Los Andes, El Mercurio, La Calle, Teleamazonas, Ecuavisa y Metro Ecuador. Esta selección equilibra la cobertura entre Quito, Guayaquil, Cuenca y ciudades intermedias, e incorpora medios de orientación informativa variada.
Se consideraron como “noticias económicas” aquellas piezas pertenecientes a secciones de economía, finanzas o negocios, o que incluían en sus títulos o cuerpos palabras clave vinculadas con la actividad económica, tales como PIB, inflación, exportaciones, empleo, precios, empresas, crédito, gobierno o dólar. Se excluyeron textos de carácter político, social o judicial sin implicaciones económicas directas. De esta forma, el corpus incluye únicamente artículos con contenido económico explícito y relación directa con la coyuntura nacional, asegurando la pertinencia temática del conjunto analizado.
La recopilación de los artículos se realizó mediante un proceso de extracción automatizada (web scraping) sobre estos portales. Este desarrollo incluye la verificación de la accesibilidad de las URLs mediante el análisis de los archivos robots.txt y la extracción de contenido utilizando técnicas de análisis de texto.
El proceso de descarga de las noticias utiliza los mapas de sitio (en formato XML) de cada medio para obtener las URLs de los artículos publicados. A continuación, las URLs candidatas se filtran para incluir únicamente artículos de secciones económicas publicados a partir de 2019. La fecha de publicación se valida en dos etapas: en primer lugar, se identifica el año directamente de la URL, y segundo, se extrae la fecha real del artículo desde metadatos estructurados2. Si dichos metadatos no están disponibles, se utilizan expresiones regulares3 con el objetivo de identificar patrones de fecha dentro del contenido HTML.
La extracción del texto y los metadatos se ejecutó mediante la librería Trafilatura en Python. Esta herramienta está optimizada para el análisis estructural del texto (parsing) de documentos web, lo que permite una extracción limpia del contenido principal y la exclusión de elementos irrelevantes como menús, anuncios o pies de página (Barbaresi, 2021).
Por último, para garantizar que la información sea pertinente, se diseñó un filtro automatizado que descarta textos cortos y aplica un sistema de puntuación basado en palabras clave vinculadas al Ecuador (ciudades, provincias, instituciones), penalizando menciones de otros países en el encabezado y en el cuerpo de la noticia (anexos A y D). Se otorga mayor peso a las referencias en títulos y se incorpora una regla de rescate4 cuando aparece el término “Ecuador”. En esta fase, se produce el conjunto estructurado de textos definitivo de artículos con contenido textual y metadatos, preparado para el análisis de sentimientos5.
En consecuencia, se recopiló un conjunto válido de 28.741 noticias económicas relacionadas con Ecuador, abarcando el periodo desde 2019 hasta agosto de 2025 (anexo B).
El desarrollo del análisis de sentimiento económico combina tres enfoques metodológicos distintos de procesamiento de lenguaje natural (NLP). Primero, se emplea el método VADER (Valence Aware Dictionary and sEntiment Reasoner), desarrollado por Hutto y Gilbert (2014), que constituye un enfoque léxico para la medición de sentimiento. Su funcionamiento descansa en un diccionario de palabras y expresiones preclasificadas según su valencia afectiva, a cada una de las cuales se asigna un puntaje entre −4 (muy negativo) y +4 (muy positivo). La construcción del corpus se realizó originalmente en inglés, calibrando los pesos a partir de juicios humanos sobre miles de frases y verificando su robustez en textos de redes sociales, reseñas y titulares noticiosos.
La polaridad de un documento d se define como el promedio normalizado de las intensidades positivas y negativas de sus términos:
(1)
Donde y corresponden al número de ocurrencias de términos con carga positiva y negativa, ponderados por su intensidad en el léxico de VADER.
El algoritmo incluye además un conjunto de reglas lingüísticas que modifican el puntaje según el contexto, tales como:
Segundo, se aplica un enfoque de aprendizaje profundo empleando modelos de lenguaje basados en Bidirectional Encoder Representations from Transformers (BERT) (Devlin et al., 2019). BERT es un modelo de lenguaje bidireccional6 fundamentado en arquitecturas transformer, preentrenado en grandes corpus multilingües y ajustable para tareas específicas de procesamiento de lenguaje natural (NLP), como la clasificación de texto. En este estudio se implementa la versión multilingüe nlptown/bert-base-multilingual-uncased-sentiment, la cual clasifica cada documento en una escala ordinal de una a cinco estrellas, que representa un gradiente de sentimiento desde muy negativo hasta muy positivo.
Con el fin de obtener un puntaje continuo y simétrico en el intervalo [−1,1], la clasificación original se transforma mediante la siguiente expresión:
(2)
Donde corresponde a la categoría asignada por el modelo al documento d. De este modo, una predicción de “1 estrella” se asigna al valor −1; “3 estrellas” corresponde a neutralidad (0), y “5 estrellas” equivale a +1. Este procedimiento permite que los resultados de BERT sean comparables con los generados por métodos léxicos y otros enfoques de aprendizaje profundo. Además, el modelo muestra una capacidad destacada para capturar matices semánticos en textos más extensos y con lenguaje especializado, como noticias económicas, reportes técnicos y comunicados oficiales.
Finalmente, se empleó PySentimiento que es una herramienta de Python de código abierto diseñada para realizar minería de opinión y tareas de NLP social, adaptada para el español (Pérez et al., 2021). Este paquete utiliza modelos preentrenados de última generación para la clasificación de polaridad (análisis de sentimientos), emociones, discurso de odio e ironía. Estos modelos están construidos sobre la biblioteca HuggingFace’s Transformers7, la cual emplea embeddings8 y representaciones vectoriales basadas en autoatención para extraer características contextuales del texto.
Así, dado un documento d, PySentimiento estima un vector de puntuaciones:
(3)
Donde cada componente corresponde a una dimensión de sentimiento o emoción específica. Para la construcción del índice de sentimiento económico, se selecciona la dimensión de interés , la cual se normaliza al rango [−1,1] mediante:
(4)
Donde es la salida original del modelo y µ representa el valor central de la escala original. Esta normalización permite interpretar los puntajes de manera uniforme y consistente para análisis económico.
El paquete PySentimiento emplea modelos entrenados con corpus anotados en español, principalmente el corpus de Twitter (X) en español. Este corpus incluye miles de frases etiquetadas manualmente en tres categorías de sentimiento:
El modelo no crea categorías nuevas en función del texto analizado, sino que asigna cada observación a una de las tres categorías establecidas en el corpus de entrenamiento. La conversión a escala numérica se realiza asignando valores de +1 a la categoría positiva, −1 a la negativa y 0 a la neutra, lo que permite la agregación en el cálculo del índice de sentimiento económico (ISE).
En resumen, cada modelo genera un vector de probabilidades pd = (pd, pos, pd, neu, pd, neg) para cada documento d, sumando dicho vector a 1. La etiqueta asignada es la clase con la probabilidad más alta. De esta manera, la clasificación final de cada noticia siempre corresponde a la categoría que el modelo calcula como la más probable (anexo C).
Como resultado del proceso de muestreo9 y validación humana, se conformó un conjunto de 481 artículos de noticias económicas de Ecuador, publicados entre 2019 y 2025. Estas piezas informativas cubren dimensiones clave de la coyuntura nacional.
Cada artículo fue clasificado manualmente en una de tres categorías de sentimiento: positivo, negativo o neutro, atendiendo al tono predominante del texto y a sus implicaciones económicas. Se asignó la etiqueta positivo a noticias que resaltaban indicadores favorables, como el incremento del PIB o el dinamismo de las exportaciones; la etiqueta negativo se asoció con informes de recesión y crisis sectoriales; mientras que la categoría neutro correspondió a textos de carácter informativo o descriptivo sin valoración explícita.
Al contar con una referencia establecida por codificación humana, fue posible comparar el desempeño de los clasificadores automáticos frente a un estándar de calidad semántica.
Dado un vector de probabilidades p (y | x), se emplean criterios clásicos de muestreo por incertidumbre:
Seleccionar instancias con intermedio como 0,50-0,70 equivale a una alta incertidumbre bajo LC y márgenes reducidos, es decir, casos cercanos a la frontera de decisión. La utilidad comparada de estas medidas y su desempeño en escenarios de aprendizaje activo han sido estudiadas en la literatura especializada de aprendizaje automático (ML) (Nguyen et al., 2022). Adicionalmente, la corrección de sesgos derivados de muestreos activos puede abordarse mediante técnicas de aprendizaje activo ponderado por importancia (importance weighted active learning), que ajustan la estimación de riesgo para reflejar fielmente la distribución poblacional (Beygelzimer et al., 2009).
La evaluación de los modelos de clasificación en el análisis de sentimientos requiere un conjunto de métricas que capture tanto la precisión global como el desempeño diferenciado por clase y la calibración de las probabilidades predichas. Para ello, se construyó un conjunto de validación compuesto por 200 noticias económicas de Ecuador, cubriendo el periodo 2019-2024, las cuales fueron etiquetadas manualmente por dos codificadores independientes bajo un esquema tricotómico (positivo, negativo, neutro).
Sobre esta base, se emplearon métricas estándar en la literatura de aprendizaje automático y NLP, tales como accuracy, precision, recall, F1-score, así como la matriz de confusión, el Brier score y el expected calibration error (ECE).
El accuracy refleja la proporción de aciertos totales del modelo respecto al número de observaciones, siendo una métrica intuitiva pero limitada en escenarios con clases desbalanceadas (Powers, 2011). Para superar esta restricción, se consideraron el precision y el recall, que evalúan respectivamente la capacidad del modelo de evitar falsos positivos y falsos negativos. La combinación de ambas se sintetiza en el F1-score.
Adicionalmente, se reporta el F1-macro, que otorga el mismo peso a cada clase independientemente de su frecuencia, y el F1-weighted, que pondera los resultados según el soporte de cada clase. Estas métricas permiten evaluar la robustez del modelo en contextos de distribución heterogénea de etiquetas.
Para evaluar la calidad probabilística de las predicciones, se incluyen métricas de calibración. El Brier score mide el error cuadrático medio entre las probabilidades pronosticadas y los resultados observados, de modo que valores más bajos reflejan una mejor calibración (Brier, 1950). De forma complementaria, el expected calibration error (ECE) estima la discrepancia promedio entre las probabilidades predichas y las frecuencias observadas, proporcionando una medida agregada de la calibración del modelo (Guo et al., 2017) (tabla 1).
Tabla 1. Resumen de métricas de evaluación
|
Métrica |
Descripción |
Interpretación |
|
Accuracy |
Proporción de predicciones correctas sobre el total de observaciones. |
Mide desempeño global; fácil de interpretar. |
|
Precision |
Porcentaje de predicciones positivas que son realmente correctas. |
Evalúa capacidad de evitar falsos positivos. |
|
Recall |
Porcentaje de casos positivos correctamente identificados. |
Evalúa capacidad de evitar falsos negativos. |
|
F1-score |
Media armónica de precision y recall. |
Balance entre precision y recall. |
|
F1-macro |
Promedio del F1 por clase con igual peso. |
Evalúa equidad entre categorías. |
|
F1-weighted |
Promedio del F1 ponderado por el número de ejemplos. |
Ajusta el F1 a la distribución de clases. |
|
Matriz de confusión |
Distribución de aciertos y errores por clase. |
Permite ver qué clases son más confundidas. |
|
Brier score |
Error cuadrático medio entre probabilidades y resultados reales. |
Evalúa calibración probabilística (↓ mejor). |
|
ECE |
Diferencia entre probabilidades predichas y frecuencias observadas. |
Evalúa si las probabilidades son coherentes (↓ mejor). |
Elaboración: autores
La construcción del índice de sentimiento económico (ISE) sigue la tradición metodológica de los índices derivados de noticias económicas, en particular los enfoques de Shapiro, Sudhof y Wilson (2020) y Baker et al. (2016), quienes proponen la agregación temporal de puntajes obtenidos a partir de textos periodísticos y su posterior normalización para facilitar la interpretación comparativa.
Sea el conjunto de noticias , cada una con marca temporal (día calendario) y un puntaje continuo de sentimiento . Este puntaje corresponde a la salida del clasificador de sentimientos y se define como la diferencia entre la probabilidad de sentimiento positivo y negativo:
(5)
Se denota a T al conjunto de días del período de estudio y por al conjunto de noticias en el día t, con tamaño . El índice diario bruto se obtiene como la media aritmética de los puntajes de las noticias en cada día t:
(6)
Con el fin de facilitar la interpretación temporal y permitir comparaciones relativas, se normaliza la serie respecto a su promedio muestral, siguiendo un procedimiento estándar en la literatura de índices de noticias (Baker et al., 2016; Shapiro, Sudhof & Wilson, 2020). Sea
(7)
la media de los valores observados en el periodo de referencia , con . El índice normalizado se define como:
(8)
De este modo, el valor de referencia 50 corresponde al promedio del periodo analizado: valores indican un tono más positivo que el promedio, mientras que reflejan un tono más negativo. La elección de la base 50 responde a criterios de interpretabilidad, en línea con prácticas similares en índices de incertidumbre y sentimiento.
Para capturar la tendencia subyacente y atenuar la volatilidad de corto plazo, se calcularon medias móviles simples con ventanas completas de 7 y 30 días:
(9)
Estos suavizadores permiten distinguir la dinámica semanal (corto plazo) y la dinámica mensual (mediano plazo) del índice.
Finalmente, se incorporó una medida de volatilidad que refleja la estabilidad del tono informativo. Esta se calcula como la desviación estándar muestral del índice en una ventana móvil de 30 días:
(10)
Donde
(11)
La tabla 2 muestra los resultados de las métricas de evaluación obtenidas para los tres enfoques comparados: el modelo basado en léxico de referencia (VADER), un transformador multilingüe (mBERT) y un modelo entrenado específicamente para el español (PySentimiento).
En primer lugar, el modelo VADER, diseñado originalmente para el análisis de textos en inglés, mostró limitaciones evidentes al aplicarse a noticias económicas en español. Alcanzó una precisión del 43,28%, mientras que su F1-macro (≈ 0,38) refleja un bajo equilibrio entre clases. En particular, la matriz de confusión reflejó dificultades en la detección de la clase neutra, lo que limita su aplicabilidad en contextos multiclase.
Por su parte, el modelo mBERT, basado en transformadores multilingües, alcanzó una exactitud de 48,4% y un F1-macro de 0,391. Su principal fortaleza se observó en la clasificación de noticias negativas (Recall = 0,99), aunque mostró incapacidad para identificar la clase neutra (Precision y Recall = 0,00). Esto evidencia un sesgo hacia polaridades extremas, restringiendo su utilidad para la construcción de un índice balanceado.
En contraste, el modelo entrenado específicamente para el español, PySentimiento, alcanzó un desempeño claramente superior. Obtuvo una exactitud de 85,5% y un F1-macro de 0,858, logrando un adecuado balance entre categorías. A nivel desagregado, la clase negativa obtuvo un F1 de 0,90, la neutra de 0,83 y la positiva de 0,84. En términos de calibración probabilística, presentó un Brier score de 0,12, considerablemente menor al de los otros modelos, y un expected calibration error (ECE) de 0,19.
Con base en estas evidencias, se seleccionó PySentimiento como modelo de referencia para la elaboración del índice de sentimiento económico.
Tabla 2. Resultados de desempeño de los modelos
|
Modelo |
Accuracy |
F1-macro |
Brier score |
ECE |
|
VADER |
0,4328 |
0,3850 |
0,2195 |
0,1260 |
|
mBERT |
0,4843 |
0,3914 |
0,2065 |
0,0553 |
|
PySentimiento |
0,8553 |
0,8575 |
0,1210 |
0,1944 |
Elaboración: autores
El corpus de noticias económicas procesado con el modelo seleccionado permitió asignar, para cada observación, un puntaje continuo de sentimiento, una etiqueta discreta y las probabilidades asociadas a cada clase. En la tabla 3 se presenta un extracto de diez observaciones que ilustra el formato final de los datos. Para cada noticia se reporta la fecha de publicación, el texto original, el puntaje continuo (Si), la etiqueta de sentimiento resultante y las probabilidades estimadas para las clases positiva, neutra y negativa.
Tabla 3. Muestra de noticias clasificadas
|
Fecha |
Noticia |
Score |
Etiqueta |
P(Pos) |
P(Neu) |
P(Neg) |
|
2019-01-02 |
Tras el cierre del período de inscripción de… |
0,071 |
Neutro |
0,121 |
0,830 |
0,049 |
|
2019-01-02 |
El trabajo debe ser pensado en las familias de recursos limitados… |
-0,696 |
Negativo |
0,024 |
0,257 |
0,720 |
|
2019-01-04 |
El alza de precios de la gasolina y del diésel… |
-0,941 |
Negativo |
0,005 |
0,048 |
0,947 |
|
2019-01-07 |
Regresa a la contienda política electoral luego del juicio… |
-0,640 |
Negativo |
0,018 |
0,323 |
0,659 |
|
2019-01-14 |
Construcción de planta Bajo Alto fue ineficiente… |
-0,920 |
Negativo |
0,005 |
0,068 |
0,926 |
|
2019-01-14 |
BIESS busca revalidar liderazgo en préstamos hipotecarios… |
0,249 |
Positivo |
0,316 |
0,617 |
0,067 |
|
2019-01-14 |
Negocios en el área turística, la nueva tendencia de emprendimientos… |
0,629 |
Positivo |
0,652 |
0,326 |
0,022 |
Elaboración: autores
Además de la clasificación de cada noticia en categorías de sentimiento, se evaluó la consistencia interna del modelo y el nivel de confianza asociado a las predicciones (tabla 4). En todos los casos, la etiqueta final asignada a las noticias correspondió a la clase con mayor probabilidad estimada por el modelo. Esto confirma la consistencia interna del procedimiento de etiquetado probabilístico.
En cuanto a la confianza de las predicciones, se calculó como la probabilidad máxima asignada por el modelo a la clase predicha para cada noticia, es decir, para cada observación se consideró la probabilidad más alta entre las tres categorías (positivo, neutro, negativo). El valor promedio de esta probabilidad máxima fue 0,701, indicando que, en promedio, el modelo asigna un 70,1% de certeza a la clase seleccionada.
Finalmente, el análisis de cobertura según distintos umbrales de probabilidad permite identificar la proporción de observaciones que cumplen con niveles mínimos de confianza. En este sentido, un 76,7% de las noticias clasificadas alcanzaron una probabilidad máxima mayor o igual a 0,6, lo que respalda la robustez del proceso de clasificación.
Tabla 4. Métricas de coherencia y confianza en las predicciones
|
Indicador |
Valor |
|
Coherencia etiqueta |
100 % |
|
Confianza promedio |
0,701 |
|
Cobertura |
76,7 % |
Elaboración: autores
A partir de la clasificación individual de las noticias económicas, se construyó la serie diaria del índice. Para cada fecha con observaciones disponibles, se reporta:
La tabla 5 muestra un extracto representativo de la base de datos. Este formato permite observar, para cada día calendario, la cobertura periodística y la estabilidad relativa de la serie. En particular, el número de noticias (n) varía entre 2 y 9 por día. Los valores del índice normalizado se concentran en torno a 50 (figura 1), pero muestran fluctuaciones que son suavizadas por las medias móviles. La volatilidad de 30 días, en cambio, evidencia periodos de mayor inestabilidad del tono noticioso.
Tabla 5. Muestra de datos del índice de sentimiento económico
|
Fecha |
ISE |
Conf. media |
norm |
|
|
|
|
2019-02-09 |
62,49 |
0,60 |
50,50 |
54,39 |
53,35 |
0,182 |
|
2019-02-11 |
54,37 |
0,82 |
50,17 |
54,73 |
53,64 |
0,182 |
|
2019-02-12 |
55,36 |
0,63 |
50,21 |
54,64 |
54,48 |
0,179 |
|
2019-02-13 |
56,31 |
0,64 |
50,25 |
55,67 |
55,10 |
0,178 |
|
2019-02-14 |
54,23 |
0,71 |
50,16 |
55,28 |
55,07 |
0,168 |
|
2019-02-15 |
50,79 |
0,68 |
50,03 |
55,57 |
54,75 |
0,171 |
|
2019-02-16 |
49,80 |
0,74 |
49,99 |
54,76 |
54,75 |
0,169 |
|
2019-02-18 |
55,68 |
0,58 |
50,22 |
53,79 |
54,52 |
0,171 |
|
2019-02-19 |
59,17 |
0,68 |
50,15 |
54,46 |
55,12 |
0,170 |
|
2019-02-20 |
53,74 |
0,70 |
50,14 |
54,22 |
55,28 |
0,168 |
Elaboración: autores
Figura 1. Serie completa del índice normalizado (2019-2025)

Elaboración: autores
En la figura 2 se observa que el índice experimenta caídas pronunciadas en episodios de crisis o incertidumbre, como el paro nacional de 2019, la cuarentena de 2020, el paro nacional de 2022 o la crisis política de 2023 asociada con el asesinato del candidato Fernando Villavicencio y los episodios de apagones nacionales de 2024. Estas caídas reflejan un incremento en la proporción de noticias negativas y en el tono pesimista de la prensa económica.
En contraste, se identifican picos positivos en momentos de expectativa favorable o de estabilidad política relativa, como la victoria electoral de Daniel Noboa en 2023 y el inicio de su segundo mandato en 2025. Estos ascensos sugieren un desplazamiento temporal hacia noticias de tono optimista y un aumento de la confianza en la coyuntura económica.
Figura 2. Índice con media móvil de 30 días

Elaboración: autores
Los resultados del análisis de correlación dinámica, presentados en la tabla 6, indican que el ISE mantiene altas y variadas correlaciones con los diferentes tipos de indicadores analizados, confirmando su capacidad de síntesis10 (anexo E).
El ISE muestra sus vínculos más fuertes con los indicadores de percepción. Las correlaciones máximas con el índice de confianza del consumidor (ICC) (ρ = 0,76) y el índice de expectativas de la economía (IEE) (ρ = 0,68) son las más elevadas.
En el ámbito de la actividad económica, el ISE mantiene correlaciones significativas tanto con el índice de actividad empresarial no petrolera (IAE-NP) del Centro de Estudios Fiscales (2010) (ρ = 0,68) como con las ventas totales registradas por el Servicio de Rentas Internas (ρ = 0,72). Estas relaciones evidencian que el sentimiento noticioso no solo refleja el estado de ánimo de los agentes, sino que también acompaña los ciclos de expansión y contracción de la actividad económica, actuando como un posible indicador coincidente y potencialmente anticipador de su evolución.
La correlación máxima con el U-Index de Romero et al. (2025) es de ρ = 0,59. Aunque es la correlación más baja del conjunto, su valor positivo indica que, durante el periodo de estudio, las fluctuaciones en el sentimiento económico (ISE) y en la incertidumbre (U-Index) se movieron, en ciertos momentos, en la misma dirección. Este resultado puede reflejar periodos de alta volatilidad donde tanto las noticias como la incertidumbre aumentaron simultáneamente.
Este hallazgo muestra que el ISE captura variaciones sincronizadas con el ánimo económico reflejado en los indicadores de confianza y expectativas. Sin embargo, la relación entre el sentimiento mediático y la situación económica no debe interpretarse en términos causales, ya que ambos fenómenos pueden influirse mutuamente. En economías pequeñas como la ecuatoriana, las noticias pueden amplificar el tono económico existente o reaccionar ante él, generando una relación bidireccional entre la percepción y la coyuntura.
Tabla 6. Máximos de correlaciones dinámicas (ventana 12 meses), periodo 2022-2025
|
Variable |
Correlación máxima (ρ) |
|
Percepción y confianza |
|
|
Índice de confianza del consumidor (ICC) |
0,76 |
|
Índice de expectativas de la economía (IEE) |
0,68 |
|
Actividad económica |
|
|
Índice de actividad empresarial no petrolera (IAENP) |
0,68 |
|
Ventas totales |
0,72 |
|
Incertidumbre política-económica |
|
|
U-Index de incertidumbre y política (UI) |
0,59 |
Elaboración: autores
Con el fin de evaluar la posible capacidad anticipadora del índice de sentimiento económico (ISE) frente a los principales indicadores macroeconómicos y de percepción, se amplió el análisis de correlaciones dinámicas incorporando adelantos y rezagos del ISE en el rango de −3 ≤ k ≤ +3 meses, utilizando una ventana móvil de 12 meses. La tabla 7 presenta los valores máximos de correlación observados, el desfase correspondiente y el mes en el que se alcanzó dicho valor.
Los resultados muestran que las correlaciones más elevadas se presentan cuando el ISE se adelanta respecto a los indicadores de actividad económica. En particular, la relación con el índice de actividad empresarial no petrolera (IAE-NP) alcanza un valor máximo de ρ = 0,88 cuando el ISE se adelanta un mes (julio de 2025), lo que sugiere que el sentimiento captado en las noticias económicas antecede parcialmente la evolución de la actividad empresarial. De forma complementaria, las ventas totales muestran una correlación contemporánea de ρ = 0,72, lo que indica que el ISE también refleja de manera coincidente los ciclos de la actividad comercial y productiva.
En contraste, las correlaciones con los indicadores de percepción, el índice de confianza del consumidor (ICC) y el índice de expectativas económicas (IEE) son menores y presentan rezagos positivos, con valores máximos de ρ = 0,67 y ρ = 0,46, respectivamente. Este resultado sugiere que los cambios en la confianza y las expectativas de los agentes tienden a seguir los movimientos del sentimiento económico expresado en los medios, en lugar de anticiparlos.
Por su parte, la relación con el U-Index de incertidumbre política y económica es principalmente contemporánea (ρ = 0,60 en marzo de 2025), reflejando que los episodios de mayor incertidumbre y el tono informativo negativo tienden a coincidir temporalmente.
Tabla 7. Máximo de correlación dinámica por indicador y mes (ventana de 12 meses; 2022-2025)
|
Variable |
Rezago |
ρ max |
Mes máx. |
Interpretación |
|
IAENP |
-1 |
0,88 |
2025-07 |
ISE anticipa la actividad no petrolera (lead) |
|
ICC |
2 |
0,67 |
2025-01 |
ISE rezagado frente a la confianza del consumidor (lag) |
|
IEE |
3 |
0,46 |
2025-08 |
ISE rezagado frente a las expectativas empresariales (lag) |
|
U-Index |
0 |
0,60 |
2025-03 |
Relación contemporánea con la incertidumbre política y económica |
|
Ventas |
0 |
0,72 |
2023-11 |
Relación contemporánea con las ventas |
Notas: Un rezago negativo indica que el ISE se adelanta al indicador (lead).
Las correlaciones se calcularon con una ventana móvil de 12 meses.
Elaboración: autores
La construcción del índice de sentimiento económico (ISE) a partir de noticias nacionales permite disponer de una medida alternativa y de alta frecuencia de las percepciones económicas captadas en los medios de comunicación. Los resultados de esta investigación evidencian tres conclusiones principales.
En primer lugar, el análisis comparativo de modelos confirmó la importancia de utilizar herramientas lingüísticas adaptadas al idioma predominante del corpus. Mientras que los enfoques léxicos o multilingües (como VADER o mBERT) mostraron limitaciones notorias en la identificación de noticias neutras y en la calibración de probabilidades, el modelo entrenado específicamente para español (PySentimiento) alcanzó una exactitud del 86 % y un F1-macro de 0,86. Estos resultados evidencian un mejor balance en la clasificación de categorías y una mayor coherencia probabilística, lo que justifica su elección como base metodológica para la construcción del ISE.
En segundo lugar, la serie del índice muestra capacidad de respuesta frente a episodios coyunturales de relevancia económica y política, tales como paros nacionales, elecciones presidenciales y crisis de gobernabilidad. Los descensos abruptos durante la cuarentena de 2020 o tras el asesinato de un candidato presidencial en 2023 reflejan un tono marcadamente negativo, mientras que las recuperaciones observadas en momentos de transición política (por ejemplo, la elección y posterior consolidación de Daniel Noboa en 2023-2025) evidencian el papel de las expectativas en el comportamiento del sentimiento mediático.
En tercer lugar, el análisis de correlaciones dinámicas muestra que el ISE mantiene asociaciones estadísticamente relevantes tanto con indicadores de percepciones de los agentes como con medidas de actividad económica. En particular, se registraron valores máximos de ρ = 0,68 con el índice de expectativas económicas (IEE), de ρ = 0,76 con el índice de confianza del consumidor (ICC) y correlaciones significativas con el índice de actividad económica mensual (ρ = 0,68). Estos resultados sugieren que el ISE constituye una medida sintética del estado anímico de los agentes, capaz de reflejar componentes prospectivos y, al mismo tiempo, anticipar la dinámica de la coyuntura presente.
Finalmente, los hallazgos respaldan que el ISE puede convertirse en un insumo complementario para el análisis macroeconómico y la formulación de políticas. El índice ofrece señales de alta frecuencia que permiten captar cambios abruptos en la percepción de los agentes y su propagación temporal. En función de su robustez, el ISE fue seleccionado como medida de referencia en este estudio. Si bien los resultados muestran una relación dinámica significativa con los principales indicadores económicos, el análisis no pretende establecer una relación causal, sino documentar comovimientos y sincronías entre el tono informativo y la coyuntura. En este sentido, el ISE debe entenderse como un instrumento descriptivo y complementario, cuyo valor radica en ofrecer señales tempranas y de alta frecuencia sobre el ánimo económico agregado.
Cabe señalar que la relación entre el sentimiento noticioso y la economía es bidireccional: los acontecimientos económicos influyen en la narrativa mediática, pero, a su vez, el tono de las noticias puede amplificar o atenuar las expectativas de los agentes. Esta endogeneidad es inherente al fenómeno informativo y representa un desafío metodológico común en este tipo de estudios. En adelante, será pertinente profundizar en esta interacción mediante pruebas de causalidad temporal, modelos de vectores autorregresivos estructurales (SVAR) o esquemas de frecuencia mixta que permitan identificar la dirección predominante de los efectos. Asimismo, se recomienda integrar este tipo de índices con modelos econométricos de mayor complejidad, como los de factores dinámicos de frecuencia mixta (Algaba et al., 2023) o los indicadores de incertidumbre de política económica (Loughran & McDonald, 2011), y evaluar su capacidad predictiva en esquemas de nowcasting de la actividad económica.
Bibliografía
Algaba, A., Borms, S., Boudt, K., & Verbeken, B. (2023). Daily news sentiment and monthly surveys: A mixed-frequency dynamic factor model for nowcasting consumer confidence. International Journal of Forecasting, 39(1), 266-278. https://doi.org/10.1016/j.ijforecast.2021.12.001
Angeletos, G.-M., & La’O, J. (2013). Sentiments. Econometrica, 81(2), 739-779. https://doi.org/10.3982/ECTA10008
Baker, S. R., Bloom, N., & Davis, S. J. (2016). Measuring economic policy uncertainty. The Quarterly Journal of Economics, 131(4), 1593-1636. https://doi.org/10.1093/qje/qjw024
Banco Central de Reserva del Perú (BCRP). (2022). Un índice de sentimiento de las noticias para el Perú. Revista Moneda, 193, 33-44. https://www.bcrp.gob.pe/docs/Publicaciones/Revista-Moneda/moneda-193/moneda-193-03.pdf
Barbaresi, A. (2021). Trafilatura: A web scraping library and command-line tool for text discovery and extraction. Proceedings of the Joint Conference of the 59th annual meeting of the Association for Computational Linguistics and the 11th International Joint Conference On Natural Language Processing: system demonstrations, 122-131. https://aclanthology.org/2021.acl-demo.15
Beygelzimer, A., Dasgupta, S., & Langford, J. (2009). Importance weighted active learning. Proceedings of the 26th International Conference on Machine Learning (ICML). https://icml.cc/
Brier, G. W. (1950). Verification of forecasts expressed in terms of probability. Monthly Weather Review, 78(1), 1-3. https://doi.org/10.1175/1520-0493(1950)078<0001:VOFEIT>2.0.CO;2
Cajner, T., Morin, N., Crane, L., Soto, P. E., & Vrankovich, B. (2024). Manufacturing sentiment: Forecasting industrial production with text analysis (inf. téc. Nº FEDS Working Paper No. 2024-026). Board of Governors of the Federal Reserve System. https://doi.org/10.17016/FEDS.2024.026
Centro de Estudios Fiscales. (2010). Índice de actividad empresarial no petrolera (IAE-NP). (2010-05).
Del Pilar Cruz, M., Peralta, H., & Cova, J. P. (2022). Using the press as a real-time economic confidence indicator (Working Paper No. 938). Banco Central de Chile. https://www.bcentral.cl/en/web/banco-central/content/-/detalle/documento-de-trabajo-n-938
Devlin, J., Chang, M.-W., & Lee, K., Kenton y Toutanova. (2019). BERT: Pretraining of deep bidirectional transformers for language understanding. NAACL-HLT.
Gentzkow, M., Kelly, B., & Taddy, M. (2019). Text as data. Journal of Economic Literature, 57(3), 535-574. https://doi.org/10.1257/jel.20181020
Grob-Klubmann, A. (2024). Learning deep news sentiment representations for macrofinancial forecasting. Financial Innovation, 10(1), 1-24. https://doi.org/10.1007/s42521-024-00107-2
Guo, C., Pleiss, G., Sun, Y., & Weinberger, K. Q. (2017). On calibration of modern neural networks. Proceedings of the 34th International Conference on Machine Learning, 70, 1321-1330. http://proceedings.mlr.press/v70/guo17a.html
Hutto, C. J., & Gilbert, E. (2014). VADER: A parsimonious rule-based model for sentiment analysis of social media text. Proceedings of the International AAAI Conference on Web and Social Media, 8(1).
Kahneman, D., Krueger, A. B., Schkade, D., Schwarz, N., & Stone, A. A. (2004). A survey method for characterizing daily life experience: The day reconstruction method. Science, 306(5702), 1776-1780. https://doi.org/10.1126/science.1103572
Loughran, T., & McDonald, B. (2011). When is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. The Journal of Finance, 66(1), 35-65. https://doi.org/10.1111/j.1540-6261.2010.01625.x
Nguyen, D. P. (2025). Sentiment index as a predictor of CPI: A lexicon-based approach in Vietnam. Journal of Asian Economics, 87, 101694. https://doi.org/10.1016/j.asieco.2025.101694
Nguyen, V.-L., Yamasaki, T., & Ishikawa, H. (2022). How to measure uncertainty in uncertainty sampling for active learning. Machine Learning. https://doi.org/10.1007/s10994-021-06090-6
Pérez, J. M., Giudici, J. C., & Luque, F. (2021). Pysentimiento: A Python toolkit for sentiment analysis and social NLP tasks.
Powers, D. M. W. (2011). Evaluation: From precision, recall and F-measure to ROC, informedness, markedness and correlation. Journal of Machine Learning Technologies, 2(1), 37-63.
Romero, P., López, R., & Herrera, P. (2025). Índice incertidumbre de economía y política de Ecuador: U-Index USFQ [doi:10.13140/RG.2.2.20947.08484]. [Pre-Print]. https://doi.org/10.13140/RG.2.2.20947.08484
Shapiro, A. H., Sudhof, M., & Wilson, D. (2020). Measuring news sentiment. Federal Reserve Bank of San Francisco (Working Paper 2017-01). https://doi.org/10.24148/wp2017-01
Van Binsbergen, J. H., Bryzgalova, S., Mukhopadhyay, M., & Sharma, V. (2024). (Almost) 200 years of news-based economic sentiment (inf. téc. N.o NBER Working Paper No. 32026). National Bureau of Economic Research. https://doi.org/10.3386/w32026
Zhang, Y. (2025). Interpretable machine learning for macro alpha: A news sentiment case study. https://arxiv.org/abs/2505.16136
Zhao, W. (2025). Machine learning for economic forecasting: A sentiment and timeseries approach. SSRN Electronic Journal. https://doi.org/10.2139/ssrn.5127104
Anexos
Anexo A. Diagrama de flujo web scraping

Anexo B. Promedios diarios y mensuales por diario y año
|
Diario |
Año |
Promedio mensual |
|---|---|---|
|
Diario Expreso |
2019 |
48 |
|
2020 |
103 |
|
|
2021 |
57 |
|
|
2022 |
89 |
|
|
2023 |
139 |
|
|
2024 |
183 |
|
|
2025 |
237 |
|
|
Diario Los Andes |
2019 |
6 |
|
2020 |
2 |
|
|
2021 |
6 |
|
|
2022 |
1 |
|
|
2023 |
2 |
|
|
2024 |
4 |
|
|
2025 |
3 |
|
|
Ecuavisa |
2025 |
12 |
|
El Mercurio |
2021 |
105 |
|
2022 |
90 |
|
|
2023 |
87 |
|
|
2024 |
58 |
|
|
2025 |
65 |
|
|
El Telégrafo |
2019 |
104 |
|
2020 |
12 |
|
|
2021 |
14 |
|
|
2022 |
1 |
|
|
2024 |
12 |
|
|
2025 |
10 |
|
|
Extra |
2020 |
2 |
|
2021 |
2 |
|
|
2022 |
2 |
|
|
2023 |
2 |
|
|
2024 |
5 |
|
|
2025 |
8 |
|
|
La República |
2021 |
13 |
|
2022 |
15 |
|
|
2023 |
21 |
|
|
2024 |
16 |
|
|
2025 |
23 |
|
|
La calle Media |
2019 |
16 |
|
2020 |
13 |
|
|
2021 |
8 |
|
|
2022 |
20 |
|
|
2023 |
10 |
|
|
2024 |
4 |
|
|
2025 |
3 |
|
|
Metro Ecuador |
2025 |
2 |
|
Primicias |
2019 |
88 |
|
2020 |
108 |
|
|
2021 |
106 |
|
|
2022 |
127 |
|
|
2023 |
170 |
|
|
2024 |
239 |
|
|
2025 |
166 |
|
|
Teleamazonas |
2025 |
16 |
Anexo C. Diagrama de flujo de los modelos

Anexo D. Diagrama de flujo de selección de noticias

Anexo E. Comparación del ISE con indicadores de coyuntura




1 Basados en arquitecturas de transformación de texto (Transformer), que permiten captar relaciones entre palabras dentro de una oración.
2 Como Opengraph, atributos itemprop y bloques JSON-LD.
3 Son patrones de caracteres que se utilizan para buscar, validar o manipular texto dentro de cadenas de texto.
4 Si “Ecuador” aparece en el texto, pero la suma quedó baja, el algoritmo no lo descarta, sino que lo reclasifica.
5 Cabe señalar que el fenómeno noticioso puede presentar cierta endogeneidad, dado que las líneas editoriales de los medios pueden verse influidas por intereses políticos o económicos. Este posible sesgo se atenúa parcialmente mediante la inclusión de medios públicos, privados y regionales, aunque constituye una limitación inherente a los índices construidos con información periodística.
6 El término bidireccional indica que el modelo analiza simultáneamente el contexto anterior y posterior de cada palabra, lo que le permite captar mejor el sentido completo de una oración.
7 Transformers actúa como marco de definición de modelos para modelos de aprendizaje automático de última generación en texto, visión artificial, audio, video y modelos multimodales, tanto para inferencia como para entrenamiento.
8 El modelo genera embeddings, es decir, representaciones numéricas del significado de las palabras en su contexto.
9 El muestreo se realizó mediante un diseño estratificado y balanceado por clase, en el que cada grupo de sentimiento (negativo, neutro y positivo) aportó proporcionalmente al total de la muestra. Este esquema reduce la varianza del estimador respecto a un muestreo aleatorio simple y garantiza precisión equivalente entre clases; se estableció un tamaño aproximado de 120 observaciones por clase con un nivel de confianza del 95 %.
10 El índice de confianza del consumidor (ICC) y el índice de expectativas de la economía (IEE) son elaborados por el Banco Central del Ecuador (BCE) a partir de encuestas mensuales de percepción aplicadas a hogares y empresas, respectivamente. El índice de actividad empresarial no petrolera (IAE-NP) es una herramienta estadística construida mediante una metodología de indicadores compuestos que mide el comportamiento empresarial del país, mientras que las ventas totales provienen del Servicio de Rentas Internas (SRI) y reflejan la evolución agregada de todas las actividades económicas registradas. Finalmente, el U-Index es un indicador experimental de incertidumbre económica y política desarrollado por la Universidad San Francisco de Quito.