Ejercicios: Inteligencia artificial y big data
Explica con tus palabras la diferencia entre programación tradicional (reglas escritas por una persona) y aprendizaje automático (reglas aprendidas a partir de…
Explica con tus palabras la diferencia entre programación tradicional (reglas escritas por una persona) y aprendizaje automático (reglas aprendidas a partir de ejemplos), y pon una aplicación donde cada enfoque sea más adecuado.
Define «big data» y explica las tres «V» clásicas (volumen, velocidad y variedad) con un ejemplo de cada una en el contexto de una aplicación de transporte urbano.
Define «big data» y explica las tres «V» clásicas (volumen, velocidad y variedad) con un ejemplo de cada una en el contexto de una aplicación de transporte urbano.
La figura muestra la cadena de un sistema de aprendizaje automático que recomienda rutas de autobús, pero uno de sus bloques está tapado. Indica qué bloque falta, qué…
La figura muestra la cadena de un sistema de aprendizaje automático que recomienda rutas de autobús, pero uno de sus bloques está tapado. Indica qué bloque falta, qué ocurre dentro de él y qué datos necesita recibir del bloque anterior.
Explica qué es un «modelo» en aprendizaje automático (los patrones y parámetros aprendidos de los datos) y qué diferencia hay entre entrenarlo y usarlo (inferencia).…
Explica qué es un «modelo» en aprendizaje automático (los patrones y parámetros aprendidos de los datos) y qué diferencia hay entre entrenarlo y usarlo (inferencia). ¿Por qué entrenar cuesta mucho más computación que usarlo?
Cita cinco servicios cotidianos que usan aprendizaje automático hoy (mapas y tráfico, traductores, recomendadores de vídeo, asistentes de voz, filtros de spam) e indica…
Cita cinco servicios cotidianos que usan aprendizaje automático hoy (mapas y tráfico, traductores, recomendadores de vídeo, asistentes de voz, filtros de spam) e indica en cada uno qué datos de entrada usa el modelo.
En aprendizaje supervisado, ¿qué es la etiqueta de un dato? Pon tres ejemplos de conjuntos de datos etiquetados (foto → gato/perro, correo → spam/no spam, sensor →…
En aprendizaje supervisado, ¿qué es la etiqueta de un dato? Pon tres ejemplos de conjuntos de datos etiquetados (foto → gato/perro, correo → spam/no spam, sensor → sano/avería) y explica quién suele producir las etiquetas y qué coste tiene.
Explica con una analogía sencilla qué es una red neuronal artificial: capas de «neuronas» que combinan entradas con pesos ajustables. ¿Qué se ajusta durante el…
Explica con una analogía sencilla qué es una red neuronal artificial: capas de «neuronas» que combinan entradas con pesos ajustables. ¿Qué se ajusta durante el entrenamiento y qué significa que la red «aprende»?
Ordena de más general a más específico estos tres términos: aprendizaje profundo (deep learning), inteligencia artificial, aprendizaje automático. Explica la relación de…
Ordena de más general a más específico estos tres términos: aprendizaje profundo (deep learning), inteligencia artificial, aprendizaje automático. Explica la relación de inclusión entre ellos con un ejemplo de cada nivel.
Explica la diferencia entre aprendizaje supervisado, no supervisado y por refuerzo, y clasifica estas aplicaciones: filtro de spam entrenado con correos etiquetados,…
Explica la diferencia entre aprendizaje supervisado, no supervisado y por refuerzo, y clasifica estas aplicaciones: filtro de spam entrenado con correos etiquetados, agrupación de clientes por hábitos de compra sin etiquetas, y un robot que aprende a caminar por ensayo y error.
Un sistema aprende con el $80\,\%$ de los datos y se evalúa con el $20\,\%$ restante. Explica qué son el conjunto de entrenamiento y el de prueba, qué es el sobreajuste…
Un sistema aprende con el $80\,\%$ de los datos y se evalúa con el $20\,\%$ restante. Explica qué son el conjunto de entrenamiento y el de prueba, qué es el sobreajuste y cómo se detecta comparando los errores en ambos conjuntos.
Un ayuntamiento instala sensores de tráfico en $200$ cruces que envían una lectura cada $5$ segundos. a) Estima el número de lecturas generadas al día y al año. b)…
Un ayuntamiento instala sensores de tráfico en $200$ cruces que envían una lectura cada $5$ segundos. a) Estima el número de lecturas generadas al día y al año. b) Razona qué problemas de almacenamiento y procesamiento plantean y por qué las bases de datos convencionales de un solo servidor pueden quedarse cortas.
Un clasificador de averías evaluado sobre $200$ máquinas da la matriz de confusión de la figura. a) Calcula la precisión ($\frac{VP}{VP + FP}$) y la exhaustividad o…
Un clasificador de averías evaluado sobre $200$ máquinas da la matriz de confusión de la figura. a) Calcula la precisión ($\frac{VP}{VP + FP}$) y la exhaustividad o sensibilidad ($\frac{VP}{VP + FN}$). b) Explica qué error es más grave en mantenimiento (el falso negativo: avería no detectada) y cómo cambiarías el umbral del modelo para reducirlo a costa de más falsas alarmas.
Explica qué es la validación cruzada (dividir los datos en varias partes y rotar cuál se usa para probar) y qué problema resuelve cuando hay pocos datos: ¿por qué una…
Explica qué es la validación cruzada (dividir los datos en varias partes y rotar cuál se usa para probar) y qué problema resuelve cuando hay pocos datos: ¿por qué una única división entrenamiento/prueba puede dar una estimación «con suerte» o «con mala suerte» del error real?
En la detección de fraude bancario solo una transacción de cada mil es fraudulenta. Explica qué es un conjunto desbalanceado, por qué un modelo que clasifica todo como…
En la detección de fraude bancario solo una transacción de cada mil es fraudulenta. Explica qué es un conjunto desbalanceado, por qué un modelo que clasifica todo como «legítimo» acierta el $99{,}9\,\%$ y no sirve para nada, y qué métricas y técnicas se usan en su lugar (exhaustividad, sobremuestreo de la clase minoritaria, pesos).
Para predecir el consumo eléctrico de un edificio, propon al menos seis variables de entrada (temperatura exterior, hora del día, día laborable o festivo, ocupación,…
Para predecir el consumo eléctrico de un edificio, propon al menos seis variables de entrada (temperatura exterior, hora del día, día laborable o festivo, ocupación, histórico del día anterior, radiación solar) y justifica cada una. Explica qué es la ingeniería de variables y por qué suele decidir más que el algoritmo elegido.
Distingue entre un problema de clasificación (predecir una categoría) y uno de regresión (predecir un número). Clasifica estas tareas: estimar el precio de una vivienda,…
Distingue entre un problema de clasificación (predecir una categoría) y uno de regresión (predecir un número). Clasifica estas tareas: estimar el precio de una vivienda, decidir si una radiografía muestra una fractura, predecir la temperatura de mañana y agrupar noticias por tema.
Un modelo de selección de currículos rechaza sistemáticamente más candidaturas de ciertos barrios. Analiza de dónde puede venir ese sesgo (datos históricos de…
Un modelo de selección de currículos rechaza sistemáticamente más candidaturas de ciertos barrios. Analiza de dónde puede venir ese sesgo (datos históricos de contratación, variables que actúan como sustitutas de la procedencia), qué consecuencias éticas y legales tiene y qué medidas de auditoría aplicarías antes de usar el modelo.
Diseña a nivel conceptual un sistema de mantenimiento predictivo para el parque de calderas de una ciudad: qué sensores y datos recogerías, qué etiquetas necesitaría el…
Diseña a nivel conceptual un sistema de mantenimiento predictivo para el parque de calderas de una ciudad: qué sensores y datos recogerías, qué etiquetas necesitaría el aprendizaje supervisado, cómo validarías el modelo y qué decisión tomaría el sistema ante una predicción de avería inminente.
Evalúa críticamente la frase «los datos son el nuevo petróleo»: en qué se parecen los datos a un recurso natural (valor, extracción, refinado) y en qué se diferencian…
Evalúa críticamente la frase «los datos son el nuevo petróleo»: en qué se parecen los datos a un recurso natural (valor, extracción, refinado) y en qué se diferencian radicalmente (no se agotan al usarse, se copian sin coste, su valor depende del contexto). Concluye con los derechos que plantea su explotación masiva.
Diseña un experimento A/B para decidir si un nuevo recomendador de vídeos mejora al actual: qué dos grupos de usuarios comparas, qué métrica principal eliges (tiempo de…
Diseña un experimento A/B para decidir si un nuevo recomendador de vídeos mejora al actual: qué dos grupos de usuarios comparas, qué métrica principal eliges (tiempo de visionado, retención a una semana), qué riesgos de contaminación evitas (usuarios que comparten cuenta, efectos de novedad) y cuánto tiempo debe durar la prueba.
Un hospital quiere compartir datos de pacientes para entrenar un modelo. Analiza qué es la anonimización y por qué quitar el nombre no basta (reidentificación por…
Un hospital quiere compartir datos de pacientes para entrenar un modelo. Analiza qué es la anonimización y por qué quitar el nombre no basta (reidentificación por combinación de código postal, fecha y diagnóstico), qué técnicas robustas existen (seudonimización, agregación, privacidad diferencial) y qué exige el RGPD para este uso.
En un diagnóstico médico asistido, compara un modelo de caja negra (red profunda muy precisa pero inexplicable) con uno interpretable (árbol de decisión o reglas, algo…
En un diagnóstico médico asistido, compara un modelo de caja negra (red profunda muy precisa pero inexplicable) con uno interpretable (árbol de decisión o reglas, algo menos preciso). Analiza qué exige el médico (razones de cada diagnóstico), qué exige el paciente y qué solución de compromiso propondrías (modelos explicables por diseño, explicaciones post hoc, supervisión humana obligatoria).
Entrenar un modelo grande de lenguaje puede consumir cientos de megavatio-hora. Evalúa la huella ambiental del ciclo de vida de la IA (fabricación del hardware,…
Entrenar un modelo grande de lenguaje puede consumir cientos de megavatio-hora. Evalúa la huella ambiental del ciclo de vida de la IA (fabricación del hardware, entrenamiento, inferencia diaria a gran escala) y propón tres medidas para reducirla (modelos más pequeños y especializados, centros de datos con renovables, reutilización de modelos preentrenados).
Un ayuntamiento quiere un modelo que «prediga qué barrios tendrán más conflictividad el año próximo». Analiza críticamente la viabilidad: qué datos históricos existen…
Un ayuntamiento quiere un modelo que «prediga qué barrios tendrán más conflictividad el año próximo». Analiza críticamente la viabilidad: qué datos históricos existen (denuncias: miden actividad policial, no conflictividad real), qué profecía autocumplida puede generar (más vigilancia → más denuncias → más vigilancia) y qué uso alternativo de los datos sería más honesto y útil.