Módulo 1 — Introducción a la computación en biología
Duración estimada: 1 h (teórico)
Objetivos
Al finalizar este módulo serás capaz de:
- Explicar por qué la biología actual necesita herramientas informáticas de análisis masivo de datos.
- Reconocer los formatos de archivo más comunes en biología (CSV, FASTA, FASTQ, VCF) y para qué se usa cada uno.
¿Por qué la biología necesita informática?
Hace treinta años, un estudio típico de biología generaba datos que cabían en un cuaderno de laboratorio: unas pocas decenas de mediciones, revisables a mano. Hoy, tres áreas muy distintas de la biología comparten el mismo problema — generan más datos de los que una persona puede examinar uno a uno:
- Genómica y transcriptómica: secuenciar un solo genoma humano produce cientos de millones de fragmentos de lectura (reads); un experimento de expresión génica (RNA-seq) puede generar decenas de gigabytes de datos por muestra, y un estudio compara docenas de muestras a la vez.
- Ecología de comunidades: una red de cámaras trampa o de sensores de campo puede generar miles de observaciones al mes; un muestreo de biodiversidad con secuenciación ambiental (metabarcoding) identifica cientos de especies en una sola muestra de suelo o agua.
- Bioinformática clínica y epidemiológica: analizar un solo panel genético de un paciente implica comparar su secuencia contra bases de datos de millones de variantes conocidas.
En los tres casos, el “verlo directamente” deja de ser viable, y la pregunta pasa de “¿qué observo?” a “¿qué herramienta escribo para que el ordenador lo resuma, filtre o compare por mí?”. Ese es el problema que aborda este curso.
Formatos de datos comunes en biología
Distintos tipos de datos biológicos se guardan en formatos de texto con una estructura reconocible. Aprender a identificarlos a simple vista es el primer paso para saber qué herramienta usar con cada uno.
CSV (comma-separated values) — tablas de datos, una fila por observación, columnas separadas por comas. Es el formato más general, y lo usarás en varios módulos de este curso:
sample_id,date,site,latitude,longitude,species,count,notes
S001,2024-05-12,SiteA,40.123,-3.456,Quercus_robur,3,Adultos en borde de camino
FASTA — secuencias biológicas (ADN, ARN o proteína). Cada secuencia ocupa dos partes: una línea de cabecera que empieza por > con un identificador y, opcionalmente, una descripción, y una o más líneas siguientes con la secuencia:
>seq1|Arabidopsis_thaliana|rbcL
ATGTCACCACAAACAGAGACTATCGACTGCTGCTGCTGCTGCTGCTGCTG
FASTQ — lecturas crudas de un secuenciador (antes de cualquier análisis). Se parece a FASTA, pero cada lectura ocupa exactamente 4 líneas: identificador (empieza por @), secuencia, un separador (+), y una línea de la misma longitud con la calidad de cada base leída (cuánto se fía el secuenciador de haber leído bien esa posición):
@read1
GATTACAGATTACAGATTACA
+
IIIIIIIIIIIIIIIIIIIII
VCF (variant call format) — variantes genéticas encontradas al comparar una secuencia contra un genoma de referencia (p. ej. mutaciones puntuales). Cada línea es una posición del genoma con la base de referencia, la base alternativa encontrada, y metadatos de confianza:
##fileformat=VCFv4.2
#CHROM POS ID REF ALT QUAL FILTER INFO
1 14370 rs123 G A 29 PASS DP=14
Un archivo FASTQ real de una sola muestra de secuenciación puede tener varios gigabytes y millones de líneas: abrirlo con un editor de texto normal, o revisarlo “a ojo”, no es una opción. Necesitas comandos y scripts que lo procesen por ti — la línea de comandos y Python, que verás en los módulos siguientes.
Ejercicios
Empareja cada formato con su uso típico: CSV, FASTA, FASTQ, VCF ↔︎ tabla de observaciones de campo, secuencia de referencia de un gen, lecturas crudas de un secuenciador, lista de variantes genéticas encontradas.
Se te da este fragmento, sin decirte de qué formato es:
>seq3|Pinus_sylvestris|rbcL ATGACCATGATTACGCCAAGCTTGGCACTGCTGCTGCTGATGCGT¿Qué formato es? ¿Qué detalle del texto te lo dice?
¿Por qué no tiene sentido abrir un archivo FASTQ de varios gigabytes con un editor de texto normal y leerlo línea a línea? Relaciónalo con lo explicado sobre la necesidad de herramientas automatizadas.
Soluciones
- CSV → tabla de observaciones de campo. FASTA → secuencia de referencia de un gen. FASTQ → lecturas crudas de un secuenciador. VCF → lista de variantes genéticas.
- Es FASTA: la línea empieza por
>seguida de un identificador (aquí con formatoid|especie|gen), y la línea siguiente es una secuencia de nucleótidos. - Porque un archivo de varios gigabytes tiene millones de líneas — ni cabe cómodamente en la memoria de un editor de texto normal, ni una persona podría revisarlas todas a simple vista en un tiempo razonable. Hacen falta programas que lean el archivo por partes y apliquen automáticamente el filtro, resumen o cálculo que se necesite; eso es exactamente lo que aprenderás a construir con la línea de comandos y Python.