Por qué la fonética acústica necesita una física mínima
Los capítulos anteriores describieron la producción del habla desde la anatomía y la articulación. Entre el movimiento de los articuladores y la percepción del oyente existe, sin embargo, un objeto intermedio, la señal acústica, que es una variación de presión que se propaga a través de un medio físico y puede medirse. La fonética acústica estudia propiedades de esa señal como la frecuencia, la amplitud, la duración, el espectro, la periodicidad, el ruido y las transiciones. Comprenderlas permite pasar de descripciones impresionistas, como «habla más aguda» o «suena apagado», a propiedades mensurables (Ladefoged y Johnson, 2015).
Ese paso obliga a distinguir la propiedad física, su correlato perceptivo y su función lingüística. Una frecuencia fundamental más alta suele percibirse como un tono más agudo, aunque frecuencia y tono no son conceptos idénticos. La amplitud acústica contribuye a la percepción de la sonoridad sin determinarla de manera lineal. Un formante es una resonancia del tracto vocal, no «la frecuencia de una vocal». Este capítulo construye la base física necesaria para leer un espectrograma y entender qué representa una señal de habla.
El sonido como variación de presión
El sonido es una perturbación mecánica que se propaga en un medio elástico, como el aire. Cuando una fuente vibra, genera compresiones y rarefacciones alternadas que se desplazan por el medio. Un micrófono convierte esas fluctuaciones de presión en una señal eléctrica y después digital. En su representación temporal más simple, la forma de onda, el eje horizontal representa el tiempo y el eje vertical, la amplitud relativa. Un tono puro dibuja una sinusoide regular. El habla real es mucho más compleja, porque contiene múltiples frecuencias, ruido, cambios abruptos, transitorios y modulaciones. La forma de onda sigue siendo, aun así, el punto de partida de cualquier análisis.
Frecuencia y periodo
La frecuencia indica cuántos ciclos completos ocurren por unidad de tiempo y se mide en hercios. Un hercio equivale a un ciclo por segundo, de modo que una onda que completa 100 ciclos en un segundo tiene una frecuencia de 100 Hz. Su correlato perceptivo es la altura tonal, que en inglés se llama pitch. Una frecuencia mayor se percibe en general como un tono más agudo, aunque la relación entre la frecuencia física y la altura percibida no es lineal, porque la audición sigue propiedades psicoacústicas propias. Frecuencia física y altura tonal están estrechamente relacionadas; no son lo mismo.
El periodo es la duración de un ciclo completo. Frecuencia y periodo son inversamente proporcionales; la frecuencia es igual a uno dividido por el periodo expresado en segundos. Un periodo de 0,01 s corresponde a una frecuencia de 100 Hz. Si en una vocal se observan ciclos glóticos separados por unos 8 ms, es decir, 0,008 s, la frecuencia fundamental es de unos 125 Hz. Las herramientas computacionales hacen operaciones mucho más complejas, aunque esta relación entre periodicidad temporal y frecuencia es la base de la estimación de la frecuencia fundamental.
Amplitud y decibelios
La amplitud de presión describe cuánto se aparta la presión instantánea de su valor de equilibrio. Puede expresarse como valor de pico o como valor eficaz, conocido por la sigla inglesa RMS. Ambas medidas no deben intercambiarse sin especificarlo. En condiciones físicas comparables, la intensidad acústica es proporcional al cuadrado de la presión eficaz. Un archivo digital conserva amplitudes que dependen del micrófono, de la distancia, de la ganancia y del procesamiento, por lo que sus valores no equivalen automáticamente a una presión en pascales. Una grabación con mayor amplitud no demuestra, sin control instrumental, que el hablante haya emitido una voz más intensa. La sonoridad percibida depende, además, de la frecuencia, de la duración y del oyente.
El nivel de presión sonora se expresa en decibelios. Se obtiene multiplicando por veinte el logaritmo decimal del cociente entre la presión eficaz y una presión de referencia de 20 micropascales. La escala es logarítmica y compara una presión con esa referencia. Duplicar la presión aumenta el nivel en unos 6,02 dB, mientras que duplicar la intensidad lo aumenta en unos 3,01 dB, porque intensidad y presión son magnitudes distintas. Praat calcula la intensidad a partir del promedio de la presión al cuadrado y supone que la señal está expresada en pascales (Boersma y Weenink, s. f.). Una grabación no calibrada no adquiere valores absolutos de nivel de presión sonora por abrirse en el programa. Ajustar automáticamente su nivel tampoco recupera la presión original. Para comparar la intensidad vocal entre personas hay que documentar la calibración, la distancia, la ganancia, el equipo y las transformaciones del archivo.
Ondas simples y complejas
Una onda sinusoidal pura contiene una única frecuencia. El habla contiene, en cambio, señales complejas. Una vocal sonora tiene una estructura periódica compuesta por una frecuencia fundamental y múltiples armónicos. Según el teorema de Fourier, toda señal periódica compleja puede representarse como una suma de componentes sinusoidales, así que una forma de onda en apariencia compleja puede descomponerse en un espectro de frecuencias. La representación temporal muestra cómo cambia la amplitud a lo largo del tiempo; el espectro muestra qué frecuencias componen la señal y con qué amplitud. Son dos perspectivas sobre el mismo fenómeno.
Frecuencia fundamental y armónicos
La frecuencia fundamental, o F0, corresponde aproximadamente a la tasa de repetición de los ciclos glóticos durante la fonación periódica. Si los pliegues vocales completan unos 120 ciclos por segundo, la F0 es de unos 120 Hz. Depende de la longitud, la masa y la tensión de los pliegues vocales, así como de la presión subglótica (Titze, 2000). El hablante la varía durante el habla. La entonación consiste justamente en cambios de F0 a lo largo del tiempo. En las lenguas tonales, como el mandarín examinado en el texto LS-005, las variaciones de F0 distinguen palabras. En español participan sobre todo en la entonación, el foco, la modalidad y la expresión prosódica.
Cuando los pliegues vocales vibran de manera aproximadamente periódica, producen energía en la F0 y en sus múltiplos enteros, llamados armónicos. Con una F0 de 100 Hz, los armónicos aparecen aproximadamente en 100, 200, 300, 400 y 500 Hz, en una serie que continúa hacia frecuencias más altas. La frecuencia fundamental es el primer armónico. La fuente glótica produce, así, un espectro rico, cuya amplitud relativa modifica después el tracto vocal.
Fuente, filtro y formantes
Desde la acústica, la producción de una vocal puede describirse como una cadena en la que la fuente glótica atraviesa el filtro del tracto vocal y la señal se irradia finalmente por los labios (Fant, 1960). La fuente contiene una serie de componentes armónicos y el filtro tiene resonancias. Cuando un armónico se encuentra cerca de una resonancia del tracto, su energía se refuerza. Las regiones de resonancia se manifiestan como formantes. Los armónicos pertenecen a la estructura espectral de la fuente, mientras que los formantes reflejan las resonancias del tracto vocal (Stevens, 1998). Confundirlos es un error básico.
Los formantes se numeran como F1, F2, F3 y así sucesivamente. El texto LS-009 mostró que el F1 se relaciona con la apertura y el F2, con la anterioridad y el redondeamiento. El F3 aporta información sobre los róticos, sobre determinadas configuraciones del tracto vocal y sobre características individuales; la /ɹ/ del inglés, por ejemplo, se caracteriza por un F3 muy bajo. Los formantes no son componentes nuevos añadidos a la señal. Son regiones del espectro donde el filtro concentra la energía. Su localización depende de la forma del tracto. Como el filtro actúa sobre los armónicos disponibles, un formante puede quedar entre dos armónicos, lo que dificulta estimarlo en voces de F0 alta, como las de los niños.
Representación espectral y transformada de Fourier
Un espectro representa la energía o la amplitud en función de la frecuencia. En una vocal sonora, cada armónico aparece como una línea vertical y la envolvente que une sus extremos muestra cómo el tracto vocal modificó la fuente. Las regiones de mayor energía de esa envolvente corresponden a las resonancias formánticas. Un espectro es una instantánea o un resumen de un intervalo determinado y pierde la información temporal si se analiza aislado.
La herramienta matemática que descompone una señal en sus componentes de frecuencia es la transformada de Fourier. Basta aquí su idea básica, según la cual una señal compleja puede representarse como una combinación de componentes sinusoidales de distintas frecuencias, amplitudes y fases. En el procesamiento digital se usa habitualmente la transformada rápida de Fourier, conocida por la sigla inglesa FFT, un algoritmo eficiente para calcular la transformada discreta y estimar el espectro de segmentos de habla (Rabiner y Schafer, 1978).
Resolución temporal y frecuencial
El análisis espectral enfrenta una tensión inevitable. Una ventana temporal larga da una mejor resolución de frecuencia y una peor precisión temporal; una ventana corta mejora la resolución temporal y reduce la frecuencial. Esta tensión no es una limitación accidental del programa. Es una consecuencia de analizar una señal localizada en el tiempo. Esa misma tensión explica la diferencia entre los espectrogramas de banda ancha y de banda estrecha.
La separación entre los puntos de una FFT es igual a la frecuencia de muestreo dividida por el número de muestras analizadas. Aumentar ese número añadiendo ceros al final del segmento no agrega información sobre el intervalo observado, porque solo interpola más puntos del espectro. La capacidad de separar componentes próximos depende de la duración efectiva del análisis y de la ventana empleada. Más líneas o más píxeles no significan, por tanto, más resolución física.
Qué representa un espectrograma
Un espectrograma representa a la vez el tiempo, la frecuencia y la energía. Habitualmente, el eje horizontal corresponde al tiempo, el vertical a la frecuencia y la oscuridad o el color a la intensidad relativa. En una vocal, los formantes aparecen como bandas horizontales oscuras. El espectrograma es una de las herramientas más usadas de la fonética acústica porque permite observar cómo cambia el espectro en el tiempo.
Espectrogramas de banda ancha y de banda estrecha
Un espectrograma de banda ancha usa ventanas relativamente cortas. Tiene buena resolución temporal, muestra con claridad las transiciones y deja ver los pulsos glóticos como estrías verticales, además de los formantes. Resuelve peor los armónicos individuales. Por su capacidad para mostrar cambios rápidos, es el más usado en fonética segmental. Un espectrograma de banda estrecha usa ventanas más largas. Tiene buena resolución frecuencial, deja ver los armónicos como líneas horizontales y permite examinar la F0 y la estructura armónica, a costa de una peor resolución temporal. Los espectrógrafos analógicos usaban tradicionalmente filtros de unos 300 Hz para la banda ancha y de unos 45 Hz para la banda estrecha (Kent y Read, 2002). La elección depende de la pregunta, porque ningún espectrograma es mejor en términos absolutos.
Cómo se ve una vocal
En una vocal sonora se espera observar periodicidad, estructura armónica y bandas formánticas. En un espectrograma de banda ancha, el F1, el F2 y el F3 aparecen como bandas relativamente oscuras. Las transiciones hacia las consonantes vecinas muestran el movimiento de esas bandas. Una [i] presenta un F1 bajo y un F2 alto; una [u], un F1 y un F2 bajos; una [a], un F1 alto. Las relaciones que el texto LS-009 describió en tablas se vuelven visualmente evidentes en el espectrograma.
Oclusivas
Una oclusiva presenta varias fases acústicas. Durante el cierre se observa una reducción marcada de la energía, con una posible barra de sonoridad en las frecuencias bajas cuando la oclusiva es sonora. En la liberación aparece una explosión breve, seguida según el caso de aspiración, del comienzo de la sonoridad y de la transición hacia la vocal. El intervalo entre la explosión y el comienzo de la periodicidad permite estimar el VOT; un fenómeno articulatorio se convierte así en una medida temporal acústica.
Para observar un cierre con límites acústicos comparables conviene usar una secuencia como [apa]. Tras la primera vocal se identifica la reducción de energía compatible con el cierre, después la explosión y luego el comienzo de la periodicidad de la segunda vocal. El intervalo entre la explosión y ese comienzo corresponde al VOT cuando ambos eventos son identificables. En una [pa] situada al comienzo de una grabación, el silencio previo puede incluir tanto la ausencia de habla como el cierre articulatorio. El audio no siempre permite localizar el comienzo de ese cierre. La duración del silencio no equivale, por tanto, a la duración de la oclusión.
Fricativas
Las fricativas generan ruido aperiódico, que en el espectrograma aparece como energía distribuida de manera difusa. La distribución espectral de ese ruido depende del lugar de articulación. La [s] concentra su energía en frecuencias altas, por encima de unos 4 kHz, mientras que la [ʃ] la concentra en frecuencias algo más bajas y la [f] produce un ruido débil y difuso (Kent y Read, 2002). La acústica permite, así, distinguir lugares de articulación incluso cuando la señal carece de periodicidad.
Nasales y aproximantes
Las consonantes nasales son periódicas y tienen resonancias propias, además de antirresonancias introducidas por el acoplamiento de la cavidad nasal. En el espectrograma muestran un murmullo con energía concentrada en frecuencias bajas y una reducción de ciertos componentes. Su lectura visual requiere entrenamiento, porque un solo rasgo oscuro rara vez basta para identificar una nasal de manera fiable.
Las aproximantes tienen una estructura formántica parecida a la de las vocales, con menor intensidad y transiciones más marcadas. Las realizaciones [β̞], [ð̞] y [ɣ̞] de /b d g/ aparecen en el espectrograma como descensos de energía sin silencio ni explosión, lo que permite distinguir una realización aproximante de una oclusiva plena, como anticipó el texto LS-008.
Duración
El habla transcurre en el tiempo. Pueden medirse las duraciones de segmentos, sílabas, palabras, pausas e intervalos entre turnos, que se expresan habitualmente en segundos o en milisegundos. Una consonante puede durar unos 70 ms y una pausa, unos 600 ms. La interpretación depende del contexto. Un silencio de un segundo puede ser normal entre dos turnos y muy largo dentro de una palabra; la medida absoluta debe relacionarse, por eso, con la estructura lingüística.
Velocidad del habla
La velocidad puede expresarse en sílabas por segundo, en palabras por minuto o en segmentos por segundo. Hay que distinguir, además, la velocidad de habla, que incluye las pausas, de la velocidad de articulación, que se calcula sobre los periodos efectivamente articulados. Dos hablantes pueden tener la misma velocidad de articulación y velocidades de habla diferentes porque uno de ellos hace más pausas. La distinción importa en la investigación clínica, porque un «habla lenta» puede deberse a una articulación lenta, a muchas pausas o a ambas cosas, que son fenómenos distintos.
Latencia de respuesta
En la interacción puede medirse el intervalo entre el final del turno de una persona y el comienzo de la respuesta de otra, llamado latencia de respuesta. Depende de la complejidad de la pregunta, de la planificación, de la relación social, del estado cognitivo, de la emoción y del estilo conversacional. Stivers et al. (2009) compararon la toma de turnos en diez lenguas, desde lenguas de comunidades indígenas hasta grandes lenguas mundiales. Todas mostraron una tendencia general a evitar el solapamiento y a minimizar el silencio entre turnos. Los mismos factores explicaban, además, la variación de la velocidad de respuesta dentro de cada lengua. Las diferencias entre lenguas en el intervalo medio se mantenían dentro de unos 250 ms en torno a la media general. Una latencia prolongada debe juzgarse, por tanto, contra esa base conversacional y no equivale directamente a un bloqueo. La medición describe el tiempo; su explicación necesita información adicional.
Periodicidad, jitter y shimmer
Las vocales son típicamente cuasiperiódicas, porque los ciclos glóticos presentan pequeñas variaciones. El jitter mide la variabilidad de la duración del periodo de un ciclo a otro; el shimmer, la variabilidad de la amplitud. Ambas medidas se han usado en estudios de calidad vocal, aunque son sensibles al método, a la calidad de la grabación, al algoritmo y a la patología laríngea (Titze, 2000). Presuponen estimaciones fiables de los periodos y de las amplitudes. Los valores obtenidos en una vocal sostenida no son comparables sin más con los extraídos de una conversación. El hecho de ser numéricos tampoco los convierte en indicadores psiquiátricos. Las condiciones de cálculo y la adecuación a la tarea deben examinarse antes de cualquier análisis clínico. Estas medidas no deben usarse aisladas para inferir estados psicológicos.
Ruido
El ruido acústico puede provenir de la fricación lingüística, de la respiración, del ambiente, del micrófono o de alteraciones vocales. En el análisis de la voz se usan medidas como la relación entre armónicos y ruido. Hay que separar el ruido como componente lingüístico, el ruido como propiedad de la voz y el ruido como artefacto de grabación, que un sistema automático puede confundir. La calidad de los datos forma parte del análisis.
Muestreo y aliasing
Una señal analógica continua debe digitalizarse midiéndola a intervalos regulares. El número de muestras por segundo es la frecuencia de muestreo, cuyos valores habituales son 16 kHz, 44,1 kHz y 48 kHz. Según el teorema de Nyquist, para representar adecuadamente una frecuencia se necesita una frecuencia de muestreo superior al doble de la frecuencia máxima de interés. Con un muestreo de 16 000 Hz, la frecuencia máxima representable es teóricamente de unos 8000 Hz, antes de considerar los filtros y otros detalles prácticos. Para muchas tareas de reconocimiento de voz basta un muestreo de 16 kHz, mientras que el análisis acústico detallado puede usar frecuencias mayores. La telefonía clásica muestrea a 8 kHz y transmite una banda de unos 300 a 3400 Hz. Buena parte de la energía de la [s] queda fuera de esa banda, lo que explica que la [s] y la [f] se confundan con facilidad por teléfono, una limitación que debe tenerse en cuenta al analizar grabaciones de atenciones remotas.
Si una señal contiene frecuencias superiores al límite que permite el muestreo, aparecen en la representación digital frecuencias falsas. El fenómeno se llama aliasing y se previene con filtros aplicados antes de la digitalización. La cuestión parece técnica, aunque tiene alcance epistemológico. Una grabación digital es una representación limitada por el muestreo, la cuantización, el micrófono y el ambiente. No es una copia infinita ni transparente de la señal original. Todo análisis depende de la calidad de esa representación.
Cuantización
Además del tiempo, la amplitud debe discretizarse. El número de bits determina cuántos niveles de amplitud pueden representarse. Cada bit añade unos 6 dB de rango dinámico teórico, de modo que 16 bits permiten unos 96 dB y 24 bits, unos 144 dB, con un error de cuantización menor. Para el análisis lingüístico corriente, esa diferencia importa menos que la calidad del micrófono, la distancia y el ruido ambiental. Una metodología rigurosa debe, en todo caso, documentar las condiciones de grabación.
Praat y los límites de la medición automática
Praat, desarrollado por Paul Boersma y David Weenink en la Universidad de Ámsterdam, es uno de los programas más usados en fonética (Boersma y Weenink, s. f.). Permite visualizar ondas, generar espectrogramas, estimar la F0, medir formantes y duraciones, anotar segmentos y automatizar análisis mediante guiones. Su difusión se debe a que es gratuito y flexible y a que lo usa una comunidad amplia. El programa no decide, sin embargo, qué medida es correcta. Cada algoritmo tiene parámetros. Estimar la F0 exige definir un rango de frecuencias, una ventana y criterios de sonoridad. Un rango inadecuado produce errores.
Una estimación de 220 Hz parece objetiva y puede ser incorrecta si el algoritmo duplicó la frecuencia real de una voz de 110 Hz, la dividió por dos, siguió un armónico o analizó ruido. Por eso el investigador debe inspeccionar el contorno, el espectrograma y la señal y juzgar la plausibilidad del resultado (Harrington, 2010). La medición automática reduce el trabajo sin eliminar la evaluación crítica.
Señal física, altura tonal y sonoridad
El sistema auditivo transforma la señal acústica. La percepción depende de la sensibilidad espectral, de la integración temporal, del contexto y de las categorías lingüísticas del oyente. Dos señales físicamente diferentes pueden percibirse como equivalentes. Una señal ambigua, a su vez, puede percibirse de distinto modo según el contexto. La fonética acústica describe el estímulo; la fonética auditiva estudia cómo se procesa. El texto LS-011 desarrolla la relación entre ambas.
La altura tonal no es simplemente la frecuencia. Depende de la F0, de los armónicos, del rango auditivo y del contexto. Puede incluso percibirse una frecuencia fundamental ausente de la señal cuando están presentes armónicos compatibles con ella, un fenómeno conocido como fundamental ausente. La F0 de muchas voces masculinas, de unos 100 a 120 Hz, queda por debajo de la banda telefónica. Los oyentes perciben aun así su altura correcta, porque el sistema auditivo reconstruye la periodicidad a partir de las relaciones entre armónicos. La sonoridad tampoco equivale a la amplitud física. La sensibilidad humana varía con la frecuencia. Las curvas de igual sonoridad muestran que se necesitan niveles físicos distintos para que tonos de diferentes frecuencias se perciban igual de fuertes (Johnson, 2012). Al comparar señales no basta, por eso, con mirar la amplitud bruta.
Qué puede medir la acústica clínica
Las medidas de F0, intensidad, duración, pausas y formantes pueden incorporarse a la investigación clínica, aunque sus nombres no especifican ninguna enfermedad. Antes de hablar de un marcador hay que separar tres preguntas, que son si la medida difiere entre grupos, si clasifica casos nuevos con un rendimiento útil y si identifica un mecanismo causal. Ninguna respuesta se sigue automáticamente de las otras. La evaluación de la disartria, por ejemplo, examina alteraciones de distintos subsistemas del habla dentro de una evaluación integrada (American Speech-Language-Hearing Association [ASHA], s. f.). Esa práctica no autoriza a atribuir a la depresión o a la esquizofrenia una firma acústica específica. Las aplicaciones psiquiátricas de la acústica son, por ahora, problemas de investigación; su validación diagnóstica está pendiente.
La voz depresiva
La expresión «voz depresiva» es conceptualmente insuficiente. Puede descomponerse en variables como una F0 media más baja, una menor variabilidad de la F0, una intensidad menor, una velocidad reducida y pausas más largas. La revisión de Cummins et al. (2015) recoge asociaciones de este tipo en estudios de grupo, junto con una gran heterogeneidad de métodos y de corpus. Incluso cuando el patrón aparece, puede deberse también a la fatiga, a la sedación, al dolor, a una hipofonía neurológica o al estilo individual. La fonética acústica obliga a especificar qué propiedad se observa, sin convertir esa propiedad en una etiología.
Presión del habla
En la clínica de la manía se usa el concepto de presión del habla. Acústicamente podría relacionarse con una velocidad de articulación alta, pausas breves, turnos prolongados, dificultad para ser interrumpido e intensidad variable. La presión del habla es, sin embargo, una categoría clínica más amplia que cualquier variable acústica aislada. Pueden medirse sus componentes, aunque la categoría completa no debe identificarse con un número.
De la onda a los modelos computacionales
Los sistemas automáticos pueden trabajar directamente con el audio o con representaciones intermedias. Históricamente usaron espectros, energía, estimaciones de la F0 y coeficientes cepstrales en la escala de mel, conocidos por la sigla inglesa MFCC. Los sistemas neuronales actuales pueden aprender sus propias representaciones a partir de la onda o de transformaciones espectrales. Todas estas técnicas parten del mismo objeto físico, una señal temporal digitalizada. La ingeniería cambia la representación; la acústica sigue siendo su base.
Muchos sistemas usan como entrada representaciones de tiempo y frecuencia semejantes a espectrogramas, en las que cada región codifica la energía de un intervalo temporal y de un rango de frecuencias. Un modelo puede aprender patrones asociados a fonemas, a palabras, a hablantes o al ruido, que no tienen por qué corresponder a las categorías de un fonetista. Reaparece aquí la diferencia entre una representación interpretada por personas y una representación optimizada para una tarea.
Biomarcadores vocales y prudencia
Existe un interés creciente por usar la voz como fuente de biomarcadores digitales, con propuestas para detectar la depresión, el deterioro cognitivo, la enfermedad de Parkinson o el estrés. El potencial es real, como lo son los riesgos metodológicos. Las variables vocales dependen de la edad, el idioma, el dialecto, el sexo, el micrófono, el ambiente, la medicación, las enfermedades respiratorias y la hora del día. Un sistema puede aprender correlaciones espurias con cualquiera de ellas. De ahí que una clasificación automática necesite una validación externa rigurosa. Disponer de miles de características acústicas no resuelve los problemas de causalidad, generalización y sesgo.
Cómo leer una señal
Un análisis básico de una grabación puede seguir cinco pasos. El primero examina la forma de onda, con sus duraciones, sus pausas, sus transitorios y su amplitud. El segundo establece si existe estructura periódica. El tercero recorre el espectrograma en busca de formantes, ruido, explosiones y transiciones. El cuarto analiza la F0, su nivel, su contorno y su estabilidad. Solo el quinto obtiene medidas específicas, como formantes, VOT, duraciones o intensidad. En todos los casos, la medida debe derivarse de una pregunta.
El espectrograma no muestra palabras
Un espectrograma no contiene etiquetas naturales como /p/, /a/ o /t/. Muestra energía acústica, que el analista interpreta con su conocimiento fonético. La segmentación tampoco tiene siempre fronteras claras, porque la coarticulación y las transiciones extienden las propiedades de un segmento hacia sus vecinos. La anotación fonética implica, por eso, una teoría. Leer un espectrograma no equivale a leer una señal transparente.
Señal, dato y representación
Este capítulo permite volver a una distinción del texto LS-001. La señal acústica es un fenómeno físico. La grabación digital es una representación muestreada de esa señal, el espectrograma una transformación matemática de la grabación, la anotación fonética una interpretación especializada y la medición un valor obtenido mediante un procedimiento. Del evento de habla se pasa así a la grabación, de esta a una representación, luego a una medición y finalmente a una interpretación. Cada paso introduce decisiones. Reconocerlo no vuelve subjetiva la fonética. Permite, en cambio, identificar dónde pueden aparecer los errores.
Síntesis
La fonética acústica estudia la señal física que conecta la producción con la percepción. El sonido consiste en variaciones de presión que pueden representarse como ondas temporales. La frecuencia expresa ciclos por segundo y el periodo es su inverso; la amplitud expresa la magnitud de la variación de presión, que los decibelios miden en una escala logarítmica. Las señales periódicas complejas pueden descomponerse en componentes de frecuencia mediante el análisis de Fourier. La F0 se relaciona con la periodicidad laríngea, los armónicos aparecen como sus múltiplos y los formantes corresponden a resonancias del tracto vocal que modifican la distribución de energía de esos armónicos. El espectro representa la energía según la frecuencia. El espectrograma añade el tiempo, con compromisos distintos entre resolución temporal y frecuencial en la banda ancha y en la estrecha. Oclusivas, fricativas, nasales, aproximantes y vocales generan patrones acústicos diferentes. La digitalización introduce muestreo y cuantización. Los programas automatizan el análisis con resultados que requieren inspección y criterios explícitos. La relación entre acústica y percepción no es biunívoca, porque el sistema auditivo categoriza, normaliza y reconstruye información. En la clínica y en la inteligencia artificial, la lección principal es metodológica. Una variable acústica puede ser muy precisa sin ser específica de una causa.
El texto LS-011 estudia la coarticulación y la percepción del habla, es decir, cómo una señal continua y variable puede segmentarse y reconocerse como un conjunto de unidades lingüísticas relativamente estables.
Referencias
American Speech-Language-Hearing Association. (s. f.). Dysarthria in adults [Practice portal]. https://www.asha.org/practice-portal/clinical-topics/dysarthria-in-adults/
Boersma, P. y Weenink, D. (s. f.). Praat: Doing phonetics by computer [Software]. Universidad de Ámsterdam. https://www.fon.hum.uva.nl/praat/
Cummins, N., Scherer, S., Krajewski, J., Schnieder, S., Epps, J. y Quatieri, T. F. (2015). A review of depression and suicide risk assessment using speech analysis. Speech Communication, 71, 10–49. https://doi.org/10.1016/j.specom.2015.03.004
Fant, G. (1960). Acoustic theory of speech production. Mouton.
Harrington, J. (2010). Phonetic analysis of speech corpora. Wiley-Blackwell.
Johnson, K. (2012). Acoustic and auditory phonetics (3.ª ed.). Wiley-Blackwell.
Kent, R. D. y Read, C. (2002). The acoustic analysis of speech (2.ª ed.). Singular/Thomson Learning.
Ladefoged, P. y Johnson, K. (2015). A course in phonetics (7.ª ed.). Cengage.
Rabiner, L. R. y Schafer, R. W. (1978). Digital processing of speech signals. Prentice-Hall.
Stevens, K. N. (1998). Acoustic phonetics. MIT Press.
Stivers, T., Enfield, N. J., Brown, P., Englert, C., Hayashi, M., Heinemann, T., Hoymann, G., Rossano, F., de Ruiter, J. P., Yoon, K.-E. y Levinson, S. C. (2009). Universals and cultural variation in turn-taking in conversation. Proceedings of the National Academy of Sciences, 106(26), 10587–10592. https://doi.org/10.1073/pnas.0903616106
Titze, I. R. (2000). Principles of voice production. National Center for Voice and Speech.