De la teoría general al análisis material del habla
Los capítulos anteriores trabajaron sobre todo con problemas conceptuales, como qué es un signo, cómo se organiza un sistema lingüístico o qué relaciones existen entre selección y combinación. Con este capítulo comienza un bloque técnico, cuyo objeto inmediato es el habla como fenómeno físico, fisiológico y analizable. La fonética estudia los sonidos del habla sin suponer que todas las diferencias acústicas o articulatorias tengan la misma función lingüística, una cuestión que corresponde sobre todo a la fonología. La fonética describe cómo se producen, se transmiten y se perciben los sonidos; la fonología estudia cómo una lengua los organiza en contrastes y patrones. La separación es metodológica. Para saber si dos realizaciones pertenecen a un mismo fonema se necesitan datos fonéticos, mientras que el conocimiento fonológico influye a su vez en la percepción de la señal.
El capítulo trata tres problemas, que son cómo se genera físicamente el habla, cómo se clasifican articulatoriamente los sonidos y cómo se representan de manera sistemática mediante el Alfabeto Fonético Internacional (AFI). El objetivo es aprender a describir un sonido mediante propiedades explícitas y reproducibles, algo más útil que memorizar una tabla completa de símbolos (Ashby y Maidment, 2005; Ladefoged y Johnson, 2015).
El habla como transformación de energía
La producción vocal transforma de manera coordinada una energía respiratoria en una señal acústica estructurada. En la mayor parte del habla humana, el aire procede de los pulmones. La contracción y la relajación de los músculos respiratorios generan diferencias de presión que impulsan una corriente de aire hacia la laringe y el tracto vocal.
El proceso puede dividirse analíticamente en tres sistemas. El respiratorio aporta el flujo de aire y la presión necesaria. El fonatorio, formado por la laringe y en particular por los pliegues vocales, regula si el flujo produce vibración periódica, turbulencia u otros patrones. El articulatorio o supralaríngeo comprende la lengua, los labios, el paladar, los dientes, la mandíbula y el velo, que modifican el flujo y las resonancias. La señal final depende de la coordinación temporal de los tres. La división es útil porque una alteración observable puede originarse en componentes distintos. Una voz débil, una articulación imprecisa y una velocidad reducida no son necesariamente el mismo fenómeno ni obedecen al mismo mecanismo.
La corriente de aire
Casi todos los sonidos del español usan una corriente de aire pulmonar egresiva, que sale de los pulmones hacia el exterior. Otras lenguas usan además mecanismos glotálicos o velares (Catford, 2001). Las eyectivas se producen con un cierre glótico que comprime el aire de la boca; el quechua del Cusco y el aimara, por ejemplo, las tienen, como en el quechua t'anta 'pan'. Las implosivas y los clics, estos últimos característicos de lenguas del sur de África como el zulú o el xhosa, amplían todavía más el repertorio. Estas categorías muestran que el aparato vocal humano permite una diversidad fonética mucho mayor que la que usa cualquier lengua individual. Recuerdan, además, que las propiedades del español no deben confundirse con propiedades universales del habla. Por eso la fonética necesita una notación capaz de describir sonidos que no existen en la propia lengua.
La laringe y los pliegues vocales
La laringe contiene los pliegues vocales. El espacio entre ellos se llama glotis. Según su configuración, los pliegues pueden aproximarse, separarse, vibrar o impedir momentáneamente el paso del aire. La oposición más conocida distingue los sonidos sonoros, con vibración periódica de los pliegues, de los sordos, que carecen de ella durante la porción pertinente. /p/ y /b/ pueden articularse con el mismo cierre bilabial y se diferencian principalmente por la actividad laríngea, porque en español /p/ es típicamente sorda y /b/ pertenece a la serie sonora. Incluso esta descripción requiere matices, ya que la realización concreta depende del contexto y de la variedad. La sonoridad no es, además, una propiedad binaria simple. Las lenguas usan distintos ajustes laríngeos y temporales, como la aspiración, la voz murmurada o la voz laringealizada, que en inglés se llama creaky voice (Laver, 1994).
Fuente y filtro
La teoría de la fuente y el filtro es una manera clásica de entender la producción vocal (Stevens, 1998). La laringe genera una fuente acústica y el tracto vocal actúa como un filtro que modifica la distribución de la energía en las distintas frecuencias. Los pliegues vocales producen una señal rica en armónicos. La forma del tracto refuerza algunas bandas de frecuencia y atenúa otras. Las resonancias resultantes se llaman formantes. La identidad acústica de una vocal depende en gran medida de ellas; su calidad refleja sobre todo la configuración del tracto vocal (Johnson, 2012). El capítulo 10 desarrolla esta teoría con detalle.
El tracto vocal
Por encima de la laringe se encuentran varias cavidades. La faringe conecta la laringe con las cavidades oral y nasal. La cavidad oral incluye la lengua, los dientes, los alvéolos, el paladar y los labios. La cavidad nasal participa cuando el velo del paladar desciende y deja pasar el aire hacia la nariz; cuando se eleva, cierra esa vía. En /m/, el cierre de los labios se combina con el descenso del velo; el aire sale entonces por la nariz. En /b/, el mismo cierre bilabial se produce con la vía nasal cerrada. La diferencia entre oralidad y nasalidad corresponde, así, a una configuración fisiológica específica.
Articuladores activos y pasivos
Para describir las consonantes es útil distinguir los articuladores activos de los pasivos. El articulador activo es la estructura que se mueve, como el labio inferior, la punta, la lámina o el dorso de la lengua. El pasivo es la superficie hacia la que se dirige el movimiento, como el labio superior, los dientes superiores, los alvéolos, el paladar duro o el velo. Esta relación define el lugar de articulación. En una consonante bilabial participan ambos labios; en una labiodental, el labio inferior se acerca a los dientes superiores. Cada denominación expresa una hipótesis anatómica sobre dónde se produce la constricción principal.
Tres dimensiones de las consonantes
La descripción articulatoria de una consonante suele organizarse en tres dimensiones, que son el estado laríngeo, el lugar de articulación y el modo de articulación. /p/ es, así, una consonante oclusiva bilabial sorda y /m/, una nasal bilabial sonora. La clasificación convierte una impresión auditiva en un conjunto explícito de propiedades. Dos sonidos pueden compartir dos dimensiones y diferir en la tercera, una estructura que permite estudiar después los contrastes fonológicos.
Lugares de articulación
En las consonantes bilabiales participan ambos labios, como en /p/, /b/ y /m/. En las labiodentales el labio inferior se aproxima a los dientes superiores, como en /f/. En las dentales la lengua entra en contacto con los dientes superiores o se acerca mucho a ellos; en muchas variedades del español, /t/ y /d/ son dentales o dentoalveolares. En las alveolares la lengua se aproxima a la zona situada detrás de los dientes superiores, como ocurre con la /s/ de muchas variedades, con /n/, con /l/ y con las vibrantes. Las postalveolares tienen la constricción algo más atrás; el español general tiene aquí menos contrastes que lenguas como el inglés. En las palatales la lengua se aproxima al paladar duro. En las velares el dorso de la lengua se acerca al velo, como en /k/, /g/ y la /x/ de numerosas variedades.
Otros lugares tienen menor participación en el inventario del español, aunque aparecen en sus variedades o en otras lenguas. En el norte y el centro de España, la /x/ se realiza a menudo como uvular, [χ]. El árabe tiene consonantes faríngeas. La [h] glotal aparece en el español de Chile como realización frecuente de la /s/ a final de sílaba. Estas categorías muestran la amplitud del espacio fonético humano.
Modos de articulación
El modo describe cómo se modifica la corriente de aire. En las oclusivas, como /p/, /t/ y /k/, el tracto oral se cierra por completo durante un intervalo y la liberación del cierre produce un cambio acústico característico. En las fricativas, como /f/, /s/ y /x/, el aire atraviesa una constricción estrecha que genera turbulencia. En las aproximantes los articuladores se acercan sin producir esa turbulencia. En español, las realizaciones de /b d g/ entre segmentos sonoros suelen describirse como aproximantes o como fricativas muy abiertas, según el marco. En las nasales, como /m/, /n/ y /ɲ/, existe un cierre oral y el velo desciende, lo que permite la salida de aire por la nariz. En las laterales, como /l/, el centro del tracto queda obstruido y el aire escapa por uno o ambos lados de la lengua. En las vibrantes, por último, un articulador realiza uno o varios contactos breves. El español distingue tradicionalmente la vibrante simple /ɾ/ de la múltiple /r/, como en pero y perro, diferencia que en muchas variedades distingue significados.
Africadas
Una africada comienza con un cierre completo y continúa con una liberación fricativa tan integrada que se comporta como una unidad. El sonido de ch en chico, que se transcribe [tʃ], es un ejemplo frecuente en español. Las africadas muestran que las categorías articulatorias no son cajones simples, porque el tiempo y la coordinación entre gestos forman parte de la estructura fonética.
La articulación como movimiento
Los manuales suelen presentar las consonantes como posturas estáticas, aunque el habla es movimiento. Un hablante no coloca la lengua en una posición independiente, produce un sonido y reinicia desde cero para el siguiente. Los gestos articulatorios se superponen, un fenómeno llamado coarticulación. La /s/ de su se pronuncia ya con los labios redondeados, anticipando la /u/, mientras que la de si se produce con los labios extendidos. La lengua puede comenzar a desplazarse hacia la articulación siguiente antes de que termine el segmento en curso. Los segmentos fonéticos son, por eso, abstracciones útiles sobre una señal continua. El capítulo 11 estudia la coarticulación y sus consecuencias para la percepción.
Las vocales
Las vocales se producen sin una constricción lo bastante estrecha para obstruir de manera importante el flujo de aire oral. Se describen según la altura de la lengua, su anterioridad o posterioridad y el redondeamiento de los labios. Estas categorías son dimensiones continuas y aproximadas que permiten organizar el espacio vocálico, sin corresponder a coordenadas anatómicas discretas.
La altura describe aproximadamente la posición vertical de la lengua y se relaciona acústicamente con el primer formante. Sus grados tradicionales van de cerrada a abierta, pasando por semicerrada, media y semiabierta. El español tiene en muchas variedades un sistema de cinco vocales fonológicas, /i e a o u/, cuyas realizaciones concretas varían; no todas las /e/ de un hablante tienen la misma posición articulatoria ni los mismos valores acústicos. Según su anterioridad, /i/ y /e/ son anteriores, /a/ es central y /o/ y /u/ son posteriores. La clasificación es comparativa, porque ningún punto anatómico convierte de pronto una vocal en anterior. En español, las vocales posteriores /o/ y /u/ se producen con redondeamiento. Otras lenguas combinan estas propiedades de otro modo. El francés lune y el alemán schön, por ejemplo, tienen vocales anteriores redondeadas, lo que muestra que el sistema español usa solo una parte del espacio articulatorio disponible. El capítulo 9 desarrolla el estudio de las vocales.
Por qué se necesita una transcripción fonética
La ortografía no es una representación científica suficiente de los sonidos. La letra g representa sonidos diferentes en gato y en gente, mientras que grafías distintas, como las de queso y kilo, representan el mismo fonema /k/. La escritura convencional está condicionada por la historia, la morfología y las normas ortográficas, además de la pronunciación. Para describir sonidos de manera comparable entre lenguas se necesita otro sistema. El Alfabeto Fonético Internacional, que en inglés se abrevia IPA, se desarrolló justamente para representar de manera sistemática los sonidos del habla, asociando símbolos convencionales a categorías fonéticas precisas (International Phonetic Association, 1999).
Corchetes y barras
La transcripción lingüística usa corchetes para la representación fonética y barras oblicuas para la fonológica. /b/ representa un fonema, cuyas realizaciones en español incluyen, simplificando, [b] y [β̞]. Las barras indican una unidad abstracta del sistema; los corchetes, una realización. La convención evita confundir niveles de análisis.
Transcripción amplia y estrecha
No todas las transcripciones necesitan el mismo grado de detalle. Una transcripción amplia representa los contrastes principales y omite variaciones previsibles o ajenas a la pregunta, como [ˈkasa] para casa. Una transcripción estrecha añade información mediante símbolos y diacríticos, como la aspiración, la nasalización, la dentalización, la duración o el ensordecimiento. La transcripción adecuada depende de la pregunta, porque un exceso de detalle puede ser tan poco útil como una descripción demasiado pobre. Conviene registrar el detalle necesario para responder la pregunta sin introducir distinciones irrelevantes.
La distinción entre transcripción amplia y estrecha es independiente de la que separa lo fonético de lo fonológico. La primera concierne al grado de detalle de una transcripción fonética; la segunda, al nivel representado. Una transcripción fonética amplia sigue escribiéndose entre corchetes y no se vuelve fonológica por omitir diacríticos.
Símbolos del AFI para el español
Muchos símbolos del AFI resultan intuitivos para un hispanohablante, como [p], [t], [k], [m], [n], [f], [s] y las cinco vocales. Otros requieren un aprendizaje específico, como los que recoge la tabla 7.1.
Tabla 7.1. Símbolos del AFI de uso frecuente en la transcripción del español
| Símbolo | Descripción | Ejemplo |
|---|---|---|
| [ɲ] | Nasal palatal | año |
| [ɾ] | Vibrante simple | pero |
| [r] | Vibrante múltiple | perro |
| [x] | Fricativa velar sorda | jota, gente |
| [tʃ] | Africada postalveolar sorda | chico |
| [β̞] | Aproximante bilabial sonora | lobo |
| [ð̞] | Aproximante dental sonora | cada |
| [ɣ̞] | Aproximante velar sonora | lago |
El diacrítico de descenso que distingue las aproximantes se escribe bajo el símbolo, como en [β̞]. Cuando el símbolo tiene un trazo descendente, como la [ɣ], puede escribirse a su derecha, [ɣ˕]. El detalle de algunos símbolos y diacríticos varía según la tradición descriptiva, lo que refleja que toda transcripción selecciona un nivel de precisión.
Las realizaciones de /b/ y /d/
La letra v de vaso no corresponde en el español aquí descrito a un fonema /v/, por lo que la palabra se analiza como /ˈbaso/. La tabla 7.2 compara dos contextos para separar la grafía, el fonema y la realización.
Tabla 7.2. Realizaciones de /b/ en dos contextos
| Expresión | Representación fonológica | Realización amplia ilustrativa |
|---|---|---|
| un vaso | /un ˈbaso/ | [um ˈbaso] |
| ese vaso | /ˈese ˈbaso/ | [ˈese ˈβ̞aso] |
En un vaso, la nasal precedente favorece una realización oclusiva, [b]. La nasal, a su vez, se asimila a la bilabial y se pronuncia [m]. En ese vaso, la /b/ queda entre vocales y puede realizarse como aproximante, [β̞]. El primer contexto ilustra, por tanto, la realización oclusiva; el segundo, la aproximante entre vocales. Las transcripciones ilustran un patrón descriptivo; no son registros de una grabación ni reglas exentas de variación. El diacrítico de descenso permite, además, distinguir la fricativa [β] de la aproximante [β̞] (International Phonetic Association, 1999).
La /d/ presenta una variación semejante. En «Dame eso», dicha después de una pausa, es oclusiva. En cada puede realizarse como aproximante dental, [ð̞]. En ciertas variedades y estilos llega a reducirse mucho o a perderse, como en la pronunciación [kanˈsao] de cansado. En la generalización descriptiva tradicional, la /d/ es oclusiva también después de lateral, como en el dato, además de después de pausa o de nasal. Esa condición lateral no se extiende a /b/ ni a /g/. El grado de cierre puede variar, además, con la prosodia, la velocidad y la variedad (Martínez-Celdrán et al., 2003, p. 257). La forma fonética de un segmento depende, así, del contexto, la velocidad, la variedad, el estilo y el hablante. La pronunciación real se aleja de una secuencia rígida de fonemas idealizados.
El AFI y la norma
El AFI es una herramienta descriptiva que no determina cómo debería hablar una persona. Si dos variedades pronuncian una palabra de manera diferente, ambas pronunciaciones pueden transcribirse. Las variedades del español difieren, por ejemplo, en el seseo o la distinción entre /s/ y /θ/, en el yeísmo, en las realizaciones de /s/ y en sus patrones prosódicos. La transcripción permite describir esas diferencias sin clasificarlas como errores, una separación entre fonética y norma que el libro mantendrá.
La transcripción como modelo
La grabación acústica y la transcripción no son equivalentes. La señal contiene una gran cantidad de información continua, de la que la transcripción selecciona las propiedades consideradas pertinentes. Una transcripción puede omitir microvariaciones de frecuencia, la intensidad exacta, la duración precisa o la calidad de la voz. Es, por tanto, una representación analítica de la señal, distinta de una copia. Dos investigadores pueden transcribir de manera diferente un mismo fragmento si trabajan con preguntas distintas. La calidad de una transcripción se evalúa por la explicitud de sus criterios, su consistencia y su adecuación al objetivo.
Transcripción fonética y transcripción conversacional
La transcripción fonética representa segmentos, alófonos, diacríticos y rasgos prosódicos. La transcripción conversacional representa, en cambio, turnos, solapamientos, pausas, alargamientos, interrupciones y cambios de volumen. El sistema de Jefferson (2004), usado en el análisis de la conversación, indica por ejemplo la duración de las pausas en décimas de segundo, marca con corchetes el comienzo de un solapamiento y con dos puntos el alargamiento de un sonido. El capítulo 4 mencionó las convenciones de Mondada para la transcripción multimodal. Cada sistema responde a preguntas diferentes. Una transcripción clínica puede necesitar, además, otras decisiones. Ninguna transcripción es óptima para todos los propósitos.
Fiabilidad de la transcripción
La transcripción introduce decisiones humanas y puede generar desacuerdos entre transcriptores. Esos desacuerdos pueden deberse a la mala calidad acústica, a una articulación reducida, al ruido, a diferencias dialectales, a categorías ambiguas o a un entrenamiento insuficiente. En investigación hay que documentar quién transcribió, con qué criterios, a partir de qué material acústico y cómo se resolvieron las discrepancias. Esa documentación convierte una práctica en apariencia artesanal en un procedimiento controlable.
Variación entre realizaciones y entre variedades
Una persona no produce exactamente la misma señal cada vez que dice una palabra. Varían la duración, la intensidad, la frecuencia fundamental, la posición articulatoria, la velocidad y la coarticulación. Existen también diferencias entre hablantes, que dependen de la anatomía, la edad, el sexo, la historia lingüística, la región, el estilo y la situación. La fonética trabaja, por tanto, con variación. Su desafío consiste en distinguir la variación irrelevante para un análisis de la sistemática, de la social y del contraste lingüístico. La variación no impide identificar patrones.
Los ejemplos en español son numerosos. La /s/ a final de sílaba puede mantenerse, aspirarse o perderse según la variedad, el hablante y el contexto, con realizaciones aproximadas como [s], [h] o su ausencia. En el español de Chile, los mismos puede pronunciarse [loh ˈmihmoh]. Esa pronunciación es una propiedad sistemática de una variedad, que la sociolingüística estudia según la región, la edad, la clase social, el registro y la situación. La fonética da las herramientas para describir estas variantes sin convertir una norma estándar en criterio de verdad lingüística (Quilis, 1993).
Aplicación clínica
En medicina y en psiquiatría pueden observarse cambios en el volumen, la velocidad, la articulación, la prosodia, la fluidez, la latencia y la calidad de la voz. La descripción debe preceder, en todos los casos, a la inferencia. Hablar de una «voz depresiva» mezcla una propiedad acústica con una interpretación diagnóstica. Es mejor describir un «habla de baja intensidad, ritmo lento y escasa variación prosódica» y evaluar después si ese patrón es compatible con una depresión, un parkinsonismo, una sedación, fatiga o el estilo basal de la persona. La precisión fonética reduce los errores de atribución.
La disartria afecta la ejecución motora del habla y puede modificar la articulación, la respiración, la fonación, la resonancia y la prosodia, sin alterar necesariamente la sintaxis, la semántica ni el razonamiento. Su evaluación examina por separado esos subsistemas (American Speech-Language-Hearing Association [ASHA], s. f.). Un paciente puede producir un habla difícil de entender y conservar una organización lingüística compleja. Confundir la inteligibilidad reducida con un pensamiento desorganizado sería un error clínico grave, lo que muestra la utilidad de separar la fonética de los niveles superiores.
Los fármacos y las sustancias pueden producir enlentecimiento, articulación imprecisa, disminución de la intensidad o alteraciones de la coordinación. Ninguna propiedad aislada permite identificar de manera fiable una sustancia específica. La fonética describe el fenómeno y la etiología requiere integración clínica, incluso cuando una asociación parece intuitiva. La prosodia, por su parte, permite localizar un cambio en el ritmo, la duración, la intensidad o la frecuencia fundamental, aunque su origen exige información independiente. El capítulo 15 examina la evidencia sobre los patrones prosódicos asociados a trastornos psiquiátricos y sus límites.
Del audio al texto en los sistemas de IA
Un sistema de reconocimiento de voz recibe una señal acústica digitalizada y debe resolver, antes de producir texto, problemas como la segmentación, el ruido, la variación entre hablantes, el acento, la velocidad y la coarticulación. Los sistemas actuales aprenden representaciones directamente a partir de grandes cantidades de audio. Su salida textual elimina, sin embargo, parte de la información original. Si una grabación se convierte en el texto «estoy bien», pueden perderse la entonación, la duración, el temblor de la voz, el volumen y las pausas. La transcripción automática es una transformación con pérdida de información. En las aplicaciones clínicas, decidir qué conservar es una cuestión metodológica y ética.
Un sistema puede transcribir correctamente una frase como «No sé si quiero seguir». Esa exactitud demuestra la capacidad de convertir una señal en unidades lingüísticas, aunque no demuestra que el sistema haya interpretado la ambigüedad, el contexto, el riesgo o la intención. El reconocimiento automático y la interpretación clínica operan en niveles distintos. Un diseño seguro debe distinguir las inferencias que el sistema puede hacer de las que requieren evaluación humana e información adicional.
Cómo describir un sonido
Ante una consonante desconocida puede seguirse una secuencia de preguntas. La primera es si hay vibración laríngea, es decir, si el sonido es sonoro o sordo, con los matices necesarios. La segunda es dónde se produce la constricción; la tercera, cómo se modifica el flujo de aire. La cuarta pregunta si participa la cavidad nasal. La quinta, por último, busca propiedades adicionales, como la aspiración, la duración, la lateralidad o la retroflexión. Una vocal se describe, en cambio, por su altura, su anterioridad y su redondeamiento, además de propiedades como la nasalización, la duración contrastiva o un tipo particular de fonación. En ambos casos, la descripción debe poder entenderse con independencia de la ortografía.
Del AFI importa comprender, en esta etapa, por qué la ortografía es insuficiente, qué diferencia hay entre los corchetes y las barras, cómo se describe articulatoriamente un sonido, qué información añade un diacrítico y por qué toda transcripción selecciona un nivel de detalle. La tabla completa del AFI se vuelve familiar con el uso. Memorizarla sin comprender las dimensiones articulatorias tendría poco valor. La lectura de sus convenciones debe complementarse, además, con práctica auditiva sobre grabaciones anotadas.
Síntesis
Este capítulo presentó el habla como objeto físico y fisiológico. La producción vocal depende de la coordinación entre la respiración, la fonación y la articulación. Las consonantes se describen principalmente por su estado laríngeo, su lugar y su modo de articulación; las vocales, por su altura, su anterioridad y su redondeamiento. El AFI permite representar los sonidos sin depender de las convenciones ortográficas de una lengua. La distinción entre la representación fonológica entre barras y la realización fonética entre corchetes debe mantenerse desde ahora. Una transcripción es un modelo construido con un propósito analítico. La variación fonética depende del contexto, el dialecto, el estilo, la anatomía y el estado fisiológico, de modo que una pronunciación distinta del estándar escrito no es por sí misma un error. En la clínica, la fonética permite describir propiedades de la voz y del habla sin convertirlas de inmediato en diagnósticos. En los sistemas de IA, recuerda que convertir audio en texto implica perder información potencialmente pertinente.
El capítulo 8 estudia con más detalle las consonantes a partir del lugar, el modo, la sonoridad, la coordinación laríngea y el contraste articulatorio, con un uso sistemático del AFI y comparaciones entre el español y otras lenguas.
Referencias
American Speech-Language-Hearing Association. (s. f.). Dysarthria in adults [Practice portal]. https://www.asha.org/practice-portal/clinical-topics/dysarthria-in-adults/
Ashby, M. y Maidment, J. (2005). Introducing phonetic science. Cambridge University Press.
Catford, J. C. (2001). A practical introduction to phonetics (2.ª ed.). Oxford University Press.
International Phonetic Association. (1999). Handbook of the International Phonetic Association: A guide to the use of the International Phonetic Alphabet. Cambridge University Press.
Jefferson, G. (2004). Glossary of transcript symbols with an introduction. En G. H. Lerner (Ed.), Conversation analysis: Studies from the first generation (pp. 13–31). John Benjamins. https://doi.org/10.1075/pbns.125.02jef
Johnson, K. (2012). Acoustic and auditory phonetics (3.ª ed.). Wiley-Blackwell.
Ladefoged, P. y Johnson, K. (2015). A course in phonetics (7.ª ed.). Cengage.
Laver, J. (1994). Principles of phonetics. Cambridge University Press.
Martínez-Celdrán, E., Fernández-Planas, A. M. y Carrera-Sabaté, J. (2003). Castilian Spanish. Journal of the International Phonetic Association, 33(2), 255–259.
Quilis, A. (1993). Tratado de fonología y fonética españolas. Gredos.
Stevens, K. N. (1998). Acoustic phonetics. MIT Press.