Lompat ke isi

Korpus teks: Perbedaan antara revisi

Ensiklopedia Pengetahuan Universitas Islam Sultan Agung
Maintenance script (bicara | kontrib)
Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 28935915; atribusi sumber disertakan.
 
Maintenance script (bicara | kontrib)
Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi
Baris 1: Baris 1:
'''Korpus teks''' adalah sumber daya [[bahasa]] yang terdiri dari kumpulan teks yang besar. Pada [[linguistik]], korpus teks juga dikenal dengan sebutan jamak korpora yang saat ini biasanya disimpan dan diproses secara elektronik. Korpus teks digunakan untuk melakukan analisis statistik serta pengujian hipotesis, memeriksa kejadian atau memvalidasi aturan lingustik dalam wilayah bahasa tertentu.
'''Korpus teks''' adalah sumber daya [[bahasa]] yang terdiri dari kumpulan teks yang besar. Pada [[linguistik]], korpus teks juga dikenal dengan sebutan jamak korpora yang saat ini biasanya disimpan dan diproses secara elektronik. Korpus teks digunakan untuk melakukan analisis statistik serta pengujian hipotesis, memeriksa kejadian atau memvalidasi aturan lingustik dalam wilayah bahasa tertentu.


Definisi lainnya dari korpus teks adalah kumpulan teks alami, baik bahasa lisan maupun bahasa tulis, yang disusun secara sistematis.
Definisi lainnya dari korpus teks adalah kumpulan teks alami, baik bahasa lisan maupun bahasa tulis, yang disusun secara sistematis.<ref>Adi Budiwiyanto. [https://badanbahasa.kemdikbud.go.id/artikel-detail/822/korpus-dalam-penyusunan-kamus Korpus Dalam Penyusunan Kamus]. ''Badan Pengembangan dan Pembinaan Bahasa''. 2022-01-22.</ref>


== Sejarah korpus ==
== Sejarah korpus ==
Linguistik korpus yang merupakan pembahasan ilmiah muncul sekitar tahun 1960-an yang pada era tersebut, dua buku dari [[Noam Chomsky]] berjudul ''Syntactic Structures'' terbit pada tahun 1957 dan ''Aspects of Theory of Syntax'' terbit pada tahun 1965 memberikan dampak besar bahkan memicu revisi standar paradigma dalam [[linguistik teoretis]].
Linguistik korpus yang merupakan pembahasan ilmiah muncul sekitar tahun 1960-an yang pada era tersebut, dua buku dari [[Noam Chomsky]] berjudul ''Syntactic Structures'' terbit pada tahun 1957 dan ''Aspects of Theory of Syntax'' terbit pada tahun 1965 memberikan dampak besar bahkan memicu revisi standar paradigma dalam [[linguistik teoretis]].<ref>Chomsky, Noam Verfasser. [http://worldcat.org/oclc/1156931389 Syntactic Structures]. Mouton. 1957. hlm. 11. ISBN 978-3-11-231600-9.</ref>


Setelah itu, muncul proyek-proyek mengenai korpus. Proyek korpus pertama, dimulai di akhir tahun 1950-an, [[Randolph Quirk]] melakukan pengumpulan data bahasa untuk penelitian [[tata bahasa]] secara [[empiris]]. Saat itu, data yang dikumpulkannya belum terkomputerisasi dan baru pada pertengahan tahun 1980-an proses komputerisasi tersebut dilakukan oleh Randolph Quirk bersama [[Sydney Greenbaum]]. Itulah proyek korpus pertama yang dikenal dengan International ''Corpus of English'' yang didalam data tersebut terdiri atas 1 juta kata yang meliputi 500 ribu kata data lisan dan 500 ribu kata data tulis.
Setelah itu, muncul proyek-proyek mengenai korpus. Proyek korpus pertama, dimulai di akhir tahun 1950-an, [[Randolph Quirk]] melakukan pengumpulan data bahasa untuk penelitian [[tata bahasa]] secara [[empiris]]. Saat itu, data yang dikumpulkannya belum terkomputerisasi dan baru pada pertengahan tahun 1980-an proses komputerisasi tersebut dilakukan oleh Randolph Quirk bersama [[Sydney Greenbaum]]. Itulah proyek korpus pertama yang dikenal dengan International ''Corpus of English'' yang didalam data tersebut terdiri atas 1 juta kata yang meliputi 500 ribu kata data lisan dan 500 ribu kata data tulis.<ref>[https://www.ucl.ac.uk/english-usage/projects/ice.htm The International Corpus of English]. ''University College London''. 18 November 2021.</ref>


Proyek korpus kedua bernama [[Brown Corpus]] disusun oleh [[Nelson Francis]] pada tahun 1960-an yang terdiri dari 1 juta kata.
Proyek korpus kedua bernama [[Brown Corpus]] disusun oleh [[Nelson Francis]] pada tahun 1960-an yang terdiri dari 1 juta kata.<ref>[http://icame.uib.no/brown/bcm.html Brown Corpus Manual]. ''icame.uib.no''.</ref>


Proyek ketiga dari korpus bernama ''English Lexical Studies'' dimulai pada tahun 1963 di [[Edinburgh]] dan diselesaikan di [[Birmingham]] dipimpin oleh [[John Sinclair]]. Proyek ini berbasis sampel teks elektronik bahasa lisan dan tulis yang sangat kecil.
Proyek ketiga dari korpus bernama ''English Lexical Studies'' dimulai pada tahun 1963 di [[Edinburgh]] dan diselesaikan di [[Birmingham]] dipimpin oleh [[John Sinclair]]. Proyek ini berbasis sampel teks elektronik bahasa lisan dan tulis yang sangat kecil.<ref>Sinclair, John McHardy. [http://worldcat.org/oclc/1120811855 English lexical studies : report to OSTI on project C/LP/08]. Department of English, University of Birmingham. 1970.</ref>


Pada proyek korpus berikutnya, yaitu ''Collins Cobuild English Language Dictionary'' yang disusun pertengahan 1970-an dan kamus tersebut diterbitkan pada tahun 1987 dibawah panduan John Sinclair. Pada kamus itu, korpus tersebut terdiri atas 18,3 juta kata.
Pada proyek korpus berikutnya, yaitu ''Collins Cobuild English Language Dictionary'' yang disusun pertengahan 1970-an dan kamus tersebut diterbitkan pada tahun 1987 dibawah panduan John Sinclair. Pada kamus itu, korpus tersebut terdiri atas 18,3 juta kata.<ref>Ewald Standop. [http://dx.doi.org/10.1016/0346-251x(88)90082-6 Collins COBUILD English language dictionary]. ''System''. 1988-01. Vol. 16 (3). hlm. 384–388. doi:10.1016/0346-251x(88)90082-6.</ref>


== Aplikasi korpus teks ==
== Aplikasi korpus teks ==
Baris 21: Baris 21:
Analisis dan pemrosesan berbagai jenis korpora merupakan subjek beragam pekerjaan dalam linguistik komputasi, pengenalan suara, dan terjemahan mesin, hal tersebut sering digunakan untuk membuat [[model Markov tersembunyi]] yang digunakan untuk penandaan bagian ucapan dan tujuan lainnya.
Analisis dan pemrosesan berbagai jenis korpora merupakan subjek beragam pekerjaan dalam linguistik komputasi, pengenalan suara, dan terjemahan mesin, hal tersebut sering digunakan untuk membuat [[model Markov tersembunyi]] yang digunakan untuk penandaan bagian ucapan dan tujuan lainnya.


Turunan dari daftar korpora serta frekuensi, berguna dalam pengajaran bahasa. Korpora bisa dianggap sebagai bentuk dari jenis bantuan menulis dan memahami bahasa asing, karena dari tata bahasa kontekstualnya, pengguna mampu memperoleh bahasa non asli melalui paparan teks yang otentik di korpora sehingga memungkinkan pengguna yang mempelajarinya mampu untuk memahami cara dari pembentukan kalimat dalam bahasa tujuan dan memungkinkan penulisan yang efektif.
Turunan dari daftar korpora serta frekuensi, berguna dalam pengajaran bahasa. Korpora bisa dianggap sebagai bentuk dari jenis bantuan menulis dan memahami bahasa asing, karena dari tata bahasa kontekstualnya, pengguna mampu memperoleh bahasa non asli melalui paparan teks yang otentik di korpora sehingga memungkinkan pengguna yang mempelajarinya mampu untuk memahami cara dari pembentukan kalimat dalam bahasa tujuan dan memungkinkan penulisan yang efektif.<ref>Hyunsook Yoon. [http://dx.doi.org/10.1016/j.jslw.2004.06.002 ESL student attitudes toward corpus use in L2 writing]. ''Journal of Second Language Writing''. 2004-12. Vol. 13 (4). hlm. 257–283. doi:10.1016/j.jslw.2004.06.002.</ref>


* Mesin penerjemah
* Mesin penerjemah
Baris 27: Baris 27:
Dalam mesin penerjemah, [[algoritma]] terjemahan mesin untuk menerjemahkan antara dua bahasa, sering dilatih menggunakan fragmen paralel yang terdiri atas korpus bahasa pertama serta korpus bahasa kedua, yang merupakan hasil terjemahan dari elemen per elemen dari bahasa pertama.
Dalam mesin penerjemah, [[algoritma]] terjemahan mesin untuk menerjemahkan antara dua bahasa, sering dilatih menggunakan fragmen paralel yang terdiri atas korpus bahasa pertama serta korpus bahasa kedua, yang merupakan hasil terjemahan dari elemen per elemen dari bahasa pertama.


Dalam korpus terjemahan, teks-teks dalam satu bahasa merupakan terjemahan dari teks-teks dalam bahasa lain. Dalam korpus yang sebanding, teks-teks tersebut memiliki jenis yang sama serta mencakup konten yang sama, tetapi mereka bukan merupakan terjemahan satu sama lain. Untuk mengeksploitasi teks paralel, beberapa jenis perataan teks yang mengidentifikasi segmen teks yang setara ([[frasa]] atau kalimat) merupakan bagian prasyarat untuk analisis bahasa.
Dalam korpus terjemahan, teks-teks dalam satu bahasa merupakan terjemahan dari teks-teks dalam bahasa lain. Dalam korpus yang sebanding, teks-teks tersebut memiliki jenis yang sama serta mencakup konten yang sama, tetapi mereka bukan merupakan terjemahan satu sama lain.<ref>Krzysztof Wołk. [http://link.springer.com/10.1007/978-3-319-05951-8_11 Real-Time Statistical Speech Translation]. Springer International Publishing. 2014. Vol. 275. hlm. 107–113. doi:10.1007/978-3-319-05951-8_11. ISBN 978-3-319-05950-1.</ref> Untuk mengeksploitasi teks paralel, beberapa jenis perataan teks yang mengidentifikasi segmen teks yang setara ([[frasa]] atau kalimat) merupakan bagian prasyarat untuk analisis bahasa.


* [[Filologi]]
* [[Filologi]]


Korpora teks juga digunakan dalam studi dokumen sejarah, seperti dalam upaya untuk menerjemahkan naskah-naskah kuno, atau digunakan dalam studi pada [[Alkitab]]. Beberapa korpora [[arkeologi]] dapat memiliki durasi yang begitu singkat sehingga mereka memberikan gambaran pada waktunya. Salah satu korpora terpendek dalam waktu terdapat pada teks surat [[Amarna]] 15–30 tahun (1350 SM).
Korpora teks juga digunakan dalam studi dokumen sejarah, seperti dalam upaya untuk menerjemahkan naskah-naskah kuno, atau digunakan dalam studi pada [[Alkitab]]. Beberapa korpora [[arkeologi]] dapat memiliki durasi yang begitu singkat sehingga mereka memberikan gambaran pada waktunya. Salah satu korpora terpendek dalam waktu terdapat pada teks surat [[Amarna]] 15–30 tahun (1350 SM).
== Referensi ==


==Lihat pula==
==Lihat pula==
*[[Linguistik korpus]]
*[[Linguistik korpus]]


 
== Referensi ==
<references />


== Sumber dan atribusi ==
== Sumber dan atribusi ==


Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Korpus+teks&oldid=28935915 Wikipedia bahasa Indonesia], revisi 28935915 (2026-02-06T05:43:39Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.
Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=Korpus+teks&oldid=28935915 Wikipedia bahasa Indonesia], revisi 28935915 (2026-02-06T05:43:39Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.
<!-- WIKI_UNISSULA_PRESENTATION_V4 -->

Revisi per 23 Agustus 2026 10.25

Korpus teks adalah sumber daya bahasa yang terdiri dari kumpulan teks yang besar. Pada linguistik, korpus teks juga dikenal dengan sebutan jamak korpora yang saat ini biasanya disimpan dan diproses secara elektronik. Korpus teks digunakan untuk melakukan analisis statistik serta pengujian hipotesis, memeriksa kejadian atau memvalidasi aturan lingustik dalam wilayah bahasa tertentu.

Definisi lainnya dari korpus teks adalah kumpulan teks alami, baik bahasa lisan maupun bahasa tulis, yang disusun secara sistematis.[1]

Sejarah korpus

Linguistik korpus yang merupakan pembahasan ilmiah muncul sekitar tahun 1960-an yang pada era tersebut, dua buku dari Noam Chomsky berjudul Syntactic Structures terbit pada tahun 1957 dan Aspects of Theory of Syntax terbit pada tahun 1965 memberikan dampak besar bahkan memicu revisi standar paradigma dalam linguistik teoretis.[2]

Setelah itu, muncul proyek-proyek mengenai korpus. Proyek korpus pertama, dimulai di akhir tahun 1950-an, Randolph Quirk melakukan pengumpulan data bahasa untuk penelitian tata bahasa secara empiris. Saat itu, data yang dikumpulkannya belum terkomputerisasi dan baru pada pertengahan tahun 1980-an proses komputerisasi tersebut dilakukan oleh Randolph Quirk bersama Sydney Greenbaum. Itulah proyek korpus pertama yang dikenal dengan International Corpus of English yang didalam data tersebut terdiri atas 1 juta kata yang meliputi 500 ribu kata data lisan dan 500 ribu kata data tulis.[3]

Proyek korpus kedua bernama Brown Corpus disusun oleh Nelson Francis pada tahun 1960-an yang terdiri dari 1 juta kata.[4]

Proyek ketiga dari korpus bernama English Lexical Studies dimulai pada tahun 1963 di Edinburgh dan diselesaikan di Birmingham dipimpin oleh John Sinclair. Proyek ini berbasis sampel teks elektronik bahasa lisan dan tulis yang sangat kecil.[5]

Pada proyek korpus berikutnya, yaitu Collins Cobuild English Language Dictionary yang disusun pertengahan 1970-an dan kamus tersebut diterbitkan pada tahun 1987 dibawah panduan John Sinclair. Pada kamus itu, korpus tersebut terdiri atas 18,3 juta kata.[6]

Aplikasi korpus teks

Pengaplikasian dari korpus teks ini terdapat pada beberapa area meliputi :

Analisis dan pemrosesan berbagai jenis korpora merupakan subjek beragam pekerjaan dalam linguistik komputasi, pengenalan suara, dan terjemahan mesin, hal tersebut sering digunakan untuk membuat model Markov tersembunyi yang digunakan untuk penandaan bagian ucapan dan tujuan lainnya.

Turunan dari daftar korpora serta frekuensi, berguna dalam pengajaran bahasa. Korpora bisa dianggap sebagai bentuk dari jenis bantuan menulis dan memahami bahasa asing, karena dari tata bahasa kontekstualnya, pengguna mampu memperoleh bahasa non asli melalui paparan teks yang otentik di korpora sehingga memungkinkan pengguna yang mempelajarinya mampu untuk memahami cara dari pembentukan kalimat dalam bahasa tujuan dan memungkinkan penulisan yang efektif.[7]

  • Mesin penerjemah

Dalam mesin penerjemah, algoritma terjemahan mesin untuk menerjemahkan antara dua bahasa, sering dilatih menggunakan fragmen paralel yang terdiri atas korpus bahasa pertama serta korpus bahasa kedua, yang merupakan hasil terjemahan dari elemen per elemen dari bahasa pertama.

Dalam korpus terjemahan, teks-teks dalam satu bahasa merupakan terjemahan dari teks-teks dalam bahasa lain. Dalam korpus yang sebanding, teks-teks tersebut memiliki jenis yang sama serta mencakup konten yang sama, tetapi mereka bukan merupakan terjemahan satu sama lain.[8] Untuk mengeksploitasi teks paralel, beberapa jenis perataan teks yang mengidentifikasi segmen teks yang setara (frasa atau kalimat) merupakan bagian prasyarat untuk analisis bahasa.

Korpora teks juga digunakan dalam studi dokumen sejarah, seperti dalam upaya untuk menerjemahkan naskah-naskah kuno, atau digunakan dalam studi pada Alkitab. Beberapa korpora arkeologi dapat memiliki durasi yang begitu singkat sehingga mereka memberikan gambaran pada waktunya. Salah satu korpora terpendek dalam waktu terdapat pada teks surat Amarna 15–30 tahun (1350 SM).

Lihat pula

Referensi

  1. Adi Budiwiyanto. Korpus Dalam Penyusunan Kamus. Badan Pengembangan dan Pembinaan Bahasa. 2022-01-22.
  2. Chomsky, Noam Verfasser. Syntactic Structures. Mouton. 1957. hlm. 11. ISBN 978-3-11-231600-9.
  3. The International Corpus of English. University College London. 18 November 2021.
  4. Brown Corpus Manual. icame.uib.no.
  5. Sinclair, John McHardy. English lexical studies : report to OSTI on project C/LP/08. Department of English, University of Birmingham. 1970.
  6. Ewald Standop. Collins COBUILD English language dictionary. System. 1988-01. Vol. 16 (3). hlm. 384–388. doi:10.1016/0346-251x(88)90082-6.
  7. Hyunsook Yoon. ESL student attitudes toward corpus use in L2 writing. Journal of Second Language Writing. 2004-12. Vol. 13 (4). hlm. 257–283. doi:10.1016/j.jslw.2004.06.002.
  8. Krzysztof Wołk. Real-Time Statistical Speech Translation. Springer International Publishing. 2014. Vol. 275. hlm. 107–113. doi:10.1007/978-3-319-05951-8_11. ISBN 978-3-319-05950-1.

Sumber dan atribusi

Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 28935915 (2026-02-06T05:43:39Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.