Lompat ke isi

DeepSeek: Perbedaan antara revisi

Ensiklopedia Pengetahuan Universitas Islam Sultan Agung
Maintenance script (bicara | kontrib)
Impor teks terkontrol dari Wikipedia bahasa Indonesia; revisi 29523370; atribusi sumber disertakan.
 
Maintenance script (bicara | kontrib)
Presentation V4: sitasi, referensi, Math, Wikimedia Commons, dan atribusi
 
Baris 1: Baris 1:
'''DeepSeek''' adalah nama yang diberikan untuk [[model bahasa besar]] (LLM) [[sumber terbuka]] yang dikembangkan oleh sebuah [[Industri kecerdasan buatan di Tiongkok|perusahaan kecerdasan buatan asal Tiongkok]] bernama Hangzhou DeepSeek Artificial Intelligence Co., Ltd. (). Perusahaan tersebut, yang berkantor pusat di [[Hangzhou|Hangzhou, Zhejiang]], dimiliki dan didanai sepenuhnya oleh [[dana lindung nilai]] [[High-Flyer]], yang salah seorang pendirinya, [[Liang Wenfeng]], mendirikan perusahaan tersebut pada tahun 2023 dan menjabat sebagai [[Direktur utama|CEO]]-nya.
'''DeepSeek''' adalah nama yang diberikan untuk [[model bahasa besar]] (LLM) [[sumber terbuka]] yang dikembangkan oleh sebuah [[Industri kecerdasan buatan di Tiongkok|perusahaan kecerdasan buatan asal Tiongkok]] bernama Hangzhou DeepSeek Artificial Intelligence Co., Ltd. (). Perusahaan tersebut, yang berkantor pusat di [[Hangzhou|Hangzhou, Zhejiang]], dimiliki dan didanai sepenuhnya oleh [[dana lindung nilai]] [[High-Flyer]], yang salah seorang pendirinya, [[Liang Wenfeng]], mendirikan perusahaan tersebut pada tahun 2023 dan menjabat sebagai [[Direktur utama|CEO]]-nya.


DeepSeek melakukan tugas pada level yang sama dengan [[ChatGPT]], meskipun dikembangkan dengan biaya yang jauh lebih rendah, yaitu sebesar [[Dolar Amerika Serikat|US$]] 6 juta, dibandingkan dengan $100 juta untuk GPT-4 oleh [[OpenAI]] pada tahun 2023, dan membutuhkan sepersepuluh dari daya komputasi LLM yang sebanding. Model AI dikembangkan oleh DeepSeek di tengah sanksi AS terhadap Tiongkok atas [[cip]] [[NVIDIA|Nvidia]], yang dimaksudkan untuk membatasi kemampuan negara tersebut untuk mengembangkan sistem AI tingkat lanjut. Pada 10 Januari 2025, perusahaan ini merilis [[Bot percakapan|aplikasi bot percakapan]] gratis pertamanya untuk [[IOS|iOS Apple]] dan [[Android (sistem operasi)|Android]]; pada 27 Januari, aplikasi ini telah melampaui [[ChatGPT]] sebagai aplikasi gratis yang paling banyak diunduh di [[App Store|iOS App Store]] di Amerika Serikat, dan menyebabkan harga saham [[NVIDIA|Nvidia]] turun sebesar 18%. Keberhasilan DeepSeek melawan para pesaing yang lebih besar dan mapan telah digambarkan sebagai "pengubah AI," yang merupakan "tembakan pertama dalam apa yang berkembang sebagai perlombaan ruang AI global" dan mengawali "era baru dari taktik AI yang penuh tipu daya."
DeepSeek melakukan tugas pada level yang sama dengan [[ChatGPT]],<ref>Elizabeth Gibney. [https://www.nature.com/articles/d41586-025-00229-6 China's cheap, open AI model DeepSeek thrills scientists]. ''Nature''. 23 Januari 2025. doi:10.1038/d41586-025-00229-6.}}</ref> meskipun dikembangkan dengan biaya yang jauh lebih rendah, yaitu sebesar [[Dolar Amerika Serikat|US$]] 6 juta, dibandingkan dengan $100 juta untuk GPT-4 oleh [[OpenAI]] pada tahun 2023,<ref>James Vincent. [https://www.theguardian.com/commentisfree/2025/jan/28/deepseek-r1-ai-world-chinese-chatbot-tech-world-western The DeepSeek panic reveals an AI world ready to blow]. ''The Guardian''. 28 Januari 2025.</ref> dan membutuhkan sepersepuluh dari daya komputasi LLM yang sebanding.<ref>James Vincent. [https://www.theguardian.com/commentisfree/2025/jan/28/deepseek-r1-ai-world-chinese-chatbot-tech-world-western The DeepSeek panic reveals an AI world ready to blow]. ''The Guardian''. 28 Januari 2025.</ref><ref>Peter Hoskins. [https://www.bbc.com/news/articles/c0qw7z2v1pgo DeepSeek Chinese AI chatbot sparks market turmoil for rivals]. ''BBC''. 27 Januari 2025.</ref><ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref><ref>Emma Cosgrove. [https://www.businessinsider.com/explaining-deepseek-chinese-models-efficiency-scaring-markets-2025-1 DeepSeek's cheaper models and weaker chips call into question trillions in AI infrastructure spending]. ''Business Insider''. 27 Januari 2025.</ref> Model AI dikembangkan oleh DeepSeek di tengah sanksi AS terhadap Tiongkok atas [[cip]] [[NVIDIA|Nvidia]], yang dimaksudkan untuk membatasi kemampuan negara tersebut untuk mengembangkan sistem AI tingkat lanjut.<ref>Cliff Saran. [https://www.computerweekly.com/news/366616907/Nvidia-investigation-signals-widening-of-US-and-China-chip-war Nvidia investigation signals widening of US and China chip war | Computer Weekly]. ''Computer Weekly''. 10 Desember 2024.</ref><ref>Natalie Sherman. [https://www.bbc.com/news/articles/cx2vkd90mk8o Nvidia targeted by China in new chip war probe]. ''BBC''. 9 Desember 2024.</ref> Pada 10 Januari 2025, perusahaan ini merilis [[Bot percakapan|aplikasi bot percakapan]] gratis pertamanya untuk [[IOS|iOS Apple]] dan [[Android (sistem operasi)|Android]]; pada 27 Januari, aplikasi ini telah melampaui [[ChatGPT]] sebagai aplikasi gratis yang paling banyak diunduh di [[App Store|iOS App Store]] di Amerika Serikat,<ref>Cade Metz. [https://www.nytimes.com/2025/01/27/technology/what-is-deepseek-china-ai.html What is DeepSeek? And How Is It Upending A.I.?]. ''The New York Times''. 27 Januari 2025.</ref> dan menyebabkan harga saham [[NVIDIA|Nvidia]] turun sebesar 18%.<ref>Hayden Field. [https://www.cnbc.com/2025/01/27/chinas-deepseek-ai-tops-chatgpt-app-store-what-you-should-know.html China's DeepSeek AI dethrones ChatGPT on App Store: Here's what you should know]. ''CNBC''. 27 Januari 2025.</ref><ref>[https://www.cbsnews.com/news/what-is-deepseek-ai-china-stock-nvidia-nvda-asml/ What is DeepSeek, and why is it causing Nvidia and other stocks to slump? - CBS News]. ''www.cbsnews.com''. 27 Januari 2025.</ref><ref>Thomas Barrabi. [https://nypost.com/2025/01/27/business/nvidia-stock-set-for-record-wipeout-on-deepseek-fears-ceo-jensen-huangs-net-worth-tanks/ Nvidia stock suffers record wipeout on DeepSeek fears -- as CEO Jensen Huang's net worth tanks]. 27 Januari 2025.</ref> Keberhasilan DeepSeek melawan para pesaing yang lebih besar dan mapan telah digambarkan sebagai "pengubah AI,"<ref>Cade Metz. [https://www.nytimes.com/2025/01/27/technology/what-is-deepseek-china-ai.html What is DeepSeek? And How Is It Upending A.I.?]. ''The New York Times''. 27 Januari 2025.</ref> yang merupakan "tembakan pertama dalam apa yang berkembang sebagai perlombaan ruang AI global"<ref>Max Zahn. [https://abcnews.go.com/Business/nvidia-microsoft-shares-tumble-china-based-ai-app/story?id=118136157 Nvidia, Microsoft shares tumble as China-based AI app DeepSeek hammers tech giants]. ''ABC News''.</ref> dan mengawali "era baru dari taktik AI yang penuh tipu daya."<ref>Kevin Roose. [https://www.nytimes.com/2025/01/28/technology/why-deepseek-could-change-what-silicon-valley-believes-about-ai.html Why DeepSeek Could Change What Silicon Valley Believe About A.I]. ''The New York Times''. 2025-01-28.</ref>


DeepSeek telah menjadikan bot percakapan [[Kecerdasan buatan generatif|kecerdasan buatan generatifnya]] [[sumber terbuka]], menjadikan kodenya tersedia secara bebas untuk digunakan, dimodifikasi, dan dilihat; hal ini termasuk izin untuk mengakses dan memanfaatkan kode sumber dan dokumen desain untuk tujuan pembangunan. Perusahaan ini secara aktif merekrut peneliti muda AI dari universitas-universitas ternama di Tiongkok, dan merekrut orang dari luar bidang [[ilmu komputer]] untuk menganekaragamkan pengetahuan dan kemampuan modelnya.
DeepSeek telah menjadikan bot percakapan [[Kecerdasan buatan generatif|kecerdasan buatan generatifnya]] [[sumber terbuka]], menjadikan kodenya tersedia secara bebas untuk digunakan, dimodifikasi, dan dilihat; hal ini termasuk izin untuk mengakses dan memanfaatkan kode sumber dan dokumen desain untuk tujuan pembangunan.<ref>Luis E. Romero. [https://www.forbes.com/sites/luisromero/2025/01/27/chatgpt-deepseek-or-llama-metas-lecun-says-open-source-is-the-key/ ChatGPT, DeepSeek, Or Llama? Meta's LeCun Says Open-Source Is The Key]. ''Forbes''.</ref> Perusahaan ini secara aktif merekrut peneliti muda AI dari universitas-universitas ternama di Tiongkok,<ref>Cade Metz. [https://www.nytimes.com/2025/01/27/technology/what-is-deepseek-china-ai.html What is DeepSeek? And How Is It Upending A.I.?]. ''The New York Times''. 27 Januari 2025.</ref> dan merekrut orang dari luar bidang [[ilmu komputer]] untuk menganekaragamkan pengetahuan dan kemampuan modelnya.<ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref>


== Latar belakang ==
== Latar belakang ==
Pada bulan Februari 2016, High-Flyer didirikan oleh seorang penggemar AI bernama Liang Wenfeng, yang telah berdagang sejak [[krisis keuangan 2007–2008]] saat kuliah di [[Universitas Zhejiang]]. Pada tahun 2019, ia mendirikan High-Flyer sebagai [[dana lindung nilai]] yang berfokus pada pengembangan dan penggunaan algoritma perdagangan AI. Pada tahun 2021, High-Flyer secara eksklusif menggunakan AI dalam perdagangan. DeepSeek telah menjadikan [[bot percakapan]] [[Kecerdasan buatan generatif|kecerdasan buatan generatifnya]] [[sumber terbuka]], yang berarti kodenya tersedia secara bebas untuk digunakan, dimodifikasi, dan dilihat. Hal ini termasuk izin untuk mengakses dan menggunakan [[kode sumber]], serta dokumen desain, untuk tujuan pembangunan.
Pada bulan Februari 2016, High-Flyer didirikan oleh seorang penggemar AI bernama Liang Wenfeng, yang telah berdagang sejak [[krisis keuangan 2007–2008]] saat kuliah di [[Universitas Zhejiang]].<ref>Caiwei Chen. [https://www.technologyreview.com/2025/01/24/1110526/china-deepseek-top-ai-despite-sanctions/ How a top Chinese AI model overcame US sanctions]. ''MIT Technology Review''. 24 Januari 2025.</ref> Pada tahun 2019, ia mendirikan High-Flyer sebagai [[dana lindung nilai]] yang berfokus pada pengembangan dan penggunaan algoritma perdagangan AI. Pada tahun 2021, High-Flyer secara eksklusif menggunakan AI dalam perdagangan.<ref>Lily Ottinger. [https://www.chinatalk.media/p/deepseek-from-hedge-fund-to-frontier Deepseek: From Hedge Fund to Frontier Model Maker]. ''ChinaTalk''. 9 Desember 2024.</ref> DeepSeek telah menjadikan [[bot percakapan]] [[Kecerdasan buatan generatif|kecerdasan buatan generatifnya]] [[sumber terbuka]], yang berarti kodenya tersedia secara bebas untuk digunakan, dimodifikasi, dan dilihat. Hal ini termasuk izin untuk mengakses dan menggunakan [[kode sumber]], serta dokumen desain, untuk tujuan pembangunan.<ref>Luis E. Romero. [https://www.forbes.com/sites/luisromero/2025/01/27/chatgpt-deepseek-or-llama-metas-lecun-says-open-source-is-the-key/ ChatGPT, DeepSeek, Or Llama? Meta's LeCun Says Open-Source Is The Key]. ''Forbes''.</ref>


Per [[36Kr]], Liang telah membangun penyimpanan 10.000 GPU [[Ampere (mikroarsitektur)|Nvidia A100]] sebelum pemerintah AS memberlakukan pembatasan cip AI di Tiongkok. Beberapa perkiraan menyebutkan jumlahnya mencapai 50.000.
Per [[36Kr]], Liang telah membangun penyimpanan 10.000 GPU [[Ampere (mikroarsitektur)|Nvidia A100]] sebelum pemerintah AS memberlakukan pembatasan cip AI di Tiongkok.<ref>Lily Ottinger. [https://www.chinatalk.media/p/deepseek-from-hedge-fund-to-frontier Deepseek: From Hedge Fund to Frontier Model Maker]. ''ChinaTalk''. 9 Desember 2024.</ref> Beberapa perkiraan menyebutkan jumlahnya mencapai 50.000.<ref>Caiwei Chen. [https://www.technologyreview.com/2025/01/24/1110526/china-deepseek-top-ai-despite-sanctions/ How a top Chinese AI model overcame US sanctions]. ''MIT Technology Review''. 24 Januari 2025.</ref>


Pada bulan April 2023, High-Flyer memulai laboratorium [[kecerdasan umum buatan]] yang didedikasikan untuk meneliti pengembangan alat AI yang terpisah dari bisnis keuangan High-Flyer. Pada bulan Mei 2023, dengan High-Flyer sebagai salah satu investor, lab tersebut menjadi suatu perusahaan yang berdiri sendiri, yaitu DeepSeek. Perusahaan [[modal ventura]] enggan memberikan pendanaan karena tidak mungkin menghasilkan keuntungan dalam waktu singkat.
Pada bulan April 2023, High-Flyer memulai laboratorium [[kecerdasan umum buatan]] yang didedikasikan untuk meneliti pengembangan alat AI yang terpisah dari bisnis keuangan High-Flyer.<ref>Xu Yu. [https://www.yicaiglobal.com/news/exclusive-chinese-quant-fund-high-flyer-will-not-use-agi-to-trade-stocks-managing-director-says [Exclusive] Chinese Quant Hedge Fund High-Flyer Won't Use AGI to Trade Stocks, MD Says]. ''Yicai Global''. 17 April 2023.</ref><ref>Ben Jiang. [https://www.scmp.com/tech/tech-trends/article/3293050/meet-deepseek-chinese-start-changing-how-ai-models-are-trained Meet DeepSeek: the Chinese start-up that is changing how AI models are trained]. ''South China Morning Post''. 1 Januari 2025.</ref> Pada bulan Mei 2023, dengan High-Flyer sebagai salah satu investor, lab tersebut menjadi suatu perusahaan yang berdiri sendiri, yaitu DeepSeek.<ref>Lily Ottinger. [https://www.chinatalk.media/p/deepseek-from-hedge-fund-to-frontier Deepseek: From Hedge Fund to Frontier Model Maker]. ''ChinaTalk''. 9 Desember 2024.</ref><ref>Ryan McMorrow. [https://www.ft.com/content/357f3c68-b866-4c2e-b678-0d075051a260 The Chinese quant fund-turned-AI pioneer]. ''Financial Times''. 9 June 2024.</ref><ref>Ben Jiang. [https://www.scmp.com/tech/tech-trends/article/3293050/meet-deepseek-chinese-start-changing-how-ai-models-are-trained Meet DeepSeek: the Chinese start-up that is changing how AI models are trained]. ''South China Morning Post''. 1 Januari 2025.</ref> Perusahaan [[modal ventura]] enggan memberikan pendanaan karena tidak mungkin menghasilkan keuntungan dalam waktu singkat.<ref>Lily Ottinger. [https://www.chinatalk.media/p/deepseek-from-hedge-fund-to-frontier Deepseek: From Hedge Fund to Frontier Model Maker]. ''ChinaTalk''. 9 Desember 2024.</ref>


Setelah merilis DeepSeek-V2 pada Mei 2024, yang menawarkan kinerja kuat dengan harga murah, DeepSeek dikenal sebagai katalisator [[perang harga]] model AI Tiongkok. Perusahaan ini dengan cepat dijuluki "[[Pinduoduo]] AI", dan raksasa teknologi lainnya, seperti [[ByteDance]], [[Tencent]], [[Baidu]], dan [[Alibaba Group|Alibaba]] mulai memangkas harga model AI mereka untuk bersaing dengan perusahaan tersebut. Meskipun harga yang dikenakan DeepSeek rendah, perusahaan ini tetap menguntungkan dibandingkan dengan pesaingnya yang merugi.
Setelah merilis DeepSeek-V2 pada Mei 2024, yang menawarkan kinerja kuat dengan harga murah, DeepSeek dikenal sebagai katalisator [[perang harga]] model AI Tiongkok. Perusahaan ini dengan cepat dijuluki "[[Pinduoduo]] AI", dan raksasa teknologi lainnya, seperti [[ByteDance]], [[Tencent]], [[Baidu]], dan [[Alibaba Group|Alibaba]] mulai memangkas harga model AI mereka untuk bersaing dengan perusahaan tersebut. Meskipun harga yang dikenakan DeepSeek rendah, perusahaan ini tetap menguntungkan dibandingkan dengan pesaingnya yang merugi.<ref>Jordan Schneider. [https://www.chinatalk.media/p/deepseek-ceo-interview-with-chinas Deepseek: The Quiet Giant Leading China's AI Race]. ''ChinaTalk''. 27 November 2024.</ref>


DeepSeek berfokus hanya pada penelitian dan tidak memiliki rencana terperinci untuk komersialisasi; Hal ini juga memungkinkan teknologinya menghindari ketentuan paling ketat dari peraturan AI Tiongkok, seperti mengharuskan teknologi yang berhadapan dengan konsumen untuk mematuhi kontrol pemerintah terhadap informasi.
DeepSeek berfokus hanya pada penelitian dan tidak memiliki rencana terperinci untuk komersialisasi;<ref>Jordan Schneider. [https://www.chinatalk.media/p/deepseek-ceo-interview-with-chinas Deepseek: The Quiet Giant Leading China's AI Race]. ''ChinaTalk''. 27 November 2024.</ref> Hal ini juga memungkinkan teknologinya menghindari ketentuan paling ketat dari peraturan AI Tiongkok, seperti mengharuskan teknologi yang berhadapan dengan konsumen untuk mematuhi kontrol pemerintah terhadap informasi.<ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref>


Preferensi perekrutan DeepSeek lebih mengutamakan kemampuan teknis daripada pengalaman kerja sehingga sebagian besar karyawan baru adalah lulusan universitas atau pengembang yang karier AI-nya belum begitu mapan. Demikian pula, perusahaan merekrut individu tanpa latar belakang ilmu komputer untuk membantu teknologinya memahami topik dan bidang pengetahuan lainnya, termasuk kemampuan untuk menciptakan puisi dan kemampuan untuk mengerjakan [[Gaokao|ujian masuk perguruan tinggi Tiongkok]] yang terkenal sulit.
Preferensi perekrutan DeepSeek lebih mengutamakan kemampuan teknis daripada pengalaman kerja sehingga sebagian besar karyawan baru adalah lulusan universitas atau pengembang yang karier AI-nya belum begitu mapan.<ref>Ben Jiang. [https://www.scmp.com/tech/tech-trends/article/3293050/meet-deepseek-chinese-start-changing-how-ai-models-are-trained Meet DeepSeek: the Chinese start-up that is changing how AI models are trained]. ''South China Morning Post''. 1 Januari 2025.</ref><ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref> Demikian pula, perusahaan merekrut individu tanpa latar belakang ilmu komputer untuk membantu teknologinya memahami topik dan bidang pengetahuan lainnya, termasuk kemampuan untuk menciptakan puisi dan kemampuan untuk mengerjakan [[Gaokao|ujian masuk perguruan tinggi Tiongkok]] yang terkenal sulit.<ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref>


== Riwayat rilis ==
== Riwayat rilis ==
=== DeepSeek LLM ===
=== DeepSeek LLM ===
Pada tanggal 2 November 2023, DeepSeek merilis seri model pertamanya, <code>DeepSeek-Coder</code>, yang tersedia gratis untuk peneliti dan pengguna komersial. Kode untuk model tersebut dibuat sumber terbuka di bawah [[lisensi MIT]], dengan perjanjian lisensi tambahan ("lisensi DeepSeek") mengenai "penggunaan hilir yang terbuka dan bertanggung jawab" untuk model itu sendiri.
Pada tanggal 2 November 2023, DeepSeek merilis seri model pertamanya, <code>DeepSeek-Coder</code>, yang tersedia gratis untuk peneliti dan pengguna komersial. Kode untuk model tersebut dibuat sumber terbuka di bawah [[lisensi MIT]], dengan perjanjian lisensi tambahan ("lisensi DeepSeek") mengenai "penggunaan hilir yang terbuka dan bertanggung jawab" untuk model itu sendiri.<ref>[https://github.com/deepseek-ai/DeepSeek-Coder/blob/main/LICENSE-MODEL DeepSeek-Coder/LICENSE-MODEL at main · deepseek-ai/DeepSeek-Coder]. ''GitHub''.</ref>


Model-model tersebut memiliki arsitektur yang sama dengan DeepSeek LLM yang dirinci di bawah ini. Seri ini mencakup 8 model, 4 ''pretrained'' (<code>Base</code>) dan 4 ''instruction-finetuned'' (<code>Instruct</code>). Semuanya memiliki panjang konteks 16K. Pelatihannya adalah sebagai berikut:
Model-model tersebut memiliki arsitektur yang sama dengan DeepSeek LLM yang dirinci di bawah ini. Seri ini mencakup 8 model, 4 ''pretrained'' (<code>Base</code>) dan 4 ''instruction-finetuned'' (<code>Instruct</code>). Semuanya memiliki panjang konteks 16K. Pelatihannya adalah sebagai berikut:<ref>Daya Guo. ''DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence''. 26 Januari 2024.</ref><ref>[https://deepseekcoder.github.io/ DeepSeek Coder]. ''deepseekcoder.github.io''.</ref><ref>[https://github.com/deepseek-ai/deepseek-coder/ deepseek-ai/DeepSeek-Coder]. DeepSeek. 27 Januari 2025.</ref>


# ''Pretraining'' (Prapelatihan): token 1,8T (87% kode sumber, 10% kode terkait [[bahasa Inggris]] ([[GitHub]] Markdown dan [[Stack Exchange]]), dan 3% kode terkait bahasa Mandarin).
# ''Pretraining'' (Prapelatihan): token 1,8T (87% kode sumber, 10% kode terkait [[bahasa Inggris]] ([[GitHub]] Markdown dan [[Stack Exchange]]), dan 3% kode terkait bahasa Mandarin).
Baris 29: Baris 28:
# ''Supervised finetuning'' (SFT): 2B token data instruksi. Ini menghasilkan model <code>Instruct</code>.
# ''Supervised finetuning'' (SFT): 2B token data instruksi. Ini menghasilkan model <code>Instruct</code>.


Model-model tersebut dilatih pada kluster-kluster GPU Nvidia A100 dan H800, yang dihubungkan oleh [[InfiniBand]], [[NVLink]], [[NVSwitch]].
Model-model tersebut dilatih pada kluster-kluster GPU Nvidia A100 dan H800, yang dihubungkan oleh [[InfiniBand]], [[NVLink]], [[NVSwitch]].<ref>Daya Guo. ''DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence''. 26 Januari 2024.</ref>
 


{| class="wikitable"
|+Properti DeepSeek Coder<ref>Daya Guo. ''DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence''. 26 Januari 2024.</ref><ref>[https://huggingface.co/deepseek-ai/deepseek-coder-5.7bmqa-base deepseek-ai/deepseek-coder-5.7bmqa-base · Hugging Face]. ''huggingface.co''.</ref>
|-
! . !! <math>n_{\text{layers}}</math> !! <math>d_{\text{model}}</math>
!<math>d_{\text{intermediate}}</math>!! <math>n_{\text{heads}}</math> !! <math>n_{\text{kv-heads}} </math>
|-
| 1.3B || 24 || 2048
|5504|| 16 ||  16
|-
|5.7B
|32
|4096
|11008
|32
|1
|-
| 6.7B || 32 || 4096
|11008|| 32 || 32
|-
| 33B || 62 || 7168
|19200|| 56 ||7
|}
<sup>Perhatikan bahwa ''number of heads'' tidak sama dengan ''number of KV heads'' untuk 5.6B dan 33B karena ''Grouped query attention'' (GQA).</sup>
<sup>Perhatikan bahwa ''number of heads'' tidak sama dengan ''number of KV heads'' untuk 5.6B dan 33B karena ''Grouped query attention'' (GQA).</sup>


Pada tanggal 29 November 2023, DeepSeek merilis seri model <code>DeepSeek-LLM</code>, dengan parameter 7B dan 67B dalam formulir <code>Base</code> dan <code>[[Bot percakapan|Chat]]</code> (tidak ada <code>Instruct</code> yang dirilis). Program ini dikembangkan untuk bersaing dengan LLM lain yang tersedia saat itu. Makalah ini mengklaim hasil pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') lebih tinggi daripada kebanyakan LLM sumber terbuka pada saat itu, terutama Llama 2.  Seperti DeepSeek Coder, kode untuk model tersebut berada di bawah lisensi [[MIT]], dengan lisensi DeepSeek untuk model itu sendiri.
Pada tanggal 29 November 2023, DeepSeek merilis seri model <code>DeepSeek-LLM</code>, dengan parameter 7B dan 67B dalam formulir <code>Base</code> dan <code>[[Bot percakapan|Chat]]</code> (tidak ada <code>Instruct</code> yang dirilis). Program ini dikembangkan untuk bersaing dengan LLM lain yang tersedia saat itu. Makalah ini mengklaim hasil pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') lebih tinggi daripada kebanyakan LLM sumber terbuka pada saat itu, terutama Llama 2.<ref>DeepSeek-AI. ''DeepSeek LLM: Scaling Open-Source Language Models with Longtermism''. 5 Januari 2024.</ref>  Seperti DeepSeek Coder, kode untuk model tersebut berada di bawah lisensi [[MIT]], dengan lisensi DeepSeek untuk model itu sendiri.<ref>[https://github.com/deepseek-ai/DeepSeek-LLM deepseek-ai/DeepSeek-LLM]. DeepSeek. 27 Januari 2025.</ref>
 
Arsitekturnya pada dasarnya sama dengan seri [[Llama (model bahasa)|Llama]]. Model-model tersebut menggunakan ''pre-norm decoder-only'' [[Transformer (arsitektur pemelajaran dalam)|Transformer]] dengan [[Normalisasi (pemelajaran mesin)|RMSNorm]] sebagai normalisasi, [[Mekanisme gerbang|SwiGLU]] dalam ''feedforward layers'', ''rotary positional embedding'' (RoPE), dan ''grouped-query attention'' (GQA). Keduanya memiliki ukuran kosakata 102400 ([[Pengkodean pasangan byte|BPE tingkat byte]]) dan panjang konteks 4096. Model-model tersebut berlatih pada 2 triliun token teks bahasa Inggris dan Mandarin yang diperoleh dengan mendeduplikasi [[Common Crawl]].


Arsitekturnya pada dasarnya sama dengan seri [[Llama (model bahasa)|Llama]]. Model-model tersebut menggunakan ''pre-norm decoder-only'' [[Transformer (arsitektur pemelajaran dalam)|Transformer]] dengan [[Normalisasi (pemelajaran mesin)|RMSNorm]] sebagai normalisasi, [[Mekanisme gerbang|SwiGLU]] dalam ''feedforward layers'', ''rotary positional embedding'' (RoPE), dan ''grouped-query attention'' (GQA). Keduanya memiliki ukuran kosakata 102400 ([[Pengkodean pasangan byte|BPE tingkat byte]]) dan panjang konteks 4096. Model-model tersebut berlatih pada 2 triliun token teks bahasa Inggris dan Mandarin yang diperoleh dengan mendeduplikasi [[Common Crawl]].<ref>DeepSeek-AI. ''DeepSeek LLM: Scaling Open-Source Language Models with Longtermism''. 5 Januari 2024.</ref>
{| class="wikitable"
|+Properti DeepSeek LLM<ref>DeepSeek-AI. ''DeepSeek LLM: Scaling Open-Source Language Models with Longtermism''. 5 Januari 2024.</ref>
!.
! <math>n_{\text{layers}}</math>
! <math>d_{\text{model}}</math>
! <math>d_{\text{intermediate}}</math>
! <math>n_{\text{heads}}</math>
! <math>n_{\text{kv-heads}} </math>
|-
| 7B
| 30
| 4096
| 11008
| 32
| 32
|-
| 67B
| 95
| 8192
| 22016
| 64
| 8
|}
<sup>Perhatikan bahwa ''number of heads'' tidak sama dengan ''number of KV heads'' untuk 67B karena ''Grouped query attention'' (GQA).</sup>
<sup>Perhatikan bahwa ''number of heads'' tidak sama dengan ''number of KV heads'' untuk 67B karena ''Grouped query attention'' (GQA).</sup>


Versi <code>Chat</code> dari dua model <code>Base</code> juga dirilis secara bersamaan, diperoleh dengan melatih <code>Base</code> melalui ''supervised finetuning'' [[Pembelajaran penguatan dari umpan balik manusia|(SFT) diikuti oleh ''direct policy optimization'' (DPO)]].
Versi <code>Chat</code> dari dua model <code>Base</code> juga dirilis secara bersamaan, diperoleh dengan melatih <code>Base</code> melalui ''supervised finetuning'' [[Pembelajaran penguatan dari umpan balik manusia|(SFT) diikuti oleh ''direct policy optimization'' (DPO)]].<ref>DeepSeek-AI. ''DeepSeek LLM: Scaling Open-Source Language Models with Longtermism''. 5 Januari 2024.</ref>


Pada bulan April 2024, mereka merilis 3 model <code>DeepSeek-Math</code> yang dikhususkan untuk mengerjakan soal-soal [[matematika]]: <code>Base</code>, <code>Instruct</code>, <code>RL</code>. Pelatihannya sebagai berikut:
Pada bulan April 2024, mereka merilis 3 model <code>DeepSeek-Math</code> yang dikhususkan untuk mengerjakan soal-soal [[matematika]]: <code>Base</code>, <code>Instruct</code>, <code>RL</code>. Pelatihannya sebagai berikut:<ref>Zhihong Shao. ''DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models''. 27 April 2024.</ref>


# Inisialisasi dengan <code>DeepSeek-Coder-Base-v1.5 7B</code> yang sudah ''pretrained''.
# Inisialisasi dengan <code>DeepSeek-Coder-Base-v1.5 7B</code> yang sudah ''pretrained''.
# Lakukan ''pretraining'' lebih lanjut dengan 500B token (6% DeepSeekMath Corpus, 4% AlgebraicStack, 10% arXiv, 20% kode GitHub, 10% Common Crawl). Tahap ini menghasilkan model <code>Base</code>.
# Lakukan ''pretraining'' lebih lanjut dengan 500B token (6% DeepSeekMath Corpus, 4% AlgebraicStack, 10% arXiv, 20% kode GitHub, 10% Common Crawl). Tahap ini menghasilkan model <code>Base</code>.
# Latih ''instruction-following model'' oleh SFT <code>Base</code> dengan 776K soal matematika dan solusi ''tool-use-integrated step-by-step''. Tahap ini menghasilkan model <code>Instruct</code>.
# Latih ''instruction-following model'' oleh SFT <code>Base</code> dengan 776K soal matematika dan solusi ''tool-use-integrated step-by-step''. Tahap ini menghasilkan model <code>Instruct</code>.
# [[Reinforcement learning (pemelajaran mesin)|''Reinforcement learning'']] (RL): Model ''reward''-nya adalah ''[[Model bahasa penalaran|process reward model]]'' (PRM) yang dilatih dari <code>Base</code> sesuai dengan metode Math-Shepherd. Model ''reward'' ini kemudian digunakan untuk melatih <code>Instruct</code> menggunakan [[Policy gradient method|''group relative policy optimization'']] (GRPO) pada kumpulan data 144K pertanyaan matematika "berkaitan dengan GSM8K dan MATH". Model ''reward'' terus diperbarui selama pelatihan untuk menghindari peretasan ''reward''. Tahap ini menghasilkan model <code>RL</code>.
# [[Reinforcement learning (pemelajaran mesin)|''Reinforcement learning'']] (RL): Model ''reward''-nya adalah ''[[Model bahasa penalaran|process reward model]]'' (PRM) yang dilatih dari <code>Base</code> sesuai dengan metode Math-Shepherd.<ref>Peiyi Wang. ''Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations''. 19 February 2024.</ref> Model ''reward'' ini kemudian digunakan untuk melatih <code>Instruct</code> menggunakan [[Policy gradient method|''group relative policy optimization'']] (GRPO) pada kumpulan data 144K pertanyaan matematika "berkaitan dengan GSM8K dan MATH". Model ''reward'' terus diperbarui selama pelatihan untuk menghindari peretasan ''reward''. Tahap ini menghasilkan model <code>RL</code>.


=== V2 ===
=== V2 ===
Pada bulan Mei 2024, mereka merilis seri <code>DeepSeek-V2</code>. Seri ini mencakup 4 model, 2 model dasar (<code>DeepSeek-V2</code>, <code>DeepSeek-V2-Lite</code>) dan 2 bot percakapan (<code>-Chat</code>). Kedua model yang lebih besar dilatih sebagai berikut:
Pada bulan Mei 2024, mereka merilis seri <code>DeepSeek-V2</code>. Seri ini mencakup 4 model, 2 model dasar (<code>DeepSeek-V2</code>, <code>DeepSeek-V2-Lite</code>) dan 2 bot percakapan (<code>-Chat</code>). Kedua model yang lebih besar dilatih sebagai berikut:<ref>DeepSeek-AI. ''DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model''. 19 June 2024.</ref>


# Lakukan ''pretraining'' pada himpunan data token 8,1T dengan token berbahasa Mandarin 12% lebih banyak daripada token berbahasa Inggris.
# Lakukan ''pretraining'' pada himpunan data token 8,1T dengan token berbahasa Mandarin 12% lebih banyak daripada token berbahasa Inggris.
# Perluas ''context length'' dari 4K ke 128K menggunakan YaRN. Tahap ini menghasilkan <code>DeepSeek-V2</code>.
# Perluas ''context length'' dari 4K ke 128K menggunakan YaRN.<ref>Bowen Peng. ''YaRN: Efficient Context Window Extension of Large Language Models''. 1 November 2023.</ref> Tahap ini menghasilkan <code>DeepSeek-V2</code>.
# SFT dengan 1,2M ''instances'' untuk ''helpfulness'' dan 0,3M untuk ''safety''. Tahap ini menghasilkan <code>DeepSeek-V2-Chat (SFT)</code> yang tidak dirilis.
# SFT dengan 1,2M ''instances'' untuk ''helpfulness'' dan 0,3M untuk ''safety''. Tahap ini menghasilkan <code>DeepSeek-V2-Chat (SFT)</code> yang tidak dirilis.
# RL menggunakan GRPO dalam dua tahap. Tahap pertama dilatih untuk memecahkan masalah matematika dan pengkodean. Tahap ini menggunakan 1 model ''reward'', dilatih pada ''compiler feedback'' (untuk pengkodean) dan ''ground-truth labels'' (untuk matematika). Tahap kedua dilatih agar ''helpful'', ''safe'', dan mematuhi aturan. Tahap ini menggunakan 3 model ''reward''. Model ''reward'' atas bantuan dan keselamatan dilatih pada data preferensi manusia. Model ''rule-based'' ''reward'' diprogram secara manual. Semua model ''reward'' yang dilatih diinisialisasi dari <code>DeepSeek-V2-Chat (SFT)</code>. Tahap ini menghasilkan dirilisnya versi <code>DeepSeek-V2-Chat</code>.
# RL menggunakan GRPO dalam dua tahap. Tahap pertama dilatih untuk memecahkan masalah matematika dan pengkodean. Tahap ini menggunakan 1 model ''reward'', dilatih pada ''compiler feedback'' (untuk pengkodean) dan ''ground-truth labels'' (untuk matematika). Tahap kedua dilatih agar ''helpful'', ''safe'', dan mematuhi aturan. Tahap ini menggunakan 3 model ''reward''. Model ''reward'' atas bantuan dan keselamatan dilatih pada data preferensi manusia. Model ''rule-based'' ''reward'' diprogram secara manual. Semua model ''reward'' yang dilatih diinisialisasi dari <code>DeepSeek-V2-Chat (SFT)</code>. Tahap ini menghasilkan dirilisnya versi <code>DeepSeek-V2-Chat</code>.


Mereka memilih RL 2-tahap karena mereka menemukan bahwa RL pada data penalaran (''reasoning'') memiliki "karakteristik unik" yang berbeda dari RL pada data umum. Misalnya, RL pada penalaran dapat ditingkatkan melalui beberapa langkah pelatihan.
Mereka memilih RL 2-tahap karena mereka menemukan bahwa RL pada data penalaran (''reasoning'') memiliki "karakteristik unik" yang berbeda dari RL pada data umum. Misalnya, RL pada penalaran dapat ditingkatkan melalui beberapa langkah pelatihan.<ref>DeepSeek-AI. ''DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model''. 19 June 2024.</ref>


Kedua model <code>V2-Lite</code> merupakan model yang lebih kecil, dan dilatih secara serupa, meskipun <code>DeepSeek-V2-Lite-Chat</code> hanya menjalani SFT, bukan RL. Mereka melatih versi Lite untuk membantu "penelitian dan pengembangan lebih lanjut pada MLA dan DeepSeekMoE".
Kedua model <code>V2-Lite</code> merupakan model yang lebih kecil, dan dilatih secara serupa, meskipun <code>DeepSeek-V2-Lite-Chat</code> hanya menjalani SFT, bukan RL. Mereka melatih versi Lite untuk membantu "penelitian dan pengembangan lebih lanjut pada MLA dan DeepSeekMoE".<ref>[https://id.wikipedia.org/w/index.php?title=DeepSeek&oldid=29523370 sumber pada Wikipedia bahasa Indonesia]</ref>


Secara arsitektur, model V2 dimodifikasi secara signifikan dari seri DeepSeek LLM. Mereka mengubah mekanisme atensi standar (''standard attention mechanism'') dengan ''low-rank approximation'' yang disebut ''multi-head latent attention'' (MLA), dan menggunakan varian ''mixture of experts'' (MoE) yang sebelumnya diterbitkan pada bulan Januari. Dibandingkan dengan ''standard sparsely-gated'' MoE, varian mereka memiliki "pakar bersama" (''shared experts'') yang selalu di-''query'', dan "pakar yang dirutekan" (''routed experts'') yang mungkin tidak di-''query''.
Secara arsitektur, model V2 dimodifikasi secara signifikan dari seri DeepSeek LLM. Mereka mengubah mekanisme atensi standar (''standard attention mechanism'') dengan ''low-rank approximation'' yang disebut ''multi-head latent attention'' (MLA), dan menggunakan varian ''mixture of experts'' (MoE) yang sebelumnya diterbitkan pada bulan Januari. Dibandingkan dengan ''standard sparsely-gated'' MoE, varian mereka memiliki "pakar bersama" (''shared experts'') yang selalu di-''query'', dan "pakar yang dirutekan" (''routed experts'') yang mungkin tidak di-''query''.<ref>Damai Dai. ''DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models''. 11 Januari 2024.</ref>
{| class="wikitable"
|+Properti DeepSeek V2 <ref>DeepSeek-AI. ''DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model''. 19 June 2024.</ref><ref>[https://huggingface.co/deepseek-ai/DeepSeek-V2-Lite/blob/main/config.json config.json · deepseek-ai/DeepSeek-V2-Lite at main]. ''huggingface.co''. 15 May 2024.</ref> <ref>[https://huggingface.co/deepseek-ai/DeepSeek-V2/blob/main/config.json config.json · deepseek-ai/DeepSeek-V2 at main]. ''huggingface.co''. 6 May 2024.</ref>
! Nama
! .
! . aktif
! <math>n_{\text{layers}}</math>
! Panjang konteks
! <math>n_{\text{shared experts}}</math>
! <math>n_{\text{routed experts}}</math>
|-
| V2-Lite
| 15,7B
| 2,4B
| 27
| 32K
| 2
| 64
|-
| V2
| 236B
| 21B
| 60
| 128K
| 2
| 160
|}
''[[Financial Times]]'' melaporkan bahwa harga token ini lebih murah dibanding pesaingnya, yaitu 2 [[Renminbi|RMB]] per juta token keluaran. Papan peringkat Tiger Lab dari [[Universitas Waterloo|University of Waterloo]] menempatkan DeepSeek-V2 pada posisi ketujuh dalam peringkat LLM.<ref>Ryan McMorrow. [https://www.ft.com/content/357f3c68-b866-4c2e-b678-0d075051a260 The Chinese quant fund-turned-AI pioneer]. ''Financial Times''. 9 June 2024.</ref>


''[[Financial Times]]'' melaporkan bahwa harga token ini lebih murah dibanding pesaingnya, yaitu 2 [[Renminbi|RMB]] per juta token keluaran. Papan peringkat Tiger Lab dari [[Universitas Waterloo|University of Waterloo]] menempatkan DeepSeek-V2 pada posisi ketujuh dalam peringkat LLM.
Pada bulan Juni, mereka merilis 4 model dalam seri <code>DeepSeek-Coder-V2</code>: <code>V2-Base</code>, <code>V2-Lite-Base</code>, <code>V2-Instruct</code>, <code>V2-Lite-Instruct</code>. Model-model tersebut dilatih sebagai berikut:<ref>DeepSeek-AI. [https://arxiv.org/abs/2406.11931 DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence]. arXiv. 17 June 2024. doi:10.48550/arXiv.2406.11931.</ref>
 
Pada bulan Juni, mereka merilis 4 model dalam seri <code>DeepSeek-Coder-V2</code>: <code>V2-Base</code>, <code>V2-Lite-Base</code>, <code>V2-Instruct</code>, <code>V2-Lite-Instruct</code>. Model-model tersebut dilatih sebagai berikut:


# Model <code>Base</code> diinisialisasi dari titik pemeriksaan (''checkpoints'') ''intermediate'' yang sesuai setelah ''pretraining'' pada token 4.2T (bukan versi di akhir ''pretraining''), lalu dilatih lebih lanjut untuk token 6T, lalu diperluas konteksnya ke panjang konteks 128K. Tahap ini menghasilkan model <code>Base</code>.
# Model <code>Base</code> diinisialisasi dari titik pemeriksaan (''checkpoints'') ''intermediate'' yang sesuai setelah ''pretraining'' pada token 4.2T (bukan versi di akhir ''pretraining''), lalu dilatih lebih lanjut untuk token 6T, lalu diperluas konteksnya ke panjang konteks 128K. Tahap ini menghasilkan model <code>Base</code>.
Baris 71: Baris 138:
# RL dengan GRPO. ''Reward'' untuk soal matematika dihitung dengan membandingkannya dengan ''ground-truth label''. ''Reward'' untuk masalah kode dihasilkan oleh model ''reward'' yang dilatih untuk memprediksi apakah suatu program akan lulus uji unit.
# RL dengan GRPO. ''Reward'' untuk soal matematika dihitung dengan membandingkannya dengan ''ground-truth label''. ''Reward'' untuk masalah kode dihasilkan oleh model ''reward'' yang dilatih untuk memprediksi apakah suatu program akan lulus uji unit.


<code>DeepSeek-V2.5</code> dirilis pada bulan September dan diperbarui pada bulan Desember. Rilisan tersebut dibuat dengan menggabungkan <code>DeepSeek-V2-Chat</code> dan <code>DeepSeek-Coder-V2-Instruct</code>.
<code>DeepSeek-V2.5</code> dirilis pada bulan September dan diperbarui pada bulan Desember. Rilisan tersebut dibuat dengan menggabungkan <code>DeepSeek-V2-Chat</code> dan <code>DeepSeek-Coder-V2-Instruct</code>.<ref>[https://huggingface.co/deepseek-ai/DeepSeek-V2.5 deepseek-ai/DeepSeek-V2.5 · Hugging Face]. ''huggingface.co''. 3 Januari 2025.</ref>


=== V3 ===
=== V3 ===
Pada bulan Desember 2024, mereka merilis model dasar <code>DeepSeek-V3-Base</code> dan model bot percakapan <code>DeepSeek-V3</code>. Arsitektur modelnya pada dasarnya sama dengan V2. Model-model tersebut dilatih sebagai berikut:
Pada bulan Desember 2024, mereka merilis model dasar <code>DeepSeek-V3-Base</code> dan model bot percakapan <code>DeepSeek-V3</code>. Arsitektur modelnya pada dasarnya sama dengan V2. Model-model tersebut dilatih sebagai berikut:<ref>DeepSeek-AI. ''DeepSeek-V3 Technical Report''. 27 Desember 2024.</ref>


# ''Pretraining'' pada token 14,8T dari korpus multibahasa, sebagian besar bahasa Inggris dan Mandarin. ''Dataset'' ini berisi rasio matematika dan pemrograman yang lebih tinggi daripada ''dataset'' untuk ''pretraining'' V2.
# ''Pretraining'' pada token 14,8T dari korpus multibahasa, sebagian besar bahasa Inggris dan Mandarin. ''Dataset'' ini berisi rasio matematika dan pemrograman yang lebih tinggi daripada ''dataset'' untuk ''pretraining'' V2.
# Perluasan panjang konteks (''context length'') dua kali, dari 4K ke 32K dan kemudian ke 128K, menggunakan YaRN. Tahap ini menghasilkan <code>DeepSeek-V</code> <code>3-Base</code>.
# Perluasan panjang konteks (''context length'') dua kali, dari 4K ke 32K dan kemudian ke 128K, menggunakan YaRN.<ref>Bowen Peng. ''YaRN: Efficient Context Window Extension of Large Language Models''. 1 November 2023.</ref> Tahap ini menghasilkan <code>DeepSeek-V</code> <code>3-Base</code>.
# SFT selama 2 periode pada 1,5M sampel data penalaran (matematika, pemrograman, logika) dan non-penalaran (penulisan kreatif, permainan peran, jawaban pertanyaan sederhana). Data penalaran dihasilkan oleh "model ahli". Data non-penalaran dihasilkan oleh <code>DeepSeek-V2.5</code> dan diperiksa oleh manusia.
# SFT selama 2 periode pada 1,5M sampel data penalaran (matematika, pemrograman, logika) dan non-penalaran (penulisan kreatif, permainan peran, jawaban pertanyaan sederhana). Data penalaran dihasilkan oleh "model ahli". Data non-penalaran dihasilkan oleh <code>DeepSeek-V2.5</code> dan diperiksa oleh manusia.
#* "Model pakar" (''expert models'') dilatih dengan memulai dengan model dasar yang tidak ditentukan, lalu SFT pada data <code><problem, original response></code>, dan data sintetis <code><system prompt, problem, R1 response></code> yang dihasilkan oleh model <code>DeepSeek-R1</code> internal. Perintah sistem meminta <code>R1</code> untuk berpikir dan memverifikasi selama berpikir. Kemudian, model ahli RL menggunakan fungsi imbalan yang tidak ditentukan.
#* "Model pakar" (''expert models'') dilatih dengan memulai dengan model dasar yang tidak ditentukan, lalu SFT pada data <code><problem, original response></code>, dan data sintetis <code><system prompt, problem, R1 response></code> yang dihasilkan oleh model <code>DeepSeek-R1</code> internal. Perintah sistem meminta <code>R1</code> untuk berpikir dan memverifikasi selama berpikir. Kemudian, model ahli RL menggunakan fungsi imbalan yang tidak ditentukan.
Baris 85: Baris 152:
# ''Checkpoint'' SFT <code>V3</code> dilatih oleh GRPO menggunakan ''model-based'' ''reward'' dan ''rule-based'' ''reward''. ''Rule-based reward'' dihitung untuk soal matematika dengan jawaban akhir (dimasukkan ke dalam kotak), dan untuk soal pemrograman dengan uji unit. Tahap ini menghasilkan <code>DeepSeek-V3</code>.
# ''Checkpoint'' SFT <code>V3</code> dilatih oleh GRPO menggunakan ''model-based'' ''reward'' dan ''rule-based'' ''reward''. ''Rule-based reward'' dihitung untuk soal matematika dengan jawaban akhir (dimasukkan ke dalam kotak), dan untuk soal pemrograman dengan uji unit. Tahap ini menghasilkan <code>DeepSeek-V3</code>.


{| class="wikitable"
|+Properti DeepSeek V3 <ref>DeepSeek-AI. ''DeepSeek-V3 Technical Report''. 27 Desember 2024.</ref><ref>[https://huggingface.co/deepseek-ai/DeepSeek-V3/blob/main/config.json config.json · deepseek-ai/DeepSeek-V3 at main]. ''huggingface.co''. 26 Desember 2024.</ref>
! Nama
! .
!  aktif
! <math>n_{\text{layers}}</math>
! Panjang konteks
! <math>n_{\text{shared experts}}</math>
! <math>n_{\text{routed experts}}</math>
|-
| V3
| 671B
| 37B
| 61
| 128K
| 1
| 256
|}
Mereka melakukan rekayasa tingkat rendah yang ekstensif untuk mencapai efisiensi. Mereka menggunakan ''[[mixed-precision arithmetic]]''. Sebagian besar pemindahan data ke depan dilakukan dalam [[Aritmetika titik kambang|bilangan floating point 8-bit]] (5E2M: eksponen 5-bit dan [[Significand|mantissa]] 2-bit) dan bukan dalam format standar 32-bit sehingga memerlukan rutinitas [[Subprogram Aljabar Linear Dasar|GEMM]] khusus untuk mengakumulasi secara akurat. Mereka menggunakan float 12-bit khusus (E5M6) ''hanya'' untuk masukan ke lapisan linier setelah modul atensi. Status pengoptimal berada dalam 16-bit (BF16). Mereka meminimalkan latensi komunikasi dengan melakukan tumpang tindih komputasi dan komunikasi secara ekstensif, seperti mendedikasikan 20 [[Unit pemroses grafis|''multiprosesor streaming'']] dari 132 per H800 hanya untuk komunikasi antar-GPU. Mereka menurunkan komunikasi dengan mengatur ulang (setiap 10 menit) mesin yang digunakan oleh masing-masing ahli untuk menghindari mesin tertentu yang lebih sering diakses daripada mesin lainnya, menambahkan kerugian penyeimbangan beban tambahan ke fungsi kerugian pelatihan, dan teknik penyeimbangan beban lainnya.<ref>DeepSeek-AI. ''DeepSeek-V3 Technical Report''. 27 Desember 2024.</ref>


Mereka melakukan rekayasa tingkat rendah yang ekstensif untuk mencapai efisiensi. Mereka menggunakan ''[[mixed-precision arithmetic]]''. Sebagian besar pemindahan data ke depan dilakukan dalam [[Aritmetika titik kambang|bilangan floating point 8-bit]] (5E2M: eksponen 5-bit dan [[Significand|mantissa]] 2-bit) dan bukan dalam format standar 32-bit sehingga memerlukan rutinitas [[Subprogram Aljabar Linear Dasar|GEMM]] khusus untuk mengakumulasi secara akurat. Mereka menggunakan float 12-bit khusus (E5M6) ''hanya'' untuk masukan ke lapisan linier setelah modul atensi. Status pengoptimal berada dalam 16-bit (BF16). Mereka meminimalkan latensi komunikasi dengan melakukan tumpang tindih komputasi dan komunikasi secara ekstensif, seperti mendedikasikan 20 [[Unit pemroses grafis|''multiprosesor streaming'']] dari 132 per H800 hanya untuk komunikasi antar-GPU. Mereka menurunkan komunikasi dengan mengatur ulang (setiap 10 menit) mesin yang digunakan oleh masing-masing ahli untuk menghindari mesin tertentu yang lebih sering diakses daripada mesin lainnya, menambahkan kerugian penyeimbangan beban tambahan ke fungsi kerugian pelatihan, dan teknik penyeimbangan beban lainnya.
Setelah pelatihan, ia disebarkan pada klaster H800. H800 dalam satu klaster dihubungkan melalui NVLink. Klaster-klaster tersebut dihubungkan oleh InfiniBand.<ref>DeepSeek-AI. ''DeepSeek-V3 Technical Report''. 27 Desember 2024.</ref>
 
{| class="wikitable"
Setelah pelatihan, ia disebarkan pada klaster H800. H800 dalam satu klaster dihubungkan melalui NVLink. Klaster-klaster tersebut dihubungkan oleh InfiniBand.
|+Total biaya pelatihan model DeepSeek-V3<ref>DeepSeek-AI. ''DeepSeek-V3 Technical Report''. 27 Desember 2024.</ref>
 
!''Stage''
Pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') menunjukkan bahwa DeepSeek-V3 mengungguli [[Llama (model bahasa)|Llama]] 3.1 dan [[Qwen]] 2.5 sambil menyamai [[GPT-4o]] dan [[Claude (model bahasa)|Claude]] 3.5 Sonnet.
! Biaya (dalam seribu jam GPU)
! Biaya (dalam satu juta USD$)
|-
| ''Pre-training''
| 2.664
| 5.328
|-
| ''Context extension''
| 119
| 0.24
|-
| ''Fine-tuning''
| 5
| 0,01
|-
| Total
| 2.788
| 5.576
|}
Pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') menunjukkan bahwa DeepSeek-V3 mengungguli [[Llama (model bahasa)|Llama]] 3.1 dan [[Qwen]] 2.5 sambil menyamai [[GPT-4o]] dan [[Claude (model bahasa)|Claude]] 3.5 Sonnet.<ref>Ben Jiang. [https://www.scmp.com/tech/tech-trends/article/3293050/meet-deepseek-chinese-start-changing-how-ai-models-are-trained Meet DeepSeek: the Chinese start-up that is changing how AI models are trained]. ''South China Morning Post''. 1 Januari 2025.</ref><ref>Ben Jiang. [https://www.scmp.com/tech/tech-trends/article/3292507/chinese-start-deepseek-launches-ai-model-outperforms-meta-openai-products Chinese start-up DeepSeek's new AI model outperforms Meta, OpenAI products]. ''South China Morning Post''. 27 Desember 2024.</ref><ref>Shubham Sharma. [https://venturebeat.com/ai/deepseek-v3-ultra-large-open-source-ai-outperforms-llama-and-qwen-on-launch/ DeepSeek-V3, ultra-large open-source AI, outperforms Llama and Qwen on launch]. ''VentureBeat''. 26 Desember 2024.</ref><ref>Kyle Wiggers. [https://techcrunch.com/2024/12/26/deepseeks-new-ai-model-appears-to-be-one-of-the-best-open-challengers-yet/ DeepSeek's new AI model appears to be one of the best 'open' challengers yet]. ''TechCrunch''. 26 Desember 2024.</ref>


=== R1 ===
=== R1 ===
Pada tanggal 20 November 2024, <code>DeepSeek-R1-Lite-Preview</code> dapat diakses melalui API DeepSeek dan situs web [https://chat.deepseek.com/ chat.deepseek.com]. Ia dilatih untuk inferensi logis, penalaran matematika, dan pemecahan masalah ''real-time''. DeepSeek mengklaim bahwa kinerjanya melampaui [[OpenAI o1]] pada pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') seperti [[American Invitational Mathematics Examination]] (AIME) dan MATH. Namun, ''[[The Wall Street Journal]]'' menyatakan ketika menggunakan 15 masalah dari edisi AIME 2024, model o1 mendapatkan solusi untuk soal matematika lebih cepat daripada <code>DeepSeek-R1-Lite-Preview</code>.
Pada tanggal 20 November 2024, <code>DeepSeek-R1-Lite-Preview</code> dapat diakses melalui API DeepSeek dan situs web [https://chat.deepseek.com/ chat.deepseek.com].<ref>[https://api-docs.deepseek.com/news/news1120 News DeepSeek-R1-Lite Release 2024/11/20: 🚀 DeepSeek-R1-Lite-Preview is now live: unleashing supercharged reasoning power!]. ''DeepSeek API Docs''.</ref> Ia dilatih untuk inferensi logis, penalaran matematika, dan pemecahan masalah ''real-time''. DeepSeek mengklaim bahwa kinerjanya melampaui [[OpenAI o1]] pada pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') seperti [[American Invitational Mathematics Examination]] (AIME) dan MATH. <ref>Carl Franzen. [https://venturebeat.com/ai/deepseeks-first-reasoning-model-r1-lite-preview-turns-heads-beating-openai-o1-performance/ DeepSeek's first reasoning model R1-Lite-Preview turns heads, beating OpenAI o1 performance]. ''VentureBeat''. 20 November 2024.</ref> Namun, ''[[The Wall Street Journal]]'' menyatakan ketika menggunakan 15 masalah dari edisi AIME 2024, model o1 mendapatkan solusi untuk soal matematika lebih cepat daripada <code>DeepSeek-R1-Lite-Preview</code>.<ref>Raffaele Huang. [https://www.wsj.com/tech/ai/china-ai-advances-us-chips-7838fd20 Don't Look Now, but China's AI Is Catching Up Fast]. ''The Wall Street Journal''. 24 Desember 2024.</ref>


Pada tanggal 20 Januari 2025, <code>DeepSeek-R1</code> dan <code>DeepSeek-R1-Zero</code> dirilis. Keduanya diinisialisasi dari <code>DeepSeek-V3-Base</code>. Perusahaan ini juga merilis beberapa model "<code>DeepSeek-R1-Distill</code>", yang ''tidak'' diinisialisasi pada <code>V3-Base</code>, tetapi diinisialisasi dari model ''pretrained'' ''open-weight'' lainnya, termasuk [[LLaMA (model bahasa)|LLaMA]] dan [[Qwen]], kemudian disempurnakan pada [[data sintetis]] yang dihasilkan oleh <code>R1</code>.
Pada tanggal 20 Januari 2025, <code>DeepSeek-R1</code> dan <code>DeepSeek-R1-Zero</code> dirilis.<ref>[https://github.com/deepseek-ai/DeepSeek-R1/commit/23807ced51627276434655dd9f27725354818974 Release DeepSeek-R1 · deepseek-ai/DeepSeek-R1@23807ce]. ''GitHub''.</ref> Keduanya diinisialisasi dari <code>DeepSeek-V3-Base</code>. Perusahaan ini juga merilis beberapa model "<code>DeepSeek-R1-Distill</code>", yang ''tidak'' diinisialisasi pada <code>V3-Base</code>, tetapi diinisialisasi dari model ''pretrained'' ''open-weight'' lainnya, termasuk [[LLaMA (model bahasa)|LLaMA]] dan [[Qwen]], kemudian disempurnakan pada [[data sintetis]] yang dihasilkan oleh <code>R1</code>.<ref>DeepSeek-AI. ''DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning''. 22 Januari 2025.</ref>


<code>DeepSeek-R1-Zero</code> dilatih secara eksklusif menggunakan GRPO RL tanpa SFT. Tidak seperti versi sebelumnya, mereka tidak menggunakan ''reward'' berbasis model. Semua ''rule-based reward'', "terutama" dari dua jenis (jenis lainnya tidak ditentukan): ''reward'' akurasi dan ''reward'' format. ''Reward'' akurasi memeriksa apakah jawaban yang diberikan tanda kotak itu benar (untuk matematika) atau apakah suatu kode lulus uji (untuk pemrograman). Format ''reward'' memeriksa penempatan ''thinking trace'' model tersebut dalam <code><think>...</code> <code></think></code>.
<code>DeepSeek-R1-Zero</code> dilatih secara eksklusif menggunakan GRPO RL tanpa SFT. Tidak seperti versi sebelumnya, mereka tidak menggunakan ''reward'' berbasis model. Semua ''rule-based reward'', "terutama" dari dua jenis (jenis lainnya tidak ditentukan): ''reward'' akurasi dan ''reward'' format. ''Reward'' akurasi memeriksa apakah jawaban yang diberikan tanda kotak itu benar (untuk matematika) atau apakah suatu kode lulus uji (untuk pemrograman). Format ''reward'' memeriksa penempatan ''thinking trace'' model tersebut dalam <code><think>...</code> <code></think></code>.<ref>DeepSeek-AI. ''DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning''. 22 Januari 2025.</ref>


Oleh karena <code>R1-Zero</code> memiliki masalah terkait keterbacaan (''readability'') dan pencampuran bahasa, <code>R1</code> dilatih untuk mengatasi masalah ini dan lebih meningkatkan penalaran:
Oleh karena <code>R1-Zero</code> memiliki masalah terkait keterbacaan (''readability'') dan pencampuran bahasa, <code>R1</code> dilatih untuk mengatasi masalah ini dan lebih meningkatkan penalaran:<ref>DeepSeek-AI. ''DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning''. 22 Januari 2025.</ref>


# SFT <code>DeepSeek-V3-Base</code> pada "ribuan" data "''cold-start''" semuanya dengan format standar <code>|special_token|<reasoning_process>|special_token|summary></code>.
# SFT <code>DeepSeek-V3-Base</code> pada "ribuan" data "''cold-start''" semuanya dengan format standar <code>|special_token|<reasoning_process>|special_token|summary></code>.
Baris 110: Baris 215:


== Kesan ==
== Kesan ==
DeepSeek merilis [[Asisten virtual|Asisten AI]]-nya, yang menggunakan model V3 sebagai [[Bot percakapan|aplikasi bot percakapan]] untuk [[IOS|iOS Apple]] dan [[Android (sistem operasi)|Android]]. Pada 27 Januari 2025, aplikasi ini telah melampaui [[ChatGPT]] sebagai aplikasi gratis dengan peringkat tertinggi di iOS App Store di Amerika Serikat; bot percakapannya dilaporkan dapat menjawab pertanyaan, memecahkan masalah logika, dan menulis program komputer setara dengan bot percakapan lain di pasaran, menurut pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') yang digunakan oleh perusahaan AI Amerika.
DeepSeek merilis [[Asisten virtual|Asisten AI]]-nya, yang menggunakan model V3 sebagai [[Bot percakapan|aplikasi bot percakapan]] untuk [[IOS|iOS Apple]] dan [[Android (sistem operasi)|Android]]. Pada 27 Januari 2025, aplikasi ini telah melampaui [[ChatGPT]] sebagai aplikasi gratis dengan peringkat tertinggi di iOS App Store di Amerika Serikat; bot percakapannya dilaporkan dapat menjawab pertanyaan, memecahkan masalah logika, dan menulis program komputer setara dengan bot percakapan lain di pasaran, menurut pengujian [[Tolok ukur (komputasi)|tolok ukur]] (''benchmark'') yang digunakan oleh perusahaan AI Amerika.<ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref>


DeepSeek-V3 menggunakan sumber daya yang jauh lebih sedikit dibandingkan dengan pesaingnya; misalnya, sementara perusahaan AI terkemuka di dunia melatih chatbot mereka dengan [[superkomputer]] yang menggunakan sebanyak 16.000 [[Sirkuit terpadu|sirkuit terpadu ("cip komputer")]], jika tidak lebih, DeepSeek mengklaim hanya membutuhkan sekitar 2.000 cip komputer khusus, yaitu seri H800 dari perusahaan teknologi multinasional Amerika Nvidia. Pelatihan ini memakan waktu sekitar 55 hari dengan biaya sebesar US$5,58 juta, yang kira-kira 10 kali lebih sedikit dari jumlah yang dikeluarkan oleh raksasa teknologi AS, [[Meta Platforms|Meta]], untuk membangun teknologi AI terbarunya.
DeepSeek-V3 menggunakan sumber daya yang jauh lebih sedikit dibandingkan dengan pesaingnya; misalnya, sementara perusahaan AI terkemuka di dunia melatih chatbot mereka dengan [[superkomputer]] yang menggunakan sebanyak 16.000 [[Sirkuit terpadu|sirkuit terpadu ("cip komputer")]], jika tidak lebih, DeepSeek mengklaim hanya membutuhkan sekitar 2.000 cip komputer khusus, yaitu seri H800 dari perusahaan teknologi multinasional Amerika Nvidia. Pelatihan ini memakan waktu sekitar 55 hari dengan biaya sebesar US$5,58 juta,<ref>DeepSeek-AI. ''DeepSeek-V3 Technical Report''. 27 Desember 2024.</ref> yang kira-kira 10 kali lebih sedikit dari jumlah yang dikeluarkan oleh raksasa teknologi AS, [[Meta Platforms|Meta]], untuk membangun teknologi AI terbarunya.<ref>Cade Metz. [https://www.nytimes.com/2025/01/23/technology/deepseek-china-ai-chips.html?smid=fb-nytimes&smtyp=cur&fbclid=IwY2xjawIEynFleHRuA2FlbQIxMQABHZYKXN7GJpUyNRsaGEDQVadxRBarp-aBp1GhiuRe3B57Ehe6HYv7oiK78Q_aem_KTeDgqjV_-R80owNNWOBCQ How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants]. ''The New York Times''. 23 Januari 2025.</ref>


Performa kompetitif DeepSeek telah diakui berpotensi menantang dominasi global model AI Amerika; sebuah opini oleh [[The Hill (surat kabar)|''The Hill'']] menggambarkan peluncuran bot percakapannya sebagai "[[Krisis Sputnik|momen Sputnik]]" untuk AI Amerika. Optimalisasi sumber daya terbatas DeepSeek telah menyoroti potensi batasan sanksi AS terhadap pengembangan AI Tiongkok, yang mencakup pembatasan ekspor cip AI canggih ke Tiongkok. Keberhasilan model DeepSeek kemudian "memicu kekacauan pasar" dan menyebabkan saham-saham di perusahaan-perusahaan teknologi global jatuh pada tanggal 27 Januari: saham Nvidia jatuh hingga 17–18%, dan begitu pula saham perusahaan pesaingnya, [[Broadcom Inc.|Broadcom]]. Perusahaan teknologi lain juga mengalami kemerosotan, termasuk Microsoft (turun 2,5%), [[Alphabet Inc.|Alphabet]] induk [[Google]] (turun lebih dari 4%), dan pembuat peralatan cip asal Belanda, [[ASML Holding|ASML]] (turun lebih dari 7%).
Performa kompetitif DeepSeek telah diakui berpotensi menantang dominasi global model AI Amerika;<ref>[https://www.reuters.com/technology/artificial-intelligence/chinese-ai-startup-deepseek-overtakes-chatgpt-apple-app-store-2025-01-27/ Chinese AI startup DeepSeek overtakes ChatGPT on Apple App Store]. ''Reuters''. 27 Januari 2025.</ref> sebuah opini oleh [[The Hill (surat kabar)|''The Hill'']] menggambarkan peluncuran bot percakapannya sebagai "[[Krisis Sputnik|momen Sputnik]]" untuk AI Amerika.<ref>David Wade. [https://thehill.com/opinion/technology/5024271-ai-sputnik-moment-china-challenge/ American AI has reached its Sputnik moment]. ''The Hill''. 6 Desember 2024.</ref> Optimalisasi sumber daya terbatas DeepSeek telah menyoroti potensi batasan sanksi AS terhadap pengembangan AI Tiongkok, yang mencakup pembatasan ekspor cip AI canggih ke Tiongkok.<ref>Ben Jiang. [https://www.scmp.com/tech/tech-trends/article/3293050/meet-deepseek-chinese-start-changing-how-ai-models-are-trained Meet DeepSeek: the Chinese start-up that is changing how AI models are trained]. ''South China Morning Post''. 1 Januari 2025.</ref><ref>Anton Shilov. [https://www.tomshardware.com/tech-industry/artificial-intelligence/chinese-ai-company-says-breakthroughs-enabled-creating-a-leading-edge-ai-model-with-11x-less-compute-deepseeks-optimizations-highlight-limits-of-us-sanctions Chinese AI company's AI model breakthrough highlights limits of US sanctions]. ''Tom's Hardware''. 27 Desember 2024.</ref> Keberhasilan model DeepSeek kemudian "memicu kekacauan pasar"<ref>[https://www.bbc.co.uk/news/live/cjr85l2e4l4t DeepSeek updates - Chinese AI chatbot sparks US market turmoil, wiping $500bn off Nvidia]. ''BBC News''.</ref> dan menyebabkan saham-saham di perusahaan-perusahaan teknologi global jatuh pada tanggal 27 Januari: saham Nvidia jatuh hingga 17–18%,<ref>Rita Nazareth. [https://www.bloomberg.com/news/articles/2025-01-26/asia-eyes-cautious-open-as-tariffs-remain-in-focus-markets-wrap Stock Rout Gets Ugly as Nvidia Extends Loss to 17%: Markets Wrap]. ''Bloomberg''. 26 Januari 2025.</ref> dan begitu pula saham perusahaan pesaingnya, [[Broadcom Inc.|Broadcom]]. Perusahaan teknologi lain juga mengalami kemerosotan, termasuk Microsoft (turun 2,5%), [[Alphabet Inc.|Alphabet]] induk [[Google]] (turun lebih dari 4%), dan pembuat peralatan cip asal Belanda, [[ASML Holding|ASML]] (turun lebih dari 7%).<ref>[https://www.bbc.com/news/articles/c0qw7z2v1pgo DeepSeek Chinese AI chatbot sparks market turmoil for rivals]. ''www.bbc.com''. 27 Januari 2025.</ref>


Performa <code>R1</code> dilaporkan "setara" dengan salah satu model terbaru OpenAI saat digunakan untuk tugas-tugas seperti matematika, pengkodean, dan penalaran bahasa alami; menggemakan opini ''The Hill'' tentang <code>V3</code>'','' kapitalis ventura [[Lembah Silikon]] Amerika, [[Marc Andreessen]], juga menggambarkan <code>R1</code> sebagai "momen [[Program Sputnik|Sputnik]] AI".
Performa <code>R1</code> dilaporkan "setara" dengan salah satu model terbaru OpenAI saat digunakan untuk tugas-tugas seperti matematika, pengkodean, dan penalaran bahasa alami;<ref>[https://www.bbc.com/news/articles/c0qw7z2v1pgo DeepSeek Chinese AI chatbot sparks market turmoil for rivals]. ''www.bbc.com''. 27 Januari 2025.</ref> menggemakan opini ''The Hill'' tentang <code>V3</code>'','' kapitalis ventura [[Lembah Silikon]] Amerika, [[Marc Andreessen]], juga menggambarkan <code>R1</code> sebagai "momen [[Program Sputnik|Sputnik]] AI".<ref>[https://www.bbc.com/news/articles/c0qw7z2v1pgo DeepSeek Chinese AI chatbot sparks market turmoil for rivals]. ''www.bbc.com''. 27 Januari 2025.</ref>


Penjualan saham teknologi global di [[Nasdaq]], didorong oleh rilis model <code>R1</code>, telah menyebabkan kerugian rekor sekitar $593 miliar pada kapitalisasi pasar perusahaan AI dan [[Perangkat keras|perangkat keras komputer]].
Penjualan saham teknologi global di [[Nasdaq]], didorong oleh rilis model <code>R1</code>, telah menyebabkan kerugian rekor sekitar $593 miliar pada kapitalisasi pasar perusahaan AI dan [[Perangkat keras|perangkat keras komputer]].<ref>[https://www.reuters.com/technology/chinas-deepseek-sets-off-ai-market-rout-2025-01-27/ DeepSeek sparks global AI selloff, Nvidia losses about $593 billion of value]. Reuters. 27 Januari 2025.</ref>


''The Guardian'' membandingkan DeepSeek dengan "Sputnik" Perang Dingin yang mengakibatkan nilai saham Amerika merosot hingga $1 triliun, sementara Presiden Amerika, [[Donald Trump]], menyebutnya sebagai peringatan dan perkembangan yang positif.
''The Guardian'' membandingkan DeepSeek dengan "Sputnik" Perang Dingin yang mengakibatkan nilai saham Amerika merosot hingga $1 triliun, sementara Presiden Amerika, [[Donald Trump]], menyebutnya sebagai peringatan<ref>Eva Dou. [https://www.washingtonpost.com/business/2025/01/27/deep-seek-ai-markets-nvidia/ Trump calls China’s DeepSeek AI app a ‘wake-up call’ after tech stocks slide]. ''The Washington Post''. 28 Januari 2025.</ref> dan perkembangan yang positif.<ref>Sareen Habeshian. [https://www.axios.com/2025/01/28/trump-mike-johnson-china-deepseek-ai Johnson bashes China on AI, Trump calls DeepSeek development "positive"]. ''Axios''. 28 Januari 2025.</ref><ref>Dan Milmo. [https://www.theguardian.com/business/2025/jan/27/tech-shares-asia-europe-fall-china-ai-deepseek 'Sputnik moment': $1tn wiped off US stocks after Chinese firm unveils AI chatbot]. 28 Januari 2025.</ref><ref>[https://www.bbc.com/news/articles/c0qw7z2v1pgo Nvidia shares sink as Chinese AI app DeepSeek spooks US markets]. ''www.bbc.com''. 27 Januari 2025.</ref><ref>Jason Karaian. [https://www.nytimes.com/2025/01/27/business/us-stock-market-deepseek-ai-sp500-nvidia.html China's A.I. Advances Spook Big Tech Investors on Wall Street]. 27 Januari 2025.</ref>


Pada tanggal 27 Januari, DeepSeek membatasi pendaftaran pengguna baru hanya untuk nomor telepon yang berasal dari [[daratan Tiongkok]] setelah adanya laporan [[serangan siber]].
Pada tanggal 27 Januari, DeepSeek membatasi pendaftaran pengguna baru hanya untuk nomor telepon yang berasal dari [[daratan Tiongkok]] setelah adanya laporan [[serangan siber]].<ref>Dara Kerr. [https://www.theguardian.com/technology/2025/jan/27/deepseek-cyberattack-ai DeepSeek hit with 'large-scale' cyber-attack after AI chatbot tops app stores]. 27 Januari 2025.</ref><ref>Steven Tweedie. [https://www.businessinsider.com/deepseek-issues-account-registration-limited-china-phone-numbers-malicious-attack-2025-1 DeepSeek temporarily limited new sign-ups, citing 'large-scale malicious attacks']. ''Business Insider''.</ref>


[[Amazon Web Services]], [[Toyota]], dan [[Stripe, Inc.|Stripe]] telah mencoba menggunakan model ini dalam program mereka.
[[Amazon Web Services]], [[Toyota]], dan [[Stripe, Inc.|Stripe]] telah mencoba menggunakan model ini dalam program mereka.<ref>Eugene Kim. [https://www.businessinsider.com/aws-deepseek-customer-cloud-access-bedrock-stripe-toyota-cisco-workday-2025-1 Big AWS customers, including Stripe and Toyota, are hounding the cloud giant for access to DeepSeek AI models]. ''Business Insider''.</ref>


== Kekhawatiran ==
== Kekhawatiran ==
=== Penyensoran ===
=== Penyensoran ===
Beberapa sumber telah mengamati bahwa versi API resmi R1 menggunakan mekanisme [[penyensoran]] untuk topik yang dianggap sensitif secara politik bagi [[Pemerintah Tiongkok|pemerintah Republik Rakyat Tiongkok]]. Misalnya, model tersebut menolak menjawab pertanyaan tentang [[Unjuk rasa Tiananmen 1989|protes dan pembantaian Lapangan Tiananmen 1989]], [[Penindasan Uighur di Tiongkok|penganiayaan terhadap warga Uighur]], atau [[hak asasi manusia di Tiongkok]].<ref>Matthew Field. [https://www.telegraph.co.uk/business/2025/01/27/chinese-deepseek-ai-has-sparked-a-1-trillion-panic/ Chinese AI has sparked a $1 trillion panic – and it doesn't care about free speech]. ''The Daily Telegraph''. 27 Januari 2025.</ref><ref>Jakob Steinschaden. [https://www.trendingtopics.eu/deepseek-this-is-what-live-censorship-looks-like-in-the-chinese-ai-chatbot/ DeepSeek: This is what live censorship looks like in the Chinese AI chatbot]. ''Trending Topics''. 27 Januari 2025.</ref>


Beberapa sumber telah mengamati bahwa versi API resmi R1 menggunakan mekanisme [[penyensoran]] untuk topik yang dianggap sensitif secara politik bagi [[Pemerintah Tiongkok|pemerintah Republik Rakyat Tiongkok]]. Misalnya, model tersebut menolak menjawab pertanyaan tentang [[Unjuk rasa Tiananmen 1989|protes dan pembantaian Lapangan Tiananmen 1989]], [[Penindasan Uighur di Tiongkok|penganiayaan terhadap warga Uighur]], atau [[hak asasi manusia di Tiongkok]].
AI mungkin awalnya menghasilkan jawaban, tetapi kemudian menghapusnya segera setelahnya dan menggantinya dengan pesan seperti: "Maaf, itu di luar jangkauan saya saat ini. Mari kita bicarakan hal lain."<ref>Jakob Steinschaden. [https://www.trendingtopics.eu/deepseek-this-is-what-live-censorship-looks-like-in-the-chinese-ai-chatbot/ DeepSeek: This is what live censorship looks like in the Chinese AI chatbot]. ''Trending Topics''. 27 Januari 2025.</ref> Mekanisme dan pembatasan sensor terintegrasi hanya dapat dihapus sampai batas tertentu dalam versi sumber terbuka model R1. Jika “[[Nilai-nilai Sosialis Inti|nilai-nilai sosialis inti]]” yang ditetapkan oleh [[Cyberspace Administration of China|otoritas regulasi internet Tiongkok]] disinggung atau [[status politik Taiwan]] diangkat, diskusi akan dihentikan.<ref>[https://www.theguardian.com/commentisfree/2025/jan/26/the-guardian-view-on-a-global-ai-race-geopolitics-innovation-and-the-rise-of-chaos The Guardian view on a global AI race: geopolitics, innovation and the rise of chaos]. ''The Guardian''. 26 Januari 2025.</ref>
 
AI mungkin awalnya menghasilkan jawaban, tetapi kemudian menghapusnya segera setelahnya dan menggantinya dengan pesan seperti: "Maaf, itu di luar jangkauan saya saat ini. Mari kita bicarakan hal lain." Mekanisme dan pembatasan sensor terintegrasi hanya dapat dihapus sampai batas tertentu dalam versi sumber terbuka model R1. Jika “[[Nilai-nilai Sosialis Inti|nilai-nilai sosialis inti]]” yang ditetapkan oleh [[Cyberspace Administration of China|otoritas regulasi internet Tiongkok]] disinggung atau [[status politik Taiwan]] diangkat, diskusi akan dihentikan.


Ketika diuji oleh [[NBC News]], R1 DeepSeek menggambarkan [[Taiwan]] sebagai "bagian yang tidak dapat dipindahtangankan dari wilayah Tiongkok," dan menyatakan: "Kami dengan tegas menentang segala bentuk kegiatan separatis '[[Gerakan kemerdekaan Taiwan|kemerdekaan Taiwan]]' dan berkomitmen untuk mencapai penyatuan kembali tanah air secara penuh melalui cara damai."
Ketika diuji oleh [[NBC News]], R1 DeepSeek menggambarkan [[Taiwan]] sebagai "bagian yang tidak dapat dipindahtangankan dari wilayah Tiongkok," dan menyatakan: "Kami dengan tegas menentang segala bentuk kegiatan separatis '[[Gerakan kemerdekaan Taiwan|kemerdekaan Taiwan]]' dan berkomitmen untuk mencapai penyatuan kembali tanah air secara penuh melalui cara damai."<ref>[https://www.nbcnews.com/tech/tech-news/china-ai-assistant-deepseek-rcna189385 Chinese AI DeepSeek jolts Silicon Valley, giving the AI race its 'Sputnik moment']. ''NBC News''. 27 Januari 2025.</ref>


Pada bulan Januari 2025, para peneliti Barat berhasil mengelabui DeepSeek agar memberikan jawaban yang akurat untuk beberapa topik ini dengan menyesuaikan pertanyaan yang diajukan.
Pada bulan Januari 2025, para peneliti Barat berhasil mengelabui DeepSeek agar memberikan jawaban yang akurat untuk beberapa topik ini dengan menyesuaikan pertanyaan yang diajukan.<ref>Donna Lu. [https://www.theguardian.com/technology/2025/jan/28/we-tried-out-deepseek-it-works-well-until-we-asked-it-about-tiananmen-square-and-taiwan We tried out DeepSeek. It worked well, until we asked it about Tiananmen Square and Taiwan]. ''The Guardian''. 28 Januari 2025.</ref>


=== Keamanan dan privasi ===
=== Keamanan dan privasi ===
Ada pula kekhawatiran bahwa sistem AI ini dapat digunakan untuk pengaruh asing, menyebarkan [[disinformasi]], [[pengawasan]], dan pengembangan [[senjata siber]] untuk dinas rahasia Tiongkok. Syarat dan ketentuan privasi DeepSeek menyatakan "Kami menyimpan [[Data pribadi|informasi yang kami kumpulkan]] di server aman yang berlokasi di Republik Rakyat Tiongkok. Kami dapat mengumpulkan masukan teks atau audio, perintah, file yang diunggah, umpan balik, riwayat obrolan, atau konten lain yang Anda berikan kepada model dan layanan-layanan kami". Hal ini menimbulkan kekhawatiran keamanan; lebih banyak data pribadi yang berpotensi dikumpulkan dibandingkan dengan perangkat lunak Tiongkok seperti [[TikTok]], yang memoderasi pengumpulan datanya sebagai respons terhadap [[TikTok|kekhawatiran AS]].
Ada pula kekhawatiran bahwa sistem AI ini dapat digunakan untuk pengaruh asing, menyebarkan [[disinformasi]], [[pengawasan]], dan pengembangan [[senjata siber]] untuk dinas rahasia Tiongkok.<ref>Anthony Kimery. [https://www.biometricupdate.com/202501/chinas-deepseek-ai-poses-formidable-cyber-data-privacy-threats China's DeepSeek AI poses formidable cyber, data privacy threats]. ''Biometric Update''. 26 Januari 2025.</ref><ref>Dan Milmo. [https://www.theguardian.com/technology/2025/jan/28/experts-urge-caution-over-use-of-chinese-ai-deepseek Experts urge caution over use of Chinese AI DeepSeek]. ''The Guardian''. 28 Januari 2025.</ref> Syarat dan ketentuan privasi DeepSeek menyatakan "Kami menyimpan [[Data pribadi|informasi yang kami kumpulkan]] di server aman yang berlokasi di Republik Rakyat Tiongkok. Kami dapat mengumpulkan masukan teks atau audio, perintah, file yang diunggah, umpan balik, riwayat obrolan, atau konten lain yang Anda berikan kepada model dan layanan-layanan kami". Hal ini menimbulkan kekhawatiran keamanan; lebih banyak data pribadi yang berpotensi dikumpulkan dibandingkan dengan perangkat lunak Tiongkok seperti [[TikTok]], yang memoderasi pengumpulan datanya sebagai respons terhadap [[TikTok|kekhawatiran AS]].<ref>Matt Burgess. [https://www.wired.com/story/deepseek-ai-china-privacy-data/ DeepSeek’s Popular AI App Is Explicitly Sending US Data to China]. ''Wired''.</ref>


== Lihat pula ==
== Lihat pula ==
Baris 145: Baris 248:


== Catatan ==
== Catatan ==
== Referensi ==
== Pranala luar ==
== Pranala luar ==
 
*  
 
*
* [https://huggingface.co/collections/Presidentlin/deepseek-papers-674c536aa6acddd9bc98c2ac ''Anthology of DeepSeek papers'']
* [https://huggingface.co/collections/Presidentlin/deepseek-papers-674c536aa6acddd9bc98c2ac ''Anthology of DeepSeek papers'']
*
*  
* [https://api-docs.deepseek.com/ Dokumentasi resmi API]
* [https://api-docs.deepseek.com/ Dokumentasi resmi API]
* [https://huggingface.co/deepseek-ai/DeepSeek-V2.5-1210 deepseek-ai] di [[Hugging Face]]
* [https://huggingface.co/deepseek-ai/DeepSeek-V2.5-1210 deepseek-ai] di [[Hugging Face]]


__INDEKS__


== Referensi ==
<references />


== Sumber dan atribusi ==
== Sumber dan atribusi ==


Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=DeepSeek&oldid=29523370 Wikipedia bahasa Indonesia], revisi 29523370 (2026-08-04T08:11:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.
Konten artikel ini diadaptasi dari [https://id.wikipedia.org/w/index.php?title=DeepSeek&oldid=29523370 Wikipedia bahasa Indonesia], revisi 29523370 (2026-08-04T08:11:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.
<!-- WIKI_UNISSULA_PRESENTATION_V4 -->

Revisi terkini sejak 23 Agustus 2026 04.17

DeepSeek adalah nama yang diberikan untuk model bahasa besar (LLM) sumber terbuka yang dikembangkan oleh sebuah perusahaan kecerdasan buatan asal Tiongkok bernama Hangzhou DeepSeek Artificial Intelligence Co., Ltd. (). Perusahaan tersebut, yang berkantor pusat di Hangzhou, Zhejiang, dimiliki dan didanai sepenuhnya oleh dana lindung nilai High-Flyer, yang salah seorang pendirinya, Liang Wenfeng, mendirikan perusahaan tersebut pada tahun 2023 dan menjabat sebagai CEO-nya.

DeepSeek melakukan tugas pada level yang sama dengan ChatGPT,[1] meskipun dikembangkan dengan biaya yang jauh lebih rendah, yaitu sebesar US$ 6 juta, dibandingkan dengan $100 juta untuk GPT-4 oleh OpenAI pada tahun 2023,[2] dan membutuhkan sepersepuluh dari daya komputasi LLM yang sebanding.[3][4][5][6] Model AI dikembangkan oleh DeepSeek di tengah sanksi AS terhadap Tiongkok atas cip Nvidia, yang dimaksudkan untuk membatasi kemampuan negara tersebut untuk mengembangkan sistem AI tingkat lanjut.[7][8] Pada 10 Januari 2025, perusahaan ini merilis aplikasi bot percakapan gratis pertamanya untuk iOS Apple dan Android; pada 27 Januari, aplikasi ini telah melampaui ChatGPT sebagai aplikasi gratis yang paling banyak diunduh di iOS App Store di Amerika Serikat,[9] dan menyebabkan harga saham Nvidia turun sebesar 18%.[10][11][12] Keberhasilan DeepSeek melawan para pesaing yang lebih besar dan mapan telah digambarkan sebagai "pengubah AI,"[13] yang merupakan "tembakan pertama dalam apa yang berkembang sebagai perlombaan ruang AI global"[14] dan mengawali "era baru dari taktik AI yang penuh tipu daya."[15]

DeepSeek telah menjadikan bot percakapan kecerdasan buatan generatifnya sumber terbuka, menjadikan kodenya tersedia secara bebas untuk digunakan, dimodifikasi, dan dilihat; hal ini termasuk izin untuk mengakses dan memanfaatkan kode sumber dan dokumen desain untuk tujuan pembangunan.[16] Perusahaan ini secara aktif merekrut peneliti muda AI dari universitas-universitas ternama di Tiongkok,[17] dan merekrut orang dari luar bidang ilmu komputer untuk menganekaragamkan pengetahuan dan kemampuan modelnya.[18]

Latar belakang

Pada bulan Februari 2016, High-Flyer didirikan oleh seorang penggemar AI bernama Liang Wenfeng, yang telah berdagang sejak krisis keuangan 2007–2008 saat kuliah di Universitas Zhejiang.[19] Pada tahun 2019, ia mendirikan High-Flyer sebagai dana lindung nilai yang berfokus pada pengembangan dan penggunaan algoritma perdagangan AI. Pada tahun 2021, High-Flyer secara eksklusif menggunakan AI dalam perdagangan.[20] DeepSeek telah menjadikan bot percakapan kecerdasan buatan generatifnya sumber terbuka, yang berarti kodenya tersedia secara bebas untuk digunakan, dimodifikasi, dan dilihat. Hal ini termasuk izin untuk mengakses dan menggunakan kode sumber, serta dokumen desain, untuk tujuan pembangunan.[21]

Per 36Kr, Liang telah membangun penyimpanan 10.000 GPU Nvidia A100 sebelum pemerintah AS memberlakukan pembatasan cip AI di Tiongkok.[22] Beberapa perkiraan menyebutkan jumlahnya mencapai 50.000.[23]

Pada bulan April 2023, High-Flyer memulai laboratorium kecerdasan umum buatan yang didedikasikan untuk meneliti pengembangan alat AI yang terpisah dari bisnis keuangan High-Flyer.[24][25] Pada bulan Mei 2023, dengan High-Flyer sebagai salah satu investor, lab tersebut menjadi suatu perusahaan yang berdiri sendiri, yaitu DeepSeek.[26][27][28] Perusahaan modal ventura enggan memberikan pendanaan karena tidak mungkin menghasilkan keuntungan dalam waktu singkat.[29]

Setelah merilis DeepSeek-V2 pada Mei 2024, yang menawarkan kinerja kuat dengan harga murah, DeepSeek dikenal sebagai katalisator perang harga model AI Tiongkok. Perusahaan ini dengan cepat dijuluki "Pinduoduo AI", dan raksasa teknologi lainnya, seperti ByteDance, Tencent, Baidu, dan Alibaba mulai memangkas harga model AI mereka untuk bersaing dengan perusahaan tersebut. Meskipun harga yang dikenakan DeepSeek rendah, perusahaan ini tetap menguntungkan dibandingkan dengan pesaingnya yang merugi.[30]

DeepSeek berfokus hanya pada penelitian dan tidak memiliki rencana terperinci untuk komersialisasi;[31] Hal ini juga memungkinkan teknologinya menghindari ketentuan paling ketat dari peraturan AI Tiongkok, seperti mengharuskan teknologi yang berhadapan dengan konsumen untuk mematuhi kontrol pemerintah terhadap informasi.[32]

Preferensi perekrutan DeepSeek lebih mengutamakan kemampuan teknis daripada pengalaman kerja sehingga sebagian besar karyawan baru adalah lulusan universitas atau pengembang yang karier AI-nya belum begitu mapan.[33][34] Demikian pula, perusahaan merekrut individu tanpa latar belakang ilmu komputer untuk membantu teknologinya memahami topik dan bidang pengetahuan lainnya, termasuk kemampuan untuk menciptakan puisi dan kemampuan untuk mengerjakan ujian masuk perguruan tinggi Tiongkok yang terkenal sulit.[35]

Riwayat rilis

DeepSeek LLM

Pada tanggal 2 November 2023, DeepSeek merilis seri model pertamanya, DeepSeek-Coder, yang tersedia gratis untuk peneliti dan pengguna komersial. Kode untuk model tersebut dibuat sumber terbuka di bawah lisensi MIT, dengan perjanjian lisensi tambahan ("lisensi DeepSeek") mengenai "penggunaan hilir yang terbuka dan bertanggung jawab" untuk model itu sendiri.[36]

Model-model tersebut memiliki arsitektur yang sama dengan DeepSeek LLM yang dirinci di bawah ini. Seri ini mencakup 8 model, 4 pretrained (Base) dan 4 instruction-finetuned (Instruct). Semuanya memiliki panjang konteks 16K. Pelatihannya adalah sebagai berikut:[37][38][39]

  1. Pretraining (Prapelatihan): token 1,8T (87% kode sumber, 10% kode terkait bahasa Inggris (GitHub Markdown dan Stack Exchange), dan 3% kode terkait bahasa Mandarin).
  2. Long-context pretraining: 200B token. Ini memperluas panjang konteks dari 4K ke 16K. Ini menghasilkan model Base.
  3. Supervised finetuning (SFT): 2B token data instruksi. Ini menghasilkan model Instruct.

Model-model tersebut dilatih pada kluster-kluster GPU Nvidia A100 dan H800, yang dihubungkan oleh InfiniBand, NVLink, NVSwitch.[40]

Properti DeepSeek Coder[41][42]
. nlayers dmodel dintermediate nheads nkv-heads
1.3B 24 2048 5504 16 16
5.7B 32 4096 11008 32 1
6.7B 32 4096 11008 32 32
33B 62 7168 19200 56 7

Perhatikan bahwa number of heads tidak sama dengan number of KV heads untuk 5.6B dan 33B karena Grouped query attention (GQA).

Pada tanggal 29 November 2023, DeepSeek merilis seri model DeepSeek-LLM, dengan parameter 7B dan 67B dalam formulir Base dan Chat (tidak ada Instruct yang dirilis). Program ini dikembangkan untuk bersaing dengan LLM lain yang tersedia saat itu. Makalah ini mengklaim hasil pengujian tolok ukur (benchmark) lebih tinggi daripada kebanyakan LLM sumber terbuka pada saat itu, terutama Llama 2.[43]  Seperti DeepSeek Coder, kode untuk model tersebut berada di bawah lisensi MIT, dengan lisensi DeepSeek untuk model itu sendiri.[44]

Arsitekturnya pada dasarnya sama dengan seri Llama. Model-model tersebut menggunakan pre-norm decoder-only Transformer dengan RMSNorm sebagai normalisasi, SwiGLU dalam feedforward layers, rotary positional embedding (RoPE), dan grouped-query attention (GQA). Keduanya memiliki ukuran kosakata 102400 (BPE tingkat byte) dan panjang konteks 4096. Model-model tersebut berlatih pada 2 triliun token teks bahasa Inggris dan Mandarin yang diperoleh dengan mendeduplikasi Common Crawl.[45]

Properti DeepSeek LLM[46]
. nlayers dmodel dintermediate nheads nkv-heads
7B 30 4096 11008 32 32
67B 95 8192 22016 64 8

Perhatikan bahwa number of heads tidak sama dengan number of KV heads untuk 67B karena Grouped query attention (GQA).

Versi Chat dari dua model Base juga dirilis secara bersamaan, diperoleh dengan melatih Base melalui supervised finetuning (SFT) diikuti oleh direct policy optimization (DPO).[47]

Pada bulan April 2024, mereka merilis 3 model DeepSeek-Math yang dikhususkan untuk mengerjakan soal-soal matematika: Base, Instruct, RL. Pelatihannya sebagai berikut:[48]

  1. Inisialisasi dengan DeepSeek-Coder-Base-v1.5 7B yang sudah pretrained.
  2. Lakukan pretraining lebih lanjut dengan 500B token (6% DeepSeekMath Corpus, 4% AlgebraicStack, 10% arXiv, 20% kode GitHub, 10% Common Crawl). Tahap ini menghasilkan model Base.
  3. Latih instruction-following model oleh SFT Base dengan 776K soal matematika dan solusi tool-use-integrated step-by-step. Tahap ini menghasilkan model Instruct.
  4. Reinforcement learning (RL): Model reward-nya adalah process reward model (PRM) yang dilatih dari Base sesuai dengan metode Math-Shepherd.[49] Model reward ini kemudian digunakan untuk melatih Instruct menggunakan group relative policy optimization (GRPO) pada kumpulan data 144K pertanyaan matematika "berkaitan dengan GSM8K dan MATH". Model reward terus diperbarui selama pelatihan untuk menghindari peretasan reward. Tahap ini menghasilkan model RL.

V2

Pada bulan Mei 2024, mereka merilis seri DeepSeek-V2. Seri ini mencakup 4 model, 2 model dasar (DeepSeek-V2, DeepSeek-V2-Lite) dan 2 bot percakapan (-Chat). Kedua model yang lebih besar dilatih sebagai berikut:[50]

  1. Lakukan pretraining pada himpunan data token 8,1T dengan token berbahasa Mandarin 12% lebih banyak daripada token berbahasa Inggris.
  2. Perluas context length dari 4K ke 128K menggunakan YaRN.[51] Tahap ini menghasilkan DeepSeek-V2.
  3. SFT dengan 1,2M instances untuk helpfulness dan 0,3M untuk safety. Tahap ini menghasilkan DeepSeek-V2-Chat (SFT) yang tidak dirilis.
  4. RL menggunakan GRPO dalam dua tahap. Tahap pertama dilatih untuk memecahkan masalah matematika dan pengkodean. Tahap ini menggunakan 1 model reward, dilatih pada compiler feedback (untuk pengkodean) dan ground-truth labels (untuk matematika). Tahap kedua dilatih agar helpful, safe, dan mematuhi aturan. Tahap ini menggunakan 3 model reward. Model reward atas bantuan dan keselamatan dilatih pada data preferensi manusia. Model rule-based reward diprogram secara manual. Semua model reward yang dilatih diinisialisasi dari DeepSeek-V2-Chat (SFT). Tahap ini menghasilkan dirilisnya versi DeepSeek-V2-Chat.

Mereka memilih RL 2-tahap karena mereka menemukan bahwa RL pada data penalaran (reasoning) memiliki "karakteristik unik" yang berbeda dari RL pada data umum. Misalnya, RL pada penalaran dapat ditingkatkan melalui beberapa langkah pelatihan.[52]

Kedua model V2-Lite merupakan model yang lebih kecil, dan dilatih secara serupa, meskipun DeepSeek-V2-Lite-Chat hanya menjalani SFT, bukan RL. Mereka melatih versi Lite untuk membantu "penelitian dan pengembangan lebih lanjut pada MLA dan DeepSeekMoE".[53]

Secara arsitektur, model V2 dimodifikasi secara signifikan dari seri DeepSeek LLM. Mereka mengubah mekanisme atensi standar (standard attention mechanism) dengan low-rank approximation yang disebut multi-head latent attention (MLA), dan menggunakan varian mixture of experts (MoE) yang sebelumnya diterbitkan pada bulan Januari. Dibandingkan dengan standard sparsely-gated MoE, varian mereka memiliki "pakar bersama" (shared experts) yang selalu di-query, dan "pakar yang dirutekan" (routed experts) yang mungkin tidak di-query.[54]

Properti DeepSeek V2 [55][56] [57]
Nama . . aktif nlayers Panjang konteks nshared experts nrouted experts
V2-Lite 15,7B 2,4B 27 32K 2 64
V2 236B 21B 60 128K 2 160

Financial Times melaporkan bahwa harga token ini lebih murah dibanding pesaingnya, yaitu 2 RMB per juta token keluaran. Papan peringkat Tiger Lab dari University of Waterloo menempatkan DeepSeek-V2 pada posisi ketujuh dalam peringkat LLM.[58]

Pada bulan Juni, mereka merilis 4 model dalam seri DeepSeek-Coder-V2: V2-Base, V2-Lite-Base, V2-Instruct, V2-Lite-Instruct. Model-model tersebut dilatih sebagai berikut:[59]

  1. Model Base diinisialisasi dari titik pemeriksaan (checkpoints) intermediate yang sesuai setelah pretraining pada token 4.2T (bukan versi di akhir pretraining), lalu dilatih lebih lanjut untuk token 6T, lalu diperluas konteksnya ke panjang konteks 128K. Tahap ini menghasilkan model Base.
  2. DeepSeek-Coder dan DeepSeek-Math digunakan untuk menghasilkan 20K data instruksi terkait kode dan 30K data instruksi terkait matematika, lalu digabungkan dengan kumpulan data instruksi sebanyak 300M token. Ini digunakan untuk SFT.
  3. RL dengan GRPO. Reward untuk soal matematika dihitung dengan membandingkannya dengan ground-truth label. Reward untuk masalah kode dihasilkan oleh model reward yang dilatih untuk memprediksi apakah suatu program akan lulus uji unit.

DeepSeek-V2.5 dirilis pada bulan September dan diperbarui pada bulan Desember. Rilisan tersebut dibuat dengan menggabungkan DeepSeek-V2-Chat dan DeepSeek-Coder-V2-Instruct.[60]

V3

Pada bulan Desember 2024, mereka merilis model dasar DeepSeek-V3-Base dan model bot percakapan DeepSeek-V3. Arsitektur modelnya pada dasarnya sama dengan V2. Model-model tersebut dilatih sebagai berikut:[61]

  1. Pretraining pada token 14,8T dari korpus multibahasa, sebagian besar bahasa Inggris dan Mandarin. Dataset ini berisi rasio matematika dan pemrograman yang lebih tinggi daripada dataset untuk pretraining V2.
  2. Perluasan panjang konteks (context length) dua kali, dari 4K ke 32K dan kemudian ke 128K, menggunakan YaRN.[62] Tahap ini menghasilkan DeepSeek-V 3-Base.
  3. SFT selama 2 periode pada 1,5M sampel data penalaran (matematika, pemrograman, logika) dan non-penalaran (penulisan kreatif, permainan peran, jawaban pertanyaan sederhana). Data penalaran dihasilkan oleh "model ahli". Data non-penalaran dihasilkan oleh DeepSeek-V2.5 dan diperiksa oleh manusia.
    • "Model pakar" (expert models) dilatih dengan memulai dengan model dasar yang tidak ditentukan, lalu SFT pada data <problem, original response>, dan data sintetis <system prompt, problem, R1 response> yang dihasilkan oleh model DeepSeek-R1 internal. Perintah sistem meminta R1 untuk berpikir dan memverifikasi selama berpikir. Kemudian, model ahli RL menggunakan fungsi imbalan yang tidak ditentukan.
    • Setiap model ahli dilatih untuk menghasilkan data penalaran sintetis hanya dalam satu domain spesifik (matematika, pemrograman, logika).
    • Model ahli digunakan, bukan R1 itu sendiri, karena keluaran dari R1 sendiri mengalami "pemikiran berlebihan, format buruk, dan panjang sekali".
  4. Model reward berbasis model dibuat dengan memulai dengan checkpoint SFT V3, lalu menyempurnakan data preferensi manusia yang berisi reward akhir dan rangkaian pemikiran yang mengarah ke reward akhir. Model reward menghasilkan sinyal reward untuk pertanyaan dengan jawaban objektif, tetapi berbentuk bebas, dan pertanyaan tanpa jawaban objektif (seperti penulisan kreatif).
  5. Checkpoint SFT V3 dilatih oleh GRPO menggunakan model-based reward dan rule-based reward. Rule-based reward dihitung untuk soal matematika dengan jawaban akhir (dimasukkan ke dalam kotak), dan untuk soal pemrograman dengan uji unit. Tahap ini menghasilkan DeepSeek-V3.
Properti DeepSeek V3 [63][64]
Nama . aktif nlayers Panjang konteks nshared experts nrouted experts
V3 671B 37B 61 128K 1 256

Mereka melakukan rekayasa tingkat rendah yang ekstensif untuk mencapai efisiensi. Mereka menggunakan mixed-precision arithmetic. Sebagian besar pemindahan data ke depan dilakukan dalam bilangan floating point 8-bit (5E2M: eksponen 5-bit dan mantissa 2-bit) dan bukan dalam format standar 32-bit sehingga memerlukan rutinitas GEMM khusus untuk mengakumulasi secara akurat. Mereka menggunakan float 12-bit khusus (E5M6) hanya untuk masukan ke lapisan linier setelah modul atensi. Status pengoptimal berada dalam 16-bit (BF16). Mereka meminimalkan latensi komunikasi dengan melakukan tumpang tindih komputasi dan komunikasi secara ekstensif, seperti mendedikasikan 20 multiprosesor streaming dari 132 per H800 hanya untuk komunikasi antar-GPU. Mereka menurunkan komunikasi dengan mengatur ulang (setiap 10 menit) mesin yang digunakan oleh masing-masing ahli untuk menghindari mesin tertentu yang lebih sering diakses daripada mesin lainnya, menambahkan kerugian penyeimbangan beban tambahan ke fungsi kerugian pelatihan, dan teknik penyeimbangan beban lainnya.[65]

Setelah pelatihan, ia disebarkan pada klaster H800. H800 dalam satu klaster dihubungkan melalui NVLink. Klaster-klaster tersebut dihubungkan oleh InfiniBand.[66]

Total biaya pelatihan model DeepSeek-V3[67]
Stage Biaya (dalam seribu jam GPU) Biaya (dalam satu juta USD$)
Pre-training 2.664 5.328
Context extension 119 0.24
Fine-tuning 5 0,01
Total 2.788 5.576

Pengujian tolok ukur (benchmark) menunjukkan bahwa DeepSeek-V3 mengungguli Llama 3.1 dan Qwen 2.5 sambil menyamai GPT-4o dan Claude 3.5 Sonnet.[68][69][70][71]

R1

Pada tanggal 20 November 2024, DeepSeek-R1-Lite-Preview dapat diakses melalui API DeepSeek dan situs web chat.deepseek.com.[72] Ia dilatih untuk inferensi logis, penalaran matematika, dan pemecahan masalah real-time. DeepSeek mengklaim bahwa kinerjanya melampaui OpenAI o1 pada pengujian tolok ukur (benchmark) seperti American Invitational Mathematics Examination (AIME) dan MATH. [73] Namun, The Wall Street Journal menyatakan ketika menggunakan 15 masalah dari edisi AIME 2024, model o1 mendapatkan solusi untuk soal matematika lebih cepat daripada DeepSeek-R1-Lite-Preview.[74]

Pada tanggal 20 Januari 2025, DeepSeek-R1 dan DeepSeek-R1-Zero dirilis.[75] Keduanya diinisialisasi dari DeepSeek-V3-Base. Perusahaan ini juga merilis beberapa model "DeepSeek-R1-Distill", yang tidak diinisialisasi pada V3-Base, tetapi diinisialisasi dari model pretrained open-weight lainnya, termasuk LLaMA dan Qwen, kemudian disempurnakan pada data sintetis yang dihasilkan oleh R1.[76]

DeepSeek-R1-Zero dilatih secara eksklusif menggunakan GRPO RL tanpa SFT. Tidak seperti versi sebelumnya, mereka tidak menggunakan reward berbasis model. Semua rule-based reward, "terutama" dari dua jenis (jenis lainnya tidak ditentukan): reward akurasi dan reward format. Reward akurasi memeriksa apakah jawaban yang diberikan tanda kotak itu benar (untuk matematika) atau apakah suatu kode lulus uji (untuk pemrograman). Format reward memeriksa penempatan thinking trace model tersebut dalam <think>... </think>.[77]

Oleh karena R1-Zero memiliki masalah terkait keterbacaan (readability) dan pencampuran bahasa, R1 dilatih untuk mengatasi masalah ini dan lebih meningkatkan penalaran:[78]

  1. SFT DeepSeek-V3-Base pada "ribuan" data "cold-start" semuanya dengan format standar |special_token|<reasoning_process>|special_token|summary>.
  2. Terapkan proses RL yang sama seperti R1-Zero, tetapi juga dengan "reward konsistensi bahasa" untuk mendorongnya merespons secara monolingual. Tahap ini menghasilkan model internal yang tidak dirilis.
  3. Mensintesiskan 600K data penalaran dari model internal, dengan pengambilan sampel penolakan (misalnya, jika penalaran yang dihasilkan memiliki jawaban akhir yang salah, maka penalaran tersebut dihapus). Mensintesiskan 200K data non-penalaran (penulisan, tanya jawab faktual, pengenalan diri, penerjemahan) menggunakan DeepSeek-V3.
  4. SFT DeepSeek-V3-Base pada data sintetis 800K selama 2 epoch.
  5. GRPO RL dengan rule-based reward (untuk tugas penalaran) dan model-based reward (untuk tugas non-penalaran, helpfulness, dan harmlessness). Tahap ini menghasilkan DeepSeek-R1.

Distilled models dilatih oleh SFT pada 800K data yang disintesis dari DeepSeek-R1, dengan cara yang sama seperti langkah 3 di atas. Model-model tersebut tidak dilatih dengan RL.

Kesan

DeepSeek merilis Asisten AI-nya, yang menggunakan model V3 sebagai aplikasi bot percakapan untuk iOS Apple dan Android. Pada 27 Januari 2025, aplikasi ini telah melampaui ChatGPT sebagai aplikasi gratis dengan peringkat tertinggi di iOS App Store di Amerika Serikat; bot percakapannya dilaporkan dapat menjawab pertanyaan, memecahkan masalah logika, dan menulis program komputer setara dengan bot percakapan lain di pasaran, menurut pengujian tolok ukur (benchmark) yang digunakan oleh perusahaan AI Amerika.[79]

DeepSeek-V3 menggunakan sumber daya yang jauh lebih sedikit dibandingkan dengan pesaingnya; misalnya, sementara perusahaan AI terkemuka di dunia melatih chatbot mereka dengan superkomputer yang menggunakan sebanyak 16.000 sirkuit terpadu ("cip komputer"), jika tidak lebih, DeepSeek mengklaim hanya membutuhkan sekitar 2.000 cip komputer khusus, yaitu seri H800 dari perusahaan teknologi multinasional Amerika Nvidia. Pelatihan ini memakan waktu sekitar 55 hari dengan biaya sebesar US$5,58 juta,[80] yang kira-kira 10 kali lebih sedikit dari jumlah yang dikeluarkan oleh raksasa teknologi AS, Meta, untuk membangun teknologi AI terbarunya.[81]

Performa kompetitif DeepSeek telah diakui berpotensi menantang dominasi global model AI Amerika;[82] sebuah opini oleh The Hill menggambarkan peluncuran bot percakapannya sebagai "momen Sputnik" untuk AI Amerika.[83] Optimalisasi sumber daya terbatas DeepSeek telah menyoroti potensi batasan sanksi AS terhadap pengembangan AI Tiongkok, yang mencakup pembatasan ekspor cip AI canggih ke Tiongkok.[84][85] Keberhasilan model DeepSeek kemudian "memicu kekacauan pasar"[86] dan menyebabkan saham-saham di perusahaan-perusahaan teknologi global jatuh pada tanggal 27 Januari: saham Nvidia jatuh hingga 17–18%,[87] dan begitu pula saham perusahaan pesaingnya, Broadcom. Perusahaan teknologi lain juga mengalami kemerosotan, termasuk Microsoft (turun 2,5%), Alphabet induk Google (turun lebih dari 4%), dan pembuat peralatan cip asal Belanda, ASML (turun lebih dari 7%).[88]

Performa R1 dilaporkan "setara" dengan salah satu model terbaru OpenAI saat digunakan untuk tugas-tugas seperti matematika, pengkodean, dan penalaran bahasa alami;[89] menggemakan opini The Hill tentang V3, kapitalis ventura Lembah Silikon Amerika, Marc Andreessen, juga menggambarkan R1 sebagai "momen Sputnik AI".[90]

Penjualan saham teknologi global di Nasdaq, didorong oleh rilis model R1, telah menyebabkan kerugian rekor sekitar $593 miliar pada kapitalisasi pasar perusahaan AI dan perangkat keras komputer.[91]

The Guardian membandingkan DeepSeek dengan "Sputnik" Perang Dingin yang mengakibatkan nilai saham Amerika merosot hingga $1 triliun, sementara Presiden Amerika, Donald Trump, menyebutnya sebagai peringatan[92] dan perkembangan yang positif.[93][94][95][96]

Pada tanggal 27 Januari, DeepSeek membatasi pendaftaran pengguna baru hanya untuk nomor telepon yang berasal dari daratan Tiongkok setelah adanya laporan serangan siber.[97][98]

Amazon Web Services, Toyota, dan Stripe telah mencoba menggunakan model ini dalam program mereka.[99]

Kekhawatiran

Penyensoran

Beberapa sumber telah mengamati bahwa versi API resmi R1 menggunakan mekanisme penyensoran untuk topik yang dianggap sensitif secara politik bagi pemerintah Republik Rakyat Tiongkok. Misalnya, model tersebut menolak menjawab pertanyaan tentang protes dan pembantaian Lapangan Tiananmen 1989, penganiayaan terhadap warga Uighur, atau hak asasi manusia di Tiongkok.[100][101]

AI mungkin awalnya menghasilkan jawaban, tetapi kemudian menghapusnya segera setelahnya dan menggantinya dengan pesan seperti: "Maaf, itu di luar jangkauan saya saat ini. Mari kita bicarakan hal lain."[102] Mekanisme dan pembatasan sensor terintegrasi hanya dapat dihapus sampai batas tertentu dalam versi sumber terbuka model R1. Jika “nilai-nilai sosialis inti” yang ditetapkan oleh otoritas regulasi internet Tiongkok disinggung atau status politik Taiwan diangkat, diskusi akan dihentikan.[103]

Ketika diuji oleh NBC News, R1 DeepSeek menggambarkan Taiwan sebagai "bagian yang tidak dapat dipindahtangankan dari wilayah Tiongkok," dan menyatakan: "Kami dengan tegas menentang segala bentuk kegiatan separatis 'kemerdekaan Taiwan' dan berkomitmen untuk mencapai penyatuan kembali tanah air secara penuh melalui cara damai."[104]

Pada bulan Januari 2025, para peneliti Barat berhasil mengelabui DeepSeek agar memberikan jawaban yang akurat untuk beberapa topik ini dengan menyesuaikan pertanyaan yang diajukan.[105]

Keamanan dan privasi

Ada pula kekhawatiran bahwa sistem AI ini dapat digunakan untuk pengaruh asing, menyebarkan disinformasi, pengawasan, dan pengembangan senjata siber untuk dinas rahasia Tiongkok.[106][107] Syarat dan ketentuan privasi DeepSeek menyatakan "Kami menyimpan informasi yang kami kumpulkan di server aman yang berlokasi di Republik Rakyat Tiongkok. Kami dapat mengumpulkan masukan teks atau audio, perintah, file yang diunggah, umpan balik, riwayat obrolan, atau konten lain yang Anda berikan kepada model dan layanan-layanan kami". Hal ini menimbulkan kekhawatiran keamanan; lebih banyak data pribadi yang berpotensi dikumpulkan dibandingkan dengan perangkat lunak Tiongkok seperti TikTok, yang memoderasi pengumpulan datanya sebagai respons terhadap kekhawatiran AS.[108]

Lihat pula

Catatan

Pranala luar


Referensi

  1. Elizabeth Gibney. China's cheap, open AI model DeepSeek thrills scientists. Nature. 23 Januari 2025. doi:10.1038/d41586-025-00229-6.}}
  2. James Vincent. The DeepSeek panic reveals an AI world ready to blow. The Guardian. 28 Januari 2025.
  3. James Vincent. The DeepSeek panic reveals an AI world ready to blow. The Guardian. 28 Januari 2025.
  4. Peter Hoskins. DeepSeek Chinese AI chatbot sparks market turmoil for rivals. BBC. 27 Januari 2025.
  5. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  6. Emma Cosgrove. DeepSeek's cheaper models and weaker chips call into question trillions in AI infrastructure spending. Business Insider. 27 Januari 2025.
  7. Cliff Saran. Nvidia investigation signals widening of US and China chip war | Computer Weekly. Computer Weekly. 10 Desember 2024.
  8. Natalie Sherman. Nvidia targeted by China in new chip war probe. BBC. 9 Desember 2024.
  9. Cade Metz. What is DeepSeek? And How Is It Upending A.I.?. The New York Times. 27 Januari 2025.
  10. Hayden Field. China's DeepSeek AI dethrones ChatGPT on App Store: Here's what you should know. CNBC. 27 Januari 2025.
  11. What is DeepSeek, and why is it causing Nvidia and other stocks to slump? - CBS News. www.cbsnews.com. 27 Januari 2025.
  12. Thomas Barrabi. Nvidia stock suffers record wipeout on DeepSeek fears -- as CEO Jensen Huang's net worth tanks. 27 Januari 2025.
  13. Cade Metz. What is DeepSeek? And How Is It Upending A.I.?. The New York Times. 27 Januari 2025.
  14. Max Zahn. Nvidia, Microsoft shares tumble as China-based AI app DeepSeek hammers tech giants. ABC News.
  15. Kevin Roose. Why DeepSeek Could Change What Silicon Valley Believe About A.I. The New York Times. 2025-01-28.
  16. Luis E. Romero. ChatGPT, DeepSeek, Or Llama? Meta's LeCun Says Open-Source Is The Key. Forbes.
  17. Cade Metz. What is DeepSeek? And How Is It Upending A.I.?. The New York Times. 27 Januari 2025.
  18. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  19. Caiwei Chen. How a top Chinese AI model overcame US sanctions. MIT Technology Review. 24 Januari 2025.
  20. Lily Ottinger. Deepseek: From Hedge Fund to Frontier Model Maker. ChinaTalk. 9 Desember 2024.
  21. Luis E. Romero. ChatGPT, DeepSeek, Or Llama? Meta's LeCun Says Open-Source Is The Key. Forbes.
  22. Lily Ottinger. Deepseek: From Hedge Fund to Frontier Model Maker. ChinaTalk. 9 Desember 2024.
  23. Caiwei Chen. How a top Chinese AI model overcame US sanctions. MIT Technology Review. 24 Januari 2025.
  24. Xu Yu. [Exclusive Chinese Quant Hedge Fund High-Flyer Won't Use AGI to Trade Stocks, MD Says]. Yicai Global. 17 April 2023.
  25. Ben Jiang. Meet DeepSeek: the Chinese start-up that is changing how AI models are trained. South China Morning Post. 1 Januari 2025.
  26. Lily Ottinger. Deepseek: From Hedge Fund to Frontier Model Maker. ChinaTalk. 9 Desember 2024.
  27. Ryan McMorrow. The Chinese quant fund-turned-AI pioneer. Financial Times. 9 June 2024.
  28. Ben Jiang. Meet DeepSeek: the Chinese start-up that is changing how AI models are trained. South China Morning Post. 1 Januari 2025.
  29. Lily Ottinger. Deepseek: From Hedge Fund to Frontier Model Maker. ChinaTalk. 9 Desember 2024.
  30. Jordan Schneider. Deepseek: The Quiet Giant Leading China's AI Race. ChinaTalk. 27 November 2024.
  31. Jordan Schneider. Deepseek: The Quiet Giant Leading China's AI Race. ChinaTalk. 27 November 2024.
  32. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  33. Ben Jiang. Meet DeepSeek: the Chinese start-up that is changing how AI models are trained. South China Morning Post. 1 Januari 2025.
  34. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  35. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  36. DeepSeek-Coder/LICENSE-MODEL at main · deepseek-ai/DeepSeek-Coder. GitHub.
  37. Daya Guo. DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence. 26 Januari 2024.
  38. DeepSeek Coder. deepseekcoder.github.io.
  39. deepseek-ai/DeepSeek-Coder. DeepSeek. 27 Januari 2025.
  40. Daya Guo. DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence. 26 Januari 2024.
  41. Daya Guo. DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence. 26 Januari 2024.
  42. deepseek-ai/deepseek-coder-5.7bmqa-base · Hugging Face. huggingface.co.
  43. DeepSeek-AI. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism. 5 Januari 2024.
  44. deepseek-ai/DeepSeek-LLM. DeepSeek. 27 Januari 2025.
  45. DeepSeek-AI. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism. 5 Januari 2024.
  46. DeepSeek-AI. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism. 5 Januari 2024.
  47. DeepSeek-AI. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism. 5 Januari 2024.
  48. Zhihong Shao. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. 27 April 2024.
  49. Peiyi Wang. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations. 19 February 2024.
  50. DeepSeek-AI. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. 19 June 2024.
  51. Bowen Peng. YaRN: Efficient Context Window Extension of Large Language Models. 1 November 2023.
  52. DeepSeek-AI. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. 19 June 2024.
  53. sumber pada Wikipedia bahasa Indonesia
  54. Damai Dai. DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models. 11 Januari 2024.
  55. DeepSeek-AI. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. 19 June 2024.
  56. config.json · deepseek-ai/DeepSeek-V2-Lite at main. huggingface.co. 15 May 2024.
  57. config.json · deepseek-ai/DeepSeek-V2 at main. huggingface.co. 6 May 2024.
  58. Ryan McMorrow. The Chinese quant fund-turned-AI pioneer. Financial Times. 9 June 2024.
  59. DeepSeek-AI. DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence. arXiv. 17 June 2024. doi:10.48550/arXiv.2406.11931.
  60. deepseek-ai/DeepSeek-V2.5 · Hugging Face. huggingface.co. 3 Januari 2025.
  61. DeepSeek-AI. DeepSeek-V3 Technical Report. 27 Desember 2024.
  62. Bowen Peng. YaRN: Efficient Context Window Extension of Large Language Models. 1 November 2023.
  63. DeepSeek-AI. DeepSeek-V3 Technical Report. 27 Desember 2024.
  64. config.json · deepseek-ai/DeepSeek-V3 at main. huggingface.co. 26 Desember 2024.
  65. DeepSeek-AI. DeepSeek-V3 Technical Report. 27 Desember 2024.
  66. DeepSeek-AI. DeepSeek-V3 Technical Report. 27 Desember 2024.
  67. DeepSeek-AI. DeepSeek-V3 Technical Report. 27 Desember 2024.
  68. Ben Jiang. Meet DeepSeek: the Chinese start-up that is changing how AI models are trained. South China Morning Post. 1 Januari 2025.
  69. Ben Jiang. Chinese start-up DeepSeek's new AI model outperforms Meta, OpenAI products. South China Morning Post. 27 Desember 2024.
  70. Shubham Sharma. DeepSeek-V3, ultra-large open-source AI, outperforms Llama and Qwen on launch. VentureBeat. 26 Desember 2024.
  71. Kyle Wiggers. DeepSeek's new AI model appears to be one of the best 'open' challengers yet. TechCrunch. 26 Desember 2024.
  72. News DeepSeek-R1-Lite Release 2024/11/20: 🚀 DeepSeek-R1-Lite-Preview is now live: unleashing supercharged reasoning power!. DeepSeek API Docs.
  73. Carl Franzen. DeepSeek's first reasoning model R1-Lite-Preview turns heads, beating OpenAI o1 performance. VentureBeat. 20 November 2024.
  74. Raffaele Huang. Don't Look Now, but China's AI Is Catching Up Fast. The Wall Street Journal. 24 Desember 2024.
  75. Release DeepSeek-R1 · deepseek-ai/DeepSeek-R1@23807ce. GitHub.
  76. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 22 Januari 2025.
  77. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 22 Januari 2025.
  78. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 22 Januari 2025.
  79. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  80. DeepSeek-AI. DeepSeek-V3 Technical Report. 27 Desember 2024.
  81. Cade Metz. How Chinese A.I. Start-Up DeepSeek Is Competing With Silicon Valley Giants. The New York Times. 23 Januari 2025.
  82. Chinese AI startup DeepSeek overtakes ChatGPT on Apple App Store. Reuters. 27 Januari 2025.
  83. David Wade. American AI has reached its Sputnik moment. The Hill. 6 Desember 2024.
  84. Ben Jiang. Meet DeepSeek: the Chinese start-up that is changing how AI models are trained. South China Morning Post. 1 Januari 2025.
  85. Anton Shilov. Chinese AI company's AI model breakthrough highlights limits of US sanctions. Tom's Hardware. 27 Desember 2024.
  86. DeepSeek updates - Chinese AI chatbot sparks US market turmoil, wiping $500bn off Nvidia. BBC News.
  87. Rita Nazareth. Stock Rout Gets Ugly as Nvidia Extends Loss to 17%: Markets Wrap. Bloomberg. 26 Januari 2025.
  88. DeepSeek Chinese AI chatbot sparks market turmoil for rivals. www.bbc.com. 27 Januari 2025.
  89. DeepSeek Chinese AI chatbot sparks market turmoil for rivals. www.bbc.com. 27 Januari 2025.
  90. DeepSeek Chinese AI chatbot sparks market turmoil for rivals. www.bbc.com. 27 Januari 2025.
  91. DeepSeek sparks global AI selloff, Nvidia losses about $593 billion of value. Reuters. 27 Januari 2025.
  92. Eva Dou. Trump calls China’s DeepSeek AI app a ‘wake-up call’ after tech stocks slide. The Washington Post. 28 Januari 2025.
  93. Sareen Habeshian. Johnson bashes China on AI, Trump calls DeepSeek development "positive". Axios. 28 Januari 2025.
  94. Dan Milmo. 'Sputnik moment': $1tn wiped off US stocks after Chinese firm unveils AI chatbot. 28 Januari 2025.
  95. Nvidia shares sink as Chinese AI app DeepSeek spooks US markets. www.bbc.com. 27 Januari 2025.
  96. Jason Karaian. China's A.I. Advances Spook Big Tech Investors on Wall Street. 27 Januari 2025.
  97. Dara Kerr. DeepSeek hit with 'large-scale' cyber-attack after AI chatbot tops app stores. 27 Januari 2025.
  98. Steven Tweedie. DeepSeek temporarily limited new sign-ups, citing 'large-scale malicious attacks'. Business Insider.
  99. Eugene Kim. Big AWS customers, including Stripe and Toyota, are hounding the cloud giant for access to DeepSeek AI models. Business Insider.
  100. Matthew Field. Chinese AI has sparked a $1 trillion panic – and it doesn't care about free speech. The Daily Telegraph. 27 Januari 2025.
  101. Jakob Steinschaden. DeepSeek: This is what live censorship looks like in the Chinese AI chatbot. Trending Topics. 27 Januari 2025.
  102. Jakob Steinschaden. DeepSeek: This is what live censorship looks like in the Chinese AI chatbot. Trending Topics. 27 Januari 2025.
  103. The Guardian view on a global AI race: geopolitics, innovation and the rise of chaos. The Guardian. 26 Januari 2025.
  104. Chinese AI DeepSeek jolts Silicon Valley, giving the AI race its 'Sputnik moment'. NBC News. 27 Januari 2025.
  105. Donna Lu. We tried out DeepSeek. It worked well, until we asked it about Tiananmen Square and Taiwan. The Guardian. 28 Januari 2025.
  106. Anthony Kimery. China's DeepSeek AI poses formidable cyber, data privacy threats. Biometric Update. 26 Januari 2025.
  107. Dan Milmo. Experts urge caution over use of Chinese AI DeepSeek. The Guardian. 28 Januari 2025.
  108. Matt Burgess. DeepSeek’s Popular AI App Is Explicitly Sending US Data to China. Wired.

Sumber dan atribusi

Konten artikel ini diadaptasi dari Wikipedia bahasa Indonesia, revisi 29523370 (2026-08-04T08:11:50Z), yang tersedia berdasarkan lisensi Creative Commons Atribusi-BerbagiSerupa (CC BY-SA). Mohon gunakan konten ini secara bijak serta sesuai dengan ketentuan lisensi yang berlaku.