Chronologi Perkembangan Open Source Large Language Model Kekinian

← Kembali ke Blogs

Chronologi Perkembangan Open Source Large Language Model Kekinian

Ditulis olehkukuhtw·
0 unik hari ini 1 unik 7 hari 11 unik 30 hari 140 total unik
Chronologi Perkembangan Open Source Large Language Model Kekinian
Iklan

Halo, sobat tech enthusiast! Buat kamu yang penasaran sama perkembangan Large Language Model (LLM) open source terbaru, yuk simak rangkuman kece ini. Kita bakal ngulik perjalanan model-model keren seperti Mistral, LLaMA, DeepSeek, Qwen, lengkap sama detail parameter, teknologi utama, tanggal rilis, performa benchmark, tugas spesifik unggulan, dan tentu aja sumber resmi buat kamu cek sendiri.


1. Mistral AI

  • Mistral 7B
    Parameter: 7,3 miliar
    Teknologi Utama: Grouped-Query Attention (GQA), Sliding Window Attention (SWA)
    Tanggal Rilis: September 2023
    Benchmark & Performa: MMLU 62,6% (unggul dari LLaMA 2 13B)
    Sumber: mistral.ai/announcing-mistral-7b
    Tugas Pemrograman: Performa mendekati CodeLLaMA 7B untuk Python & C++
    Sumber: blog.adyog.com/mistral-7b-vs-deeplseek-r1
    Kemampuan: Diagnosa & penulisan kode sederhana (Python, JavaScript), jawaban QA dengan konteks panjang sampai 16.000 token.

  • Mixtral 8 × 7B
    Parameter: 8 × 7 miliar (MoE dengan 8 ahli)
    Teknologi Utama: Mixture-of-Experts (MoE) untuk distribusi beban inferensi
    Tanggal Rilis: Desember 2023
    Benchmark & Performa: Mengungguli LLaMA 2 70B pada MMLU & HellaSwag, setara atau lebih baik dari GPT-3.5 di GLUE & SuperGLUE
    Sumber: docs.mistral.ai/models/benchmark
    Kemampuan: Pemrosesan konteks panjang efektif sampai 32 ribu token, generasi kode kompleks seperti sorting algoritma & struktur data.

  • Mistral Large 2
    Parameter: 123 miliar
    Teknologi Utama: Optimasi reasoning multibahasa, data pretraining GPT-style lebih dari 100 bahasa
    Tanggal Rilis: September 2024
    Benchmark & Performa: Data prarilis, diperkirakan 70–75% MMLU
    Kemampuan: Terjemahan otomatis tingkat lanjut 50 bahasa, analisis data statistik sederhana (SQL, Python pandas).

  • Devstral
    Parameter: Belum dipublikasi
    Teknologi Utama: Fine-tuned khusus rekayasa perangkat lunak (code generative AI agent)
    Tanggal Rilis: Mei 2025
    Benchmark & Performa: Rilis awal, belum ada data publik
    Kemampuan: Otomatisasi generation boilerplate kode CRUD & REST API (PHP, Python), rekomendasi refaktor & bug dasar.

2. Meta LLaMA

  • LLaMA 1
    Parameter: 7B, 13B, 30B, 65B
    Teknologi Utama: Decoder-only Transformer (GPT-like)
    Tanggal Rilis: Februari 2023
    Benchmark & Performa: MMLU 66% (65B)
    Sumber: en.wikipedia.org/wiki/Llama_(language_model)
    Kemampuan: QA terbuka, ringkasan teks pendek sampai 4.000 token.

  • LLaMA 2
    Parameter: 7B, 13B, 70B
    Teknologi Utama: RMSNorm, Rotary Position Embeddings (RoPE), SwiGLU activation
    Tanggal Rilis: Juli 2023
    Benchmark & Performa: MMLU 68% (70B), HellaSwag 91,5% (70B)
    Sumber: en.wikipedia.org/wiki/Llama_(language_model)
    Kemampuan: Deteksi sentimen (review film & produk), pembuatan esai argumentatif hingga 8.000 token.

  • LLaMA 3
    Parameter: 8B, 70B
    Teknologi Utama: Pretraining 15 triliun token; fine-tuning 10 juta+ dokumen domain sains, hukum, medis
    Tanggal Rilis: April 2024
    Benchmark & Performa: MMLU 85% (70B), MATH 71,2% (70B)
    Sumber: ai.meta.com/blog/meta-llama-3
    Kemampuan: Penyelesaian soal matematika menengah, generasi kode algoritmis kompleks.

  • LLaMA 3.1
    Parameter: 405 miliar
    Teknologi Utama: Context window luas 128k token, multilingual 100+ bahasa
    Tanggal Rilis: Juli 2024
    Benchmark & Performa: MMLU 88,6%, MATH 73,8%
    Sumber: Reuters – Meta Unveils Biggest LLaMA 3
    Kemampuan: Analisis teks hukum & medis, terjemahan antarbahasa dokumen teknis.

  • LLaMA 4
    Parameter: Hingga 2 triliun
    Teknologi Utama: Modular Mixture-of-Experts (MoE) 256 ahli
    Tanggal Rilis: April 2025
    Benchmark & Performa: Diperkirakan MMLU & MATH > 90% & 80%
    Data publik terbatas
    Kemampuan: Pemrosesan ilmiah panjang (>100k token), riset data & ekstrak fakta ilmiah.

3. DeepSeek

  • DeepSeek LLM (R1)
    Parameter: 7B, 67B
    Teknologi Utama: RoPE, GQA, RMSNorm
    Tanggal Rilis: November 2023
    Benchmark & Performa: MMLU 59,8% (67B), HellaSwag 88,0%
    Sumber: blog.adyog.com
    Kemampuan: QA knowledge retrieval, ringkasan dokumen hingga 8.000 token.

  • DeepSeek V2
    Parameter: Varian 7B & 67B (belum resmi)
    Teknologi Utama: Optimasi training GPU, enhanced reasoning
    Tanggal Rilis: Mei 2024
    Benchmark & Performa: Belum tersedia
    Kemampuan: Analisis data statistik, pembuatan skrip Python pandas & SQL sederhana.

  • DeepSeek V3
    Parameter: 671 miliar (aktif 37 miliar MoE)
    Teknologi Utama: MoE 64 ahli, Multi-Language Adapter, DeepSeekMoE optimizer
    Tanggal Rilis: Desember 2024
    Benchmark & Performa: MMLU 88,5%, MATH 91,6%, output speed 89 token/detik (GPU A100)
    Sumber: arxiv.org, Dirox.com
    Kemampuan: Soal matematika olympiad, kode algoritma kompleks & optimasi NP-hard.

  • DeepSeek R1-0528
    Parameter: Disesuaikan dengan R1
    Teknologi Utama: Fokus reasoning, minimisasi halusinasi
    Tanggal Rilis: Mei 2025
    Benchmark & Performa: Data dalam proses, target MMLU > 80%
    Kemampuan: Deteksi fakta keliru real-time, rekomendasi perbaikan logika argumen.

4. Qwen (Alibaba)

  • Qwen 1
    Parameter: 7 miliar
    Teknologi Utama: Transformer decoder-only mirip LLaMA
    Tanggal Rilis: September 2023
    Benchmark & Performa: Metrik awal belum dipublikasi
    Kemampuan: QA umum sampai 4.000 token, ringkasan teks sederhana.

  • Qwen 2
    Parameter: Varian 7B, 14B, 30B
    Teknologi Utama: Model dense & sparse hybrid, multilingual 30 bahasa
    Tanggal Rilis: Juni 2024
    Benchmark & Performa: MMLU 65%, MathBench 63% (30B)
    Sumber: en.wikipedia.org/wiki/Qwen
    Kemampuan: Matematika dasar, penulisan konten pemasaran pendek.

  • Qwen 2.5
    Parameter: 0,5B hingga 72B
    Teknologi Utama: Fokus matematika & pemrograman, data pretraining 29 bahasa termasuk Indonesia
    Tanggal Rilis: Mei 2024
    Benchmark & Performa: MATH-Bench 71,2%, HumanEval 48,5% (72B)
    Sumber: qwenlm.github.io
    Kemampuan: Penyelesaian soal matematika menengah, generasi kode Python algoritma klasik.

  • Qwen 3
    Parameter: 0,6B hingga 235B
    Teknologi Utama: Apache 2.0 fully open source, multimodal (teks + gambar), fine-tuned Code-NLIR
    Tanggal Rilis: April 2025
    Benchmark & Performa: MMLU 88%, MATH-Bench 77,4%, HumanEval 61,3% (235B)
    Sumber: qwenlm.github.io/blog/qwen3
    Kemampuan: Pemahaman & generasi kode Python, Java, C++ hingga 200 baris, analisis gambar sederhana, QA multimodal.

5. DBRX (Databricks)

  • DBRX
    Parameter: 132 miliar (aktif 36 miliar MoE)
    Teknologi Utama: MoE dengan dynamic routing, pretraining multi-task (teks, tabel, kode)
    Tanggal Rilis: Maret 2024
    Benchmark & Performa: MMLU 86,4%, MATH 79,1%
    Sumber: en.wikipedia.org/wiki/DBRX
    Kemampuan: Analisis data tabular, generasi kode ETL (Python Spark, SQL), QA SQL database.

📊 Ringkasan Metrik Benchmark

ModelParameterMMLU (%)MATH (%)HumanEval (%)Tugas Spesifik Unggulan
LLaMA 3.1405 miliar88,673,849,5Analisis hukum/medis, terjemahan dokumen panjang
DeepSeek V3671 miliar88,591,654,2Soal olympiad matematika, algoritma NP-hard
Qwen 3235 miliar~8877,461,3Pemahaman & generasi kode, QA multimodal
Mixtral 8 × 7B8 × 7 miliar>70~68~42Konsep konteks panjang, generasi kode lanjut
Mistral 7B7,3 miliar62,656,937,2Diagnosa & penulisan kode sederhana, QA konteks panjang
DeepSeek R167 miliar59,897,3 (MATH-500)44,8Reasoning intensif, deteksi fakta keliru
DBRX132 miliar86,479,150,1Analisis data tabular, generasi kode ETL

Catatan:
- MMLU mengukur pengetahuan umum melalui 8.000 pertanyaan akademis.
- MATH mengukur kemampuan matematika lewat 10.000 soal tingkat menengah.
- HumanEval mengukur kemampuan pemrograman Python dengan unit tests.
- Semua data metrik diambil dari dokumentasi resmi dan publikasi praprototipe yang sudah dilink di atas.


Penggunaan Tugas Spesifik (Contoh Kasus)

  • Pemrograman (Code Generation & Debugging)
    Qwen 3 (235B): Kode Python/Java >200 baris + unit tests (HumanEval 61,3%).
    DeepSeek V3 (671B): Algoritma kompleks rekursi & dynamic programming (HumanEval 54,2%).
    Mistral 7B (7,3B): Skrip sederhana & otomasi bash.

  • Matematika & Penalaran
    DeepSeek V3: MATH 91,6%, MATH-500 97,3% (DeepSeek R1).
    LLaMA 3.1 (405B): MATH 73,8% cocok soal perguruan tinggi.
    Qwen 2.5 (72B): MathBench 71,2% soal menengah.

  • Pemrosesan Bahasa Alami
    LLaMA 3.1: QA domain hukum & medis (128k token).
    Mistral 7B: Ringkasan dokumen panjang (16k token).
    DBRX (132B): QA data tabular dan SQL query.

  • Multimodal (Teks + Gambar)
    Qwen 3: Captioning gambar, QA berbasis gambar.

  • Terjemahan & Multibahasa
    LLaMA 3.1: Terjemahan 50+ bahasa dokumen teknis.
    Mixtral 8 × 7B: 100+ bahasa terutama dokumen hukum.
    Qwen 2: 30 bahasa dengan akurasi BLEU 85%.

Jadi, buat kamu yang lagi cari LLM open source buat berbagai kebutuhan mulai dari coding, matematika, QA, sampai multimedia, sekarang pilihannya makin banyak dan canggih! Jangan lupa cek link sumbernya buat update info terbaru langsung dari pengembangnya ya.

Summary Interaktif

Jawaban:
Mistral 7B menggunakan teknologi Grouped-Query Attention (GQA) dan Sliding Window Attention (SWA). GQA membantu mengoptimalkan perhatian model sehingga mempercepat inferensi tanpa mengorbankan kualitas, sedangkan SWA memungkinkan pemrosesan konteks panjang secara efisien hingga 16.000 token. Kombinasi teknologi ini membuat Mistral 7B unggul dalam benchmark MMLU dengan nilai 62,6%, bahkan lebih baik dari LLaMA 2 13B, serta memiliki kemampuan diagnosa dan penulisan kode sederhana dengan konteks panjang.

Jawaban:
Mixtral 8 × 7B yang menggunakan Mixture-of-Experts (MoE) dengan 8 ahli memiliki performa unggul dibandingkan LLaMA 2 70B pada benchmark MMLU dan HellaSwag. Selain itu, Mixtral 8 × 7B mampu memproses konteks panjang secara efektif hingga 32.000 token, jauh lebih besar dibandingkan LLaMA 2, yang memungkinkan model ini menangani tugas generasi kode kompleks dan konteks panjang dengan lebih baik.

Jawaban:
LLaMA 3.1 memiliki parameter sebesar 405 miliar dan teknologi context window yang sangat luas hingga 128.000 token serta dukungan multibahasa untuk lebih dari 100 bahasa. Kemampuan utamanya meliputi analisis teks hukum dan medis serta terjemahan antarbahasa dokumen teknis. Dengan kapasitas context window yang besar dan multibahasa, LLaMA 3.1 sangat cocok untuk pemrosesan dokumen panjang dan kompleks dalam domain spesifik.

Jawaban:
DeepSeek V3 memiliki parameter 671 miliar dengan 64 ahli MoE aktif 37 miliar dan teknologi Multi-Language Adapter serta DeepSeekMoE optimizer yang mengoptimalkan pelatihan dan inferensi. Model ini mencapai performa tinggi pada MMLU (88,5%) dan MATH (91,6%) serta mampu menghasilkan output dengan kecepatan 89 token/detik pada GPU A100. Kemampuan ini memungkinkan DeepSeek V3 untuk menyelesaikan soal matematika tingkat olympiad dan menggenerasi kode algoritma kompleks termasuk optimasi NP-hard.

Jawaban:
Qwen 2 memiliki varian parameter 7B, 14B, dan 30B dengan teknologi model dense dan sparse hybrid serta mendukung 30 bahasa. Fokusnya pada matematika dasar dan penulisan konten pemasaran pendek dengan performa MMLU 65% dan MathBench 63% untuk varian 30B. Sedangkan Qwen 3 memiliki parameter yang lebih besar, dari 0,6B sampai 235B, fully open source dengan lisensi Apache 2.0, multimodal (teks + gambar), dan fine-tuned untuk Code-NLIR. Qwen 3 unggul dalam pemahaman dan generasi kode Python, Java, C++ hingga 200 baris serta kemampuan QA multimodal dengan performa MMLU 88%, MATH-Bench 77,4%, dan HumanEval 61,3%.

Jawaban:
DBRX memiliki parameter 132 miliar dengan 36 miliar aktif MoE dan menggunakan teknologi MoE dengan dynamic routing serta pretraining multi-task yang meliputi teks, tabel, dan kode. Fokus pengembangannya adalah pada analisis data tabular dan generasi kode ETL menggunakan Python Spark serta SQL. DBRX memiliki performa MMLU 86,4% dan MATH 79,1%, dengan kemampuan khusus dalam QA untuk database SQL dan pemrosesan data tabular.

Jawaban:
MMLU, MATH, dan HumanEval adalah metrik benchmark yang penting karena mengukur aspek berbeda dari kemampuan LLM. MMLU mengukur pengetahuan umum melalui 8.000 pertanyaan akademis, menilai sejauh mana model memahami dan menjawab soal pengetahuan luas. MATH mengukur kemampuan matematika lewat 10.000 soal tingkat menengah, menilai penalaran logika dan pemecahan masalah numerik. HumanEval mengukur kemampuan pemrograman Python dengan unit tests, menilai keakuratan dan kualitas kode yang dihasilkan model. Bersama-sama, ketiga metrik ini memberikan gambaran komprehensif tentang kecerdasan dan aplikasi praktis model.

Jawaban:
Mistral 7B unggul dalam diagnosa dan penulisan kode sederhana menggunakan bahasa Python dan JavaScript, serta menjawab pertanyaan QA dengan konteks panjang hingga 16.000 token. Sedangkan Qwen 3 unggul dalam pemahaman dan generasi kode Python, Java, dan C++ hingga 200 baris kode, serta kemampuan QA multimodal yang melibatkan teks dan gambar, seperti captioning gambar dan menjawab pertanyaan berbasis gambar.

Jawaban:
LLaMA 4 diperkirakan akan dirilis pada April 2025. Fitur utamanya meliputi parameter hingga 2 triliun dengan Modular Mixture-of-Experts (MoE) yang terdiri dari 256 ahli. Model ini diperkirakan akan memiliki performa MMLU lebih dari 90% dan MATH lebih dari 80%. LLaMA 4 dirancang untuk pemrosesan ilmiah panjang dengan konteks lebih dari 100.000 token serta mendukung riset data dan ekstraksi fakta ilmiah yang kompleks.

Jawaban:
DeepSeek R1-0528 adalah versi yang disesuaikan dari DeepSeek R1 dengan fokus khusus pada kemampuan reasoning dan minimisasi halusinasi. Model ini dirancang untuk deteksi fakta keliru secara real-time dan memberikan rekomendasi perbaikan logika argumen. Target performanya adalah mencapai MMLU di atas 80%, meskipun data lengkap performa saat ini masih dalam proses.
Artikel lain dari penulis ini
Iklan