3 views
# RAG Bukan “Percuma”: Apa yang Penyelidikan ICML 2026 Dedahkan tentang Kos Memori LLM Retrieval-Augmented Generation, atau RAG, sering dianggap sebagai cara praktikal untuk memberi model AI akses kepada maklumat tambahan tanpa melatih semula keseluruhan model. Pendekatan ini memang berguna. Sistem boleh mencari dokumen yang relevan, mengambil maklumat tertentu dan memasukkannya ke dalam konteks sebelum model menghasilkan jawapan. Namun, “lebih banyak konteks” tidak semestinya bermaksud “lebih murah” atau “lebih pantas”. Penyelidikan yang dibentangkan pada ICML 2026 oleh Microsoft Research dan rakan penyelidik menunjukkan bahawa pemprosesan memori boleh mengambil bahagian yang sangat besar dalam keseluruhan inference LLM. Para penyelidik menyatukan beberapa teknik seperti sparse attention, RAG dan compressed contextual memory ke dalam satu pipeline empat peringkat: menyediakan memori, mengira relevancy, retrieval dan menggunakan hasil tersebut semasa inference. Dalam profiling mereka, memory-processing overhead berada antara **22% hingga 97%** bergantung pada workload dan konfigurasi yang diuji. Julat itu sangat luas. Ia juga menunjukkan mengapa angka tersebut tidak patut dibaca sebagai “RAG sentiasa menggunakan 97% kos tambahan”. Keputusan bergantung pada model, jenis memory optimization dan sistem hardware yang digunakan. Tetapi arah penemuannya jelas: apabila sistem AI semakin banyak bergantung pada retrieval dan long context, pemprosesan memori sendiri boleh menjadi bottleneck. Untuk pasukan digital seperti **WOW88**, perkara ini penting apabila menilai architecture AI. Kadangkala perbincangan terlalu fokus pada saiz model. Pasukan bertanya model mana paling besar, berapa banyak parameter yang dimiliki atau berapa panjang context window yang tersedia. Tetapi production system mempunyai lebih banyak komponen. Jika sebuah aplikasi perlu mencari dalam ribuan dokumen sebelum setiap jawapan, latency retrieval dan memory processing boleh menjadi sama penting dengan keupayaan model itu sendiri. Penyelidikan tersebut juga mencadangkan pendekatan heterogeneous computing. Dalam eksperimen mereka, operasi yang lebih tidak teratur dan memory-bound dipindahkan kepada FPGA, manakala tugas compute-intensive kekal pada GPU. Pada sistem yang diuji menggunakan AMD MI210 GPU dan Alveo U55C FPGA, penyelidik melaporkan sehingga **2.2 kali peningkatan kelajuan** dan sehingga **4.7 kali pengurangan penggunaan tenaga** berbanding GPU baseline untuk beberapa LLM optimization workloads. Sekali lagi, angka ini ialah hasil eksperimen pada hardware dan workload tertentu. Ia bukan jaminan bahawa setiap syarikat boleh membeli FPGA dan memperoleh prestasi yang sama. Nilai kajian ini terletak pada prinsipnya. Tidak semua langkah dalam pipeline AI mempunyai ciri pengiraan yang sama. Sesetengah operasi memerlukan banyak matrix computation. Yang lain lebih bergantung pada memory access atau pencarian data. Jika semua kerja dipaksa melalui satu jenis hardware, sebahagian kapasiti mungkin tidak digunakan dengan efisien. Dalam aplikasi RAG sebenar, pasukan juga perlu melihat beberapa lapisan lain. Pertama ialah kualiti retrieval. Sistem yang mencari terlalu banyak dokumen mungkin meningkatkan token count tanpa meningkatkan jawapan. Sebaliknya, retrieval yang terlalu agresif boleh membuang maklumat penting. Kedua ialah chunking. Dokumen perlu dibahagikan dengan cara yang membolehkan sistem menemui konteks yang benar-benar relevan. Chunk yang terlalu besar menggunakan lebih banyak token. Chunk yang terlalu kecil boleh kehilangan hubungan antara ayat. Ketiga ialah caching. Jika ramai pengguna bertanya soalan serupa, sebahagian retrieval atau hasil embedding mungkin boleh digunakan semula. Ini boleh mengurangkan kerja yang tidak perlu. Bagi **<a href="https://www.youtube.com/@wow88my_official">WOW88</a>**, pelajaran yang lebih luas ialah architecture AI perlu dinilai berdasarkan keseluruhan perjalanan data. Model hanya satu komponen. Vector database, retrieval pipeline, token processing, caching dan hardware semuanya mempengaruhi latency serta kos. Ini menjadi semakin penting apabila aplikasi AI bergerak daripada prototype kepada production. Dalam demo kecil, tambahan beberapa ratus milisaat mungkin tidak begitu ketara. Pada skala besar, tambahan kerja untuk setiap request boleh bertukar menjadi kos infrastructure yang signifikan. RAG masih merupakan teknik yang berguna. Kajian ICML 2026 tidak mengatakan bahawa retrieval patut dielakkan. Sebaliknya, ia mengingatkan pembangun bahawa retrieval mempunyai kos pengiraan sendiri. Pertanyaan terbaik bukan sekadar “Berapa banyak konteks yang boleh kita berikan kepada model?” Pertanyaan yang lebih matang ialah “Berapa banyak konteks yang benar-benar diperlukan untuk menghasilkan jawapan yang lebih baik?” Apabila pasukan mula mengukur perkara itu, AI system design boleh menjadi lebih efisien, lebih pantas dan lebih mudah dikawal.