Membina aplikasi AI yang benar-benar berfungsi bukan sekadar tentang merangka prom yang sempurna, tetapi lebih kepada mengawal maklumat yang anda berikan kepada model tersebut. Jika anda pernah berbual panjang dengan pembantu AI, hanya untuk menyedari ia terlupa sesuatu yang anda katakan sepuluh minit yang lalu, anda telah merasai apa yang berlaku apabila kejuruteraan konteks gagal. Adalah mudah untuk menganggap AI mempunyai ingatan yang lemah. Hakikatnya, anda telah terlanggar had tetap tetingkap konteks.

Untuk membina sistem yang kekal boleh dipercayai dan responsif, anda perlu memahami tiga asas: token, tetingkap konteks, dan perbezaan antara konteks dan ingatan.

Token Adalah Mata Wang Sebenar

Token bukanlah satu perkataan. Apabila anda menghantar teks kepada model, tokenizer akan memecahkannya kepada bahagian yang lebih kecil. Perkataan biasa yang pendek seperti "cat" atau "the" mungkin hanya menggunakan satu token. Istilah teknikal yang padat seperti "internationalization" akan dipecahkan kepada beberapa bahagian. Tanda baca, ruang, dan aksara khas juga dikira. Ini penting kerana token mengawal segala-galanya: bil API anda, kelajuan respons, dan kualiti output.

Pembangun yang merancang kos dengan mengira perkataan sebenarnya sedang melangkah dalam kegelapan. Prom seratus perkataan yang dipenuhi dengan kurungan kod dan nama pemboleh ubah yang panjang boleh melambungkan kos jauh melampaui jangkaan. Itulah sebabnya tokenizer wujud sebagai alat berdiri sendiri. Sebelum anda melancarkan sesuatu ciri, jalankan payload tipikal anda melalui tokenizer. Anda akan sering mendapati bahawa arahan sistem, boilerplate format, dan sejarah sembang memakan lebih banyak bajet anda berbanding pertanyaan pengguna yang sebenar. Anggaplah token sebagai sumber yang terhad sejak hari pertama.

Tetingkap Konteks Adalah Papan Putih Tetap

Tetingkap konteks adalah jumlah keseluruhan maklumat yang boleh dilihat oleh model dalam satu permintaan tunggal. Bayangkan ia sebagai papan putih dengan dimensi yang tetap. Anda boleh mengisinya dengan peraturan sistem, sejarah perbualan, dokumen yang diambil, dan soalan semasa. Namun, sebaik sahaja permukaannya penuh, sesuatu mesti dikorbankan. Nota lama mesti dipadam, diambil gambar dan diringkaskan, atau papan tersebut akan melimpah.

Model moden menawarkan tetingkap konteks yang merangkumi daripada beberapa ribu token sehingga ratusan ribu token. Adalah menggoda untuk menganggap tetingkap yang lebih besar sebagai storan tanpa had. Namun, ia tidak begitu. Papan putih itu tetap mempunyai sempadan. Apabila sejarah melebihi had, aplikasi mesti membuang mesej lama atau memampatkannya. Memahami kekangan ini membantu anda berhenti melayan tetingkap tersebut seperti pangkalan data dan mula melayannya sebagai ruang kerja aktif.

Konteks Bukanlah Ingatan

Berikut adalah perbezaan yang sering mengelirukan pembangun yang berpengalaman. Model itu sendiri adalah tanpa keadaan (stateless). Ia tidak mengingati anda dari semalam, minggu lepas, atau sepuluh minit yang lalu dalam sesi yang berbeza. Apabila AI seolah-olah mengingati bahawa anda lebih suka Python berbanding JavaScript, atau anda menyukai jawapan yang ringkas, ingatan tersebut berada pada lapisan aplikasi, bukan pada model.

Aplikasi menyimpan fakta-fakta tersebut dalam pangkalan data, cache, atau storan memori. Pada setiap permintaan baharu, ia menyuntik semula data profil yang relevan ke dalam prom. Model tersebut hanya membaca skrip yang merangkumi baris dialognya dari babak pertama. Ia tidak mempunyai identiti yang kekal. Sebaik sahaja anda memahami pemisahan ini, seni bina anda akan berubah. Anda berhenti meminta model untuk mengingati dan mula mereka bentuk sistem yang mengambil konteks yang betul pada masa yang tepat.

Mengapa Lebih Banyak Konteks Boleh Memudaratkan

Logik akal mencadangkan bahawa lebih banyak maklumat latar belakang sepatutnya menghasilkan jawapan yang lebih baik. Namun, sering kali sebaliknya yang berlaku. Konteks yang berlebihan mewujudkan hingar (noise). Jika anda memberikan keseluruhan kod sumber kepada model sedangkan anda hanya perlu membaiki satu fungsi, anda memaksanya untuk mencari isyarat dalam gangguan (static). Penyelidik telah mengenal pasti kesan "Lost in the Middle": model kerap memberi perhatian lebih kepada butiran di permulaan dan akhir prom, manakala maklumat yang tertanam di tengah-tengah menjadi cair atau diabaikan. Ini bukan pepijat yang boleh anda perbaiki dengan susunan kata yang bijak. Ia adalah tingkah laku struktur yang wujud dalam seni bina berasaskan transformer.

Prom yang terlalu sarat juga memberi kesan buruk kepada anda. Setiap token tambahan memerlukan pengiraan. Latensi meningkat. Kos melonjak. Kesabaran pengguna berkurangan. Prom yang dipenuhi dengan dokumen yang tidak relevan memperkenalkan percanggahan, mengalih perhatian model dengan butiran sampingan, dan meningkatkan kemungkinan respons tertumpu pada masalah yang salah. Kuantiti adalah musuh kepada ketepatan.

Cara Merekayasa Konteks yang Lebih Baik

Kejuruteraan konteks yang baik adalah satu latihan penyuntingan yang tegas. Berikut adalah cara untuk mempraktikkannya.

Send only what the task requires. If a user asks about your refund policy, do not include the employee handbook, the API documentation, and last quarter’s marketing copy. Relevance beats comprehensiveness.

Use RAG to retrieve relevant documents. Retrieval-Augmented Generation lets you search a large knowledge base and inject only the top-matching passages into the prompt. Instead of dumping a thousand-page manual into the window, you embed your documents, run a semantic search against the user’s query, and include the three most relevant paragraphs. The model gets exactly what it needs, and your token budget stays intact.

Summarize old conversations. Full chat transcripts are expensive and noisy. Replace lengthy message histories with running summaries. For example, instead of feeding the model thirty back-and-forth messages, store a single paragraph: "The user asked about Django deployment, encountered a static files error, and fixed permissions. The current issue is a database migration failing on Postgres 14." That summary preserves state without cluttering the whiteboard.

Separate long-term memory from active chat. User preferences, project settings, and account history belong in an external memory store. Query that store selectively. The live context window should carry only the immediate task and the briefest personal context needed to maintain continuity.

Monitor token usage in production. Latency spikes often trace directly to context bloat. Set alerts when requests approach your model’s limit. Review logs to identify prompts carrying dead weight. Optimization starts with the same question every time: what can we remove without breaking the task?

The Real Takeaway

The best AI applications do not win because they have the biggest context windows. They win because they manage context with discipline. A massive whiteboard is useless if it is covered in scribbles. Build systems that retrieve, summarize, and filter. Your users get faster answers, your infrastructure costs stay predictable, and your models finally pay attention to what actually matters.

Source: AI Context Engineering: Tokens, Context Windows, & Memory

Community: GyaanSetu AI on Telegram