سۈنئىي ئىدراكنى يەرلىكتە ئورنىتىش ۋە ئىشلىتىش
قاتتىق دېتال ۋە مودېل تاللاش
قاتتىق دېتال: چوڭ مودېللارنىڭ ئاساسى
چوڭ تىل مودېللىرىنى (LLMs) يەرلىك كومپيۇتېردا ئىجرا قىلىش خۇددى بىر سېخ قۇرۇشقا ئوخشايدۇ، مۇۋاپىق قوراللار بولمىسا بولمايدۇ. ئەڭ مۇھىم ئۈچ زاپچاس بار: گرافىك بىر تەرەپ قىلغۇچ (GPU)، ئىچكى ساقلىغۇچ (RAM) ۋە مەركىزىي بىر تەرەپ قىلغۇچ (CPU). بۇلارنىڭ ئىچىدە GPU مۇتلەق يادرولۇق رول ئوينايدۇ.
VRAM: مودېلنىڭ ئەستە تۇتۇش بوشلۇقى
GPU نىڭ ئەڭ ھالقىلىق ئۆلچىمى ئۇنىڭ سىنلۇق ئىختىيارىي زىيارەت ئىچكى ساقلىغۇچى (VRAM) سىغىمىدۇر. مودېلنىڭ بارلىق پارامېتىرلىرى، يەنى ئۇنىڭ «مېڭىسى» VRAM غا يۈكلىنىدۇ. VRAM قانچە چوڭ بولسا، شۇنچە چوڭ ۋە مۇرەككەپ مودېللارنى راۋان ئىجرا قىلغىلى بولىدۇ.
- ئەڭ تۆۋەن تەلەپ: 8GB VRAM. بۇ سىغىمدا كىچىك تىپتىكى 7B (يەتتە مىليارد) پارامېتىرلىق مودېللارنى ئىجرا قىلغىلى بولىدۇ.
- تەۋسىيە قىلىنىدىغان تەلەپ: 16GB ياكى ئۇنىڭدىن يۇقىرى VRAM. 16GB لىق VRAM ئارقىلىق 13B لىق مودېللارنى ياخشى ئىجرا قىلغىلى، ھەتتا بەزى 70B لىق مودېللارنىڭ تۆۋەن دەرىجىلىك مىقدارلاشتۇرۇلغان نۇسخىلىرىنى سىناپ باققىلى بولىدۇ.
ئادەتتىكى ئىچكى ساقلىغۇچ (RAM) بولسا مودېلنىڭ ۋاقىتلىق خىزمەت ئۈستىلىگە ئوخشايدۇ. ئۇ مودېل ئىجرا بولۇۋاتقاندا كېرەكلىك سانلىق مەلۇماتلارنى ساقلايدۇ. ئادەتتە 16GB RAM يېتەرلىك، ئەمما 32GB بولسا تېخىمۇ ياخشى. CPU بولسا پۈتۈن سىستېمىنىڭ باشقۇرغۇچىسى، ئۇ سانلىق مەلۇماتلارنى يۆتكەيدۇ ۋە ۋەزىپىلەرنى تەقسىملەيدۇ. كۆپىنچە زامانىۋى CPU لار بۇ ۋەزىپىنى ئورۇندىيالايدۇ.
ئەگەر GPU نىڭ VRAM سىغىمى يەتمىسە، مودېلنىڭ بىر قىسمىنى سىستېمىنىڭ RAM ىغا يۈكلەشكە توغرا كېلىدۇ. بۇ گەرچە ئىمكانىيەت ياراتسىمۇ، ئەمما RAM نىڭ سۈرئىتى VRAM غا قارىغاندا كۆپ ئاستا بولغاچقا، مودېلنىڭ جاۋاب قايتۇرۇش سۈرئىتىنى زور دەرىجىدە تۆۋەنلىتىۋېتىدۇ.
مودېل تاللاش: تەڭپۇڭلۇق سەنئىتى
قاتتىق دېتالىڭىزنى بىلگەندىن كېيىن، نۆۋەتتىكى قەدەم غا ئوخشاش سۇپىلاردىن مۇۋاپىق مودېل تاللاش. بۇ جەرياندا ئۈچ مۇھىم ئامىلنى ئويلىشىش كېرەك: پارامېتىر سانى، مىقدارلاشتۇرۇش دەرىجىسى ۋە فورماتى.
1. پارامېتىر سانى: بۇ مودېلنىڭ چوڭ-كىچىكلىكىنى ۋە «ئەقىللىق» دەرىجىسىنى بەلگىلەيدۇ. 7B، 13B، 70B دېگەندەك سانلار مودېلدىكى پارامېتىرلارنىڭ مىليارد بىلەن ھېسابلىنىدىغانلىقىنى بىلدۈرىدۇ. پارامېتىر قانچە كۆپ بولسا، مودېلنىڭ ئىقتىدارى شۇنچە كۈچلۈك، ئەمما VRAM غا بولغان تەلىپىمۇ شۇنچە يۇقىرى بولىدۇ.
2. مىقدارلاشتۇرۇش (Quantization): بۇ مودېلنىڭ ھەجىمىنى كىچىكلىتىدىغان بىر خىل پىرىسلاش تېخنىكىسى. ئەسلىدىكى مودېللار پارامېتىرلارنى ساقلاش ئۈچۈن 16-bit لىق لەيلىمە نۇقتا (FP16) ئىشلىتىدۇ. مىقدارلاشتۇرۇش بۇ پارامېتىرلارنى تېخىمۇ تۆۋەن bit لىق فورماتقا (مەسىلەن، 4-bit ياكى 5-bit) ئۆزگەرتىدۇ. بۇ VRAM ئىشلىتىشنى زور دەرىجىدە ئازايتىدۇ، ئەمما مودېلنىڭ توغلۇق دەرىجىسىنى ئازراق تۆۋەنلىتىۋېتىشى مۇمكىن.
Hugging Face تا مودېل ئىسىملىرىدە Q4_K_M، Q5_K_S، Q8_0 دېگەنگە ئوخشاش بەلگىلەرنى كۆرىسىز. بۇ يەردىكى سان (4, 5, 8) bit نىڭ سانىنى كۆرسىتىدۇ. سان قانچە چوڭ بولسا، مىقدارلاشتۇرۇش دەرىجىسى شۇنچە تۆۋەن، مودېلنىڭ سۈپىتى ئەسلىگە شۇنچە يېقىن بولىدۇ.
بىر ئاددىي ئوخشىتىش: يۇقىرى سۈپەتلىك رەسىمنى (FP16) JPG فورماتىدا (Q4) ساقلىغانغا ئوخشايدۇ. ھۆججەت ھەجىمى كىچىكلەيدۇ، ئەمما بەزى تەپسىلاتلار يوقاپ كېتىشى مۇمكىن.
3. فورماتى: يەرلىك مودېللار ئۈچۈن ئاساسلىقى ئۈچ خىل فورمات كۆپ ئۇچرايدۇ:
- (GPT-Generated Unified Format): CPU ۋە GPU دا تەڭ ئىجرا قىلىشقا ئەڭ ماس كېلىدىغان فورمات. ئۇ جانلىق بولۇپ، نۇرغۇنلىغان LLM قوراللىرى تەرىپىدىن قوللىنىلىدۇ. ئەگەر قايسى فورماتنى تاللاشنى بىلمىسىڭىز، GGUF ئەڭ بىخەتەر تاللاش.
- EXL2: بۇ فورمات پەقەت NVIDIA GPU لىرى ئۈچۈنلا لايىھەلەنگەن بولۇپ، ئىنتايىن تېز سۈرئەت ۋە تۆۋەن VRAM ئىشلىتىش ئالاھىدىلىكىگە ئىگە. ئەگەر سىزدە NVIDIA كارتىسى بولسا، EXL2 فورماتىدىكى مودېللار ئەڭ يۇقىرى ئىقتىدار بىلەن تەمىنلەيدۇ.
- AWQ (Activation-aware Weight Quantization): بۇ يېڭىدىن چىققان بىر خىل مىقدارلاشتۇرۇش ئۇسۇلى بولۇپ، تۆۋەن bit لىق فورماتلاردا (مەسىلएन 4-bit) تېخىمۇ ياخشى ئىقتىدارنى ساقلاپ قالالايدۇ.
| فورمات | ماسلىشىشچانلىقى | ئەۋزەللىكى | كەمچىلىكى |
|---|---|---|---|
| GGUF | CPU + GPU (NVIDIA, AMD, Apple) | ئەڭ كەڭ قوللىنىلىدۇ، جانلىق | EXL2 گە قارىغاندا سەل ئاستا |
| EXL2 | NVIDIA GPU | ئەڭ تېز سۈرئەت، تۆۋەن VRAM | پەقەت NVIDIA نى قوللايدۇ |
| AWQ | ئاساسلىقى NVIDIA GPU | يۇقىرى پىرىسلاش نىسبىتىدە سۈپەتنى ساقلايدۇ | EXL2 گە قارىغاندا سەل ئاستا بولۇشى مۇمكىن |
Hugging Face دىن مودېل تاللاش
ئەمدى ئەمەلىي مىسال كۆرۈپ باقايلى. سىزدە 16GB VRAM لىق NVIDIA RTX 4070 Ti كارتىسى بار دەپ پەرەز قىلايلى. Llama 3 مودېلىنى ئىجرا قىلماقچى بولدىڭىز. Hugging Face تا «Llama 3 8B Instruct» دەپ ئىزدەيسىز. نەتىجىلەر ئىچىدە «NousResearch/Meta-Llama-3-8B-Instruct-GGUF» غا ئوخشاش ئىسىملارنى كۆرىسىز.
بۇ مودېل كارتىسىغا كىرىپ، «Files and versions» بەتكۈچىگە ئۆتىسىز. ئۇ يەردە ھەر خىل مىقدارلاشتۇرۇلغان ھۆججەتلەرنى كۆرىسىز:
Meta-Llama-3-8B-Instruct.Q4_K_M.gguf(4.67 GB)Meta-Llama-3-8B-Instruct.Q5_K_M.gguf(5.42 GB)Meta-Llama-3-8B-Instruct.Q8_0.gguf(8.44 GB)
16GB لىق VRAM ئۈچۈن Q8_0 نۇسخىسى ئەڭ ياخشى تاللاش، چۈنكى ئۇ سۈپەت جەھەتتە ئەسلىگە ئەڭ يېقىن، ھەمدە VRAM سىغىمىغا پۈتۈنلەي سىغىدۇ. ئەگەر 8GB لىق VRAM بولسا، Q4_K_M ياكى Q5_K_M نى تاللاشقا توغرا كېلىدۇ.
مودېل تاللاشتا ئۆزىڭىزنىڭ ئېھتىياجىنى ئويلىشىڭ:
- Llama 3: ئومۇمىي ئىشلارغا ۋە ئىجادىي يېزىقچىلىققا ماھىر.
- Mistral: كود يېزىش ۋە لوگىكىلىق تەپەككۇردا كۈچلۈك.
- Phi-3: كىچىك ھەجىملىك بولسىمۇ، ئىقتىدارى يۇقىرى، بولۇپمۇ چەكلىك قاتتىق دېتاللارغا ماس كېلىدۇ.
تاللاش جەريانى سىناش ۋە تەڭشەشنى تەلەپ قىلىدۇ. ئوخشىمىغان مودېل ۋە مىقدارلاشتۇرۇش دەرىجىلىرىنى سىناپ بېقىپ، ئۆزىڭىزنىڭ قاتتىق دېتالى ۋە ئېھتىياجىغا ئەڭ ماس كېلىدىغان تەڭپۇڭلۇقنى تېپىپ چىقىڭ.
چوڭ تىل مودېللىرىنى (LLMs) يەرلىك كومپيۇتېردا ئىجرا قىلىشتا، قايسى قاتتىق دېتال زاپچىسى ئەڭ ھالقىلىق رول ئوينايدۇ؟
مودېلنىڭ «مىقدارلاشتۇرۇش» (Quantization) تېخنىكىسىنىڭ ئاساسلىق مەقسىتى نېمە؟
ئەمدى كېيىنكى قەدەمدە، بۇ مودېللارنى يەرلىك كومپيۇتېرىمىزدا قانداق قاچىلاپ ئىشلىتىشنى ئۆگىنىمىز.
