Kimi Code CLI 1.49.0 wprowadza dynamiczne zarządzanie tokenami i ujednolica obsługę modeli myślących

Kimi Code CLI 1.49.0 wprowadza dynamiczne zarządzanie tokenami i ujednolica obsługę modeli myślących

Narzędzie Kimi Code CLI otrzymało aktualizację 1.49.0, która została udostępniona użytkownikom 16 lipca 2026 roku. W tej wersji skupiono się na rozwiązaniu problemu przepełniania okna kontekstowego podczas długich sesji programistycznych. CLI wprowadza mechanizm dynamicznego budżetowania tokenów, który dostosowuje limity do dostępnego miejsca w kontekście modelu. Dodatkowo, zaktualizowano sposób komunikacji z modelami myślącymi oraz wprowadzono nową zmienną środowiskową, dając zespołom większą kontrolę nad limitami wyjściowymi.

Kluczowe zmiany w skrócie

  • Dynamiczny budżet tokenów – CLI oblicza dostępny limit wyjściowy na podstawie pozostałego okna kontekstowego, zamiast wysyłać stałą wartość, która może przekroczyć pojemność modelu.
  • Nowa zmienna KIMI_MODEL_MAX_COMPLETION_TOKENS – pozwala ustalić twardy limit generowanych tokenów, który jest dynamicznie przycinany do bezpiecznego poziomu.
  • Ujednolicenie parametrów modeli myślących – zmiana z przestarzałego reasoning_effort na thinking.type, bez automatycznego dodawania starego parametru.
  • Zachowanie pustej treści rozumowania – puste reasoning_content jest teraz przechowywane w historii wiadomości, co ma znaczenie dla wieloetapowych konwersacji.

Dlaczego przepełnienie kontekstu to realny problem

Podczas pracy z Kimi Code CLI nad większym projektem, kontekst rozmowy szybko się powiększa. Pliki źródłowe, wyniki testów, komunikaty z shella i wcześniejsze odpowiedzi modelu zajmują miejsce w oknie kontekstowym. Modele Kimi mają swoje limity: K3 obsługuje do 1 048 576 tokenów, natomiast K2.7 Code i K2.6 zatrzymują się na 262 144 tokenach.

Stały limit wyjściowy, który działał na początku sesji, po kilkudziesięciu interakcjach może stać się nierealny. CLI wysyłało go w żądaniu, API odrzucało, a sesja się kończyła błędem. Dynamiczny budżet rozwiązuje ten problem – przed każdym zapytaniem narzędzie sprawdza, ile miejsca zostało i odpowiednio przycina maksymalną liczbę tokenów do wygenerowania.

Jak skonfigurować nową zmienną środowiskową

Jak skonfigurować nową zmienną środowiskową

Zmienna KIMI_MODEL_MAX_COMPLETION_TOKENS pozwala na ograniczenie długości odpowiedzi. Wartość taka jak 4096 sprawdza się w przypadku krótkich edycji kodu, diagnostyki czy wyjaśniania poleceń.

Nawet gdy ustawisz tę zmienną, CLI nie wyśle wartości wyższej niż różnica między maksymalnym rozmiarem okna a tokenami już zajętymi przez wejście. To zabezpieczenie przed przypadkowym przekroczeniem limitu.

Dotychczasowa zmienna KIMI_MODEL_MAX_TOKENS nadal działa, ale nowa ma pierwszeństwo, gdy obie są zdefiniowane. Jeśli chcesz całkowicie wyłączyć przycinanie, ustaw którąkolwiek z nich na 0 lub na wartość ujemną.

Modele myślące bez starego balastu

Modele myślące bez starego balastu

Kolejna istotna zmiana dotyczy modeli myślących. Wcześniej Kimi Code CLI automatycznie dodawał do żądań parametr reasoning_effort, gdy tryb myślenia był aktywny. Teraz używa thinking.type, zgodnie z aktualnym standardem API Kimi.

To oznacza, że starsze endpointy kompatybilne z Kimi mogą wymagać jawnego przekazania reasoning_effort przez opcje generowania. Jeśli integrujesz CLI z proxy lub własnym endpointem, warto to sprawdzić przed aktualizacją.

Zmienił się również sposób przechowywania konfiguracji myślenia – stan domyślny trafia teraz do ~/.kimi/config.toml jako default_thinking, a wcześniejszy plik ~/.kimi/kimi.json nie jest już automatycznie odczytywany.

Operacyjny charakter wydania

Wersja 1.49.0 nie wprowadza nowego modelu ani spektakularnych funkcji. To aktualizacja, która poprawia niezawodność narzędzia, co sprawia, że mniej przeszkadza podczas pracy. Długie sesje DevOps, debugowanie rozległych baz kodu czy wieloetapowe refaktoryzacje rzadziej kończą się błędem przepełnienia kontekstu.

Deweloperzy mogą teraz decydować o maksymalnej długości odpowiedzi, co pozwala na lepsze zarządzanie kosztami, opóźnieniami i bezpieczeństwem kontekstu. Zespoły korzystające z modeli myślących zyskują czystszy interfejs konfiguracji, bez problemów związanych z przestarzałymi parametrami.


Źródła

Komentarze

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *