Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
12 changes: 4 additions & 8 deletions tensorrt_llm/_torch/disaggregation/transceiver.py
Original file line number Diff line number Diff line change
Expand Up @@ -173,12 +173,7 @@ def __enter__(self):
def __exit__(self, _exc_type, _exc_val, _exc_tb):
self.shutdown()

def _create_kv_slice(
self,
req: LlmRequest,
token_range: Optional[TokenRange] = None,
is_last_slice: bool = True,
) -> KVSlice:
def _create_kv_slice(self, req: LlmRequest) -> KVSlice:
adapter = self._reuse_adapter
tpb = adapter.tokens_per_block
assert self._page_table is not None
Expand All @@ -191,7 +186,8 @@ def _create_kv_slice(
else [0] * len(layer_groups)
)

if token_range is None and req.prompt_len > 0:
token_range = None
if req.prompt_len > 0:
# Align with KV cache allocation (prepare_disagg_gen_init /
# _get_context_bytes), which reserves prompt_len +
# num_extra_kv_tokens slots for speculative decoding methods
Expand Down Expand Up @@ -242,7 +238,7 @@ def _create_kv_slice(
mamba_state_index = self._kv_cache_manager.mamba_cache_index[req.py_request_id]

return KVSlice(
is_last_slice=is_last_slice,
is_last_slice=True,
block_ids_per_layer_groups=groups,
mamba_state_index=mamba_state_index,
token_range=token_range,
Expand Down
11 changes: 0 additions & 11 deletions tests/unittest/disaggregated/test_cache_reuse_adapter.py
Original file line number Diff line number Diff line change
Expand Up @@ -342,17 +342,6 @@ def test_defaults_to_prompt_len_when_no_extra(self):
assert kv_slice.token_range is not None
assert (kv_slice.token_range.start, kv_slice.token_range.end) == (0, prompt_len)

def test_respects_explicit_token_range(self):
prompt_len = 17
transceiver, req = _build_transceiver_for_kv_slice(
num_extra_kv_tokens=7, prompt_len=prompt_len
)
explicit = TokenRange(start=0, end=8)

kv_slice = transceiver._create_kv_slice(req, token_range=explicit)

assert kv_slice.token_range is explicit


# ---------------------------------------------------------------------------
# CacheReuseAdapter.get_cached_token_count_per_layer_group: SWA clamp.
Expand Down
Loading