Knowledge Chunker¶
Cluster: Uncategorised | Type: component | MCP Tools: None
Overview¶
Public API¶
Passage¶
| Field | Type | Default |
|---|---|---|
chunk_id | str | required |
text | str | required |
domain | str | required |
source_url | str | required |
page_num | Optional[int] | required |
timestamp_start | Optional[float] | required |
timestamp_end | Optional[float] | required |
frame_idx | Optional[int] | required |
token_count | int | required |
Functions¶
chunk_text(text: str, source_url: str, domain: str, chunk_size: int = 256, stride: int = 32, page_num: Optional[int] = None, timestamp_start: Optional[float] = None, timestamp_end: Optional[float] = None, frame_idx: Optional[int] = None, manifest_db: Optional['ManifestDB'] = None) -> list[Passage]¶
Split text into overlapping token chunks with paragraph-boundary awareness.