> ## Documentation Index
> Fetch the complete documentation index at: https://docs.agno.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Semantic Chunking

> Group sentences into chunks using embedding similarity and configurable boundary controls.

`SemanticChunking` wraps Chonkie's semantic chunker and groups sentences using embedding similarity. See [Chonkie Semantic Chunker](https://docs.chonkie.ai/oss/chunkers/semantic-chunker).

<Steps>
  <Step title="Create a Python file">
    Save one of these variants as `semantic_chunking.py`:

    <CodeGroup>
      ```python Agno Embedder theme={null}
      from agno.agent import Agent
      from agno.knowledge.chunking.semantic import SemanticChunking
      from agno.knowledge.embedder.openai import OpenAIEmbedder
      from agno.knowledge.knowledge import Knowledge
      from agno.knowledge.reader.pdf_reader import PDFReader
      from agno.vectordb.pgvector import PgVector

      db_url = "postgresql+psycopg://ai:ai@localhost:5532/ai"

      embedder = OpenAIEmbedder(id="text-embedding-3-small")

      knowledge = Knowledge(
          vector_db=PgVector(
              table_name="recipes_semantic_chunking", db_url=db_url, embedder=embedder
          ),
      )
      knowledge.insert(
          url="https://agno-public.s3.amazonaws.com/recipes/ThaiRecipes.pdf",
          reader=PDFReader(
              name="Semantic Chunking Reader",
              split_on_pages=False,
              chunking_strategy=SemanticChunking(
                  embedder=embedder,
                  chunk_size=500,
              ),
          ),
      )

      agent = Agent(
          knowledge=knowledge,
          search_knowledge=True,
      )

      agent.print_response("How do I make Thai curry?", markdown=True)
      ```

      ```python Chonkie Embedder theme={null}
      from agno.agent import Agent
      from agno.knowledge.chunking.semantic import SemanticChunking
      from agno.knowledge.embedder.openai import OpenAIEmbedder
      from agno.knowledge.knowledge import Knowledge
      from agno.knowledge.reader.pdf_reader import PDFReader
      from agno.vectordb.pgvector import PgVector
      from chonkie.embeddings import Model2VecEmbeddings

      db_url = "postgresql+psycopg://ai:ai@localhost:5532/ai"

      agno_embedder = OpenAIEmbedder(id="text-embedding-3-small")
      chonkie_embedder = Model2VecEmbeddings(model="minishlab/potion-base-32M")

      knowledge = Knowledge(
          vector_db=PgVector(
              table_name="recipes_semantic_chunking", db_url=db_url, embedder=agno_embedder
          ),
      )
      knowledge.insert(
          url="https://agno-public.s3.amazonaws.com/recipes/ThaiRecipes.pdf",
          reader=PDFReader(
              name="Semantic Chunking Reader",
              split_on_pages=False,
              chunking_strategy=SemanticChunking(
                  embedder=chonkie_embedder,
                  chunk_size=500,
              ),
          ),
      )

      agent = Agent(
          knowledge=knowledge,
          search_knowledge=True,
      )

      agent.print_response("How do I make Thai curry?", markdown=True)
      ```

      ```python String Model ID theme={null}
      from agno.agent import Agent
      from agno.knowledge.chunking.semantic import SemanticChunking
      from agno.knowledge.embedder.openai import OpenAIEmbedder
      from agno.knowledge.knowledge import Knowledge
      from agno.knowledge.reader.pdf_reader import PDFReader
      from agno.vectordb.pgvector import PgVector

      db_url = "postgresql+psycopg://ai:ai@localhost:5532/ai"

      agno_embedder = OpenAIEmbedder(id="text-embedding-3-small")

      knowledge = Knowledge(
          vector_db=PgVector(
              table_name="recipes_semantic_chunking", db_url=db_url, embedder=agno_embedder
          ),
      )
      knowledge.insert(
          url="https://agno-public.s3.amazonaws.com/recipes/ThaiRecipes.pdf",
          reader=PDFReader(
              name="Semantic Chunking Reader",
              split_on_pages=False,
              chunking_strategy=SemanticChunking(
                  embedder="minishlab/potion-base-32M",
                  chunk_size=500,
              ),
          ),
      )

      agent = Agent(
          knowledge=knowledge,
          search_knowledge=True,
      )

      agent.print_response("How do I make Thai curry?", markdown=True)
      ```
    </CodeGroup>
  </Step>

  <Snippet file="create-venv-step.mdx" />

  <Step title="Install dependencies">
    ```bash theme={null}
    uv pip install -U agno "chonkie[semantic]" openai pgvector psycopg pypdf sqlalchemy
    ```
  </Step>

  <Step title="Export your OpenAI API key">
    <Snippet file="set-openai-key.mdx" />
  </Step>

  <Snippet file="run-pgvector-step.mdx" />

  <Step title="Run the script">
    ```bash theme={null}
    python semantic_chunking.py
    ```
  </Step>
</Steps>

The example sets `split_on_pages=False` so `PDFReader` combines the pages before applying `SemanticChunking`. Keep the default value of `True` to chunk each page independently.

## Choose an Embedder

The `embedder` parameter accepts an Agno `Embedder`, a Chonkie `BaseEmbeddings` instance, or a string model identifier resolved by Chonkie. See [Chonkie Embeddings](https://docs.chonkie.ai/oss/embeddings/overview).

| Embedder Value           | Chunk Size Measurement                        |
| ------------------------ | --------------------------------------------- |
| Agno `Embedder`          | Whitespace-separated words                    |
| Chonkie `BaseEmbeddings` | Tokens from the embedder's tokenizer          |
| String model identifier  | Tokens from the tokenizer selected by Chonkie |

## Semantic Chunking Params

<Snippet file="chunking-semantic.mdx" />

## Developer Resources

* [Chunking overview](/knowledge/concepts/chunking/overview)
* [Chunking strategies examples](/examples/knowledge/building-blocks/chunking-strategies)
* [PDF reader](/knowledge/concepts/readers/pdf-reader)
