> For the complete documentation index, see [llms.txt](https://altero.gitbook.io/langchain-book-by-altero/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://altero.gitbook.io/langchain-book-by-altero/ch06-document-loader/06.-word.md).

# 06. Word

## Microsoft Word

[Microsoft Word](https://www.microsoft.com/en-us/microsoft-365/word) adalah pengolah kata yang dikembangkan oleh Microsoft.

Bagian ini membahas cara memuat dokumen `word` ke dalam format dokumen yang dapat digunakan di bagian hilir.

## Docx2txtLoader <a href="#docx2txtloader" id="docx2txtloader"></a>

***

Anda dapat menggunakan `Docx2txt` untuk memuat file .docx sebagai dokumen.

```python
# install
# !pip install -qU docx2txt
```

```python
from langchain_community.document_loaders import Docx2txtLoader

loader = Docx2txtLoader("./data/sample-word-document.docx")  # Inisialisasi pemuat dokumen

docs = loader.load()  # Memuat dokumen

print(len(docs))
```

## UnstructuredWordDocumentLoader

***

```python
from langchain_community.document_loaders import UnstructuredWordDocumentLoader

# Menginstalasi pemuat dokumen Word yang tidak terstruktur
loader = UnstructuredWordDocumentLoader("./data/sample-word-document.docx")

# Memuat dokumen
docs = loader.load()

print(len(docs))
```

Hasilnya dimuat sebagai satu Dokumen.

```python
# Output metadata
print(docs[0].metadata)
```

Secara internal, unstructured menciptakan **"elemen"** yang berbeda untuk setiap potongan teks.

Secara default, semua ini digabungkan bersama, tetapi dapat dengan mudah dipisahkan dengan menentukan `mode="elements"`.

```python
# UnstructuredWordDocumentLoader
loader = UnstructuredWordDocumentLoader(
    "./data/sample-word-document.docx", mode="elements"
)

# Memuat data
docs = loader.load()

# Menampilkan jumlah dokumen yang dimuat
print(len(docs))
```

```python
# Cetak isi dokumen pertama
print(docs[0].page_content)
```

```python
# Cetak isi dokumen pertama
docs[0].metadata
```
