OpenXML (Office) format (.docx, .docm, .dotx, .dotm, .xlsx, .xlsm, .xltx, .xltm, .pptx, .pptm, .ppsx, .potx)
The OpenXML format handles Microsoft Office Open XML documents: Word
(.docx), Excel (.xlsx), and PowerPoint (.pptx). All three share a
ZIP-and-XML package, so one filter serves them and auto-detects the
variant from the package contents, per ECMA-376 / ISO/IEC 29500.
Extraction is selective: by default the reader pulls the main body text plus the parts that are normally user-visible (document properties, headers and footers, footnotes, comments, and hyperlink text in Word; shared strings in Excel; and speaker notes in PowerPoint) while leaving hidden, structural, or rarely translated content out unless you opt in. A set of style and colour filters lets you include or exclude runs by paragraph/character style or highlight colour. This mirrors Okapi's OpenXML filter, including its default of accepting tracked changes before extraction.
Parameters
| Parameter | Type | Default | Description |
|---|---|---|---|
aggressiveCleanup | boolean | true | Fjern revisjons-ID-er, korrekturleserfeil og annet støy før sammenslåing av kjøringer. |
automaticallyAcceptRevisions | boolean | true | Aksepter automatisk sporede endringer før uttrekking. Når sann (standard, tilsvarer Okapi), beholdes innsatte kjøringer og slettede kjøringer fjernes; rader merket med <w:trPr><w:del/> (ECMA-376 §17.13.5.13) fjernes helt; rader merket med <w:trPr><w:ins/> (§17.13.5.16) beholdes. |
codeFinderRules | array | Regex-mønstre som samsvarer med innebygde koder i oversettbar tekst. | |
complexFieldDefinitionsToExtract | array | Feltinstruksprefikser som skal trekkes ut (f.eks. «HYPERLINK», «REF»). | |
excludeColors | array | Skriftfarger som skal utelates (hex RGB, f.eks. "FF0000" for rød). | |
excludedColumns | array | Kolonnebokstaver som skal utelates (f.eks. «A», «C», «AA»). | |
excludedSheets | array | Arknavn som skal utelates fra uttrekk. | |
excludeHighlightColors | array | Uthevingsfarger som skal ekskluderes (f.eks. «yellow», «red»). | |
excludeStyles | array | Avsnitt-/tegnstilnavn som skal utelates. | |
extractNonTranslatableContent | boolean | true | Hvis sann (standard), vises ikke-oversettbart kontekstuelt innhold — bilde-/form-alt-tekst (descr/title på docPr/cNvPr) som innholdsblokker (synlig for inntak/LLM-konsumenter, hoppes over av maskinoversettelse), og PowerPoint/Excel-kommentartekst som datadeler — i stedet for å bli skjult i ugjennomsiktig skjelett. Deaktiver for å holde det ugjennomsiktig. |
extractRunFontsInfo | boolean | false | Emit skriftmetadata som merknader på blokker. |
fontMappings | object | Tilordning av fontnavn til skriptgruppe (f.eks. "MS Gothic": "ja"). | |
ignoreSoftHyphenTag | boolean | false | Ignorer myke bindestrek-tagger i dokumentet. |
includedSlides | array | Hvis ikke-tom, hent bare disse lysbilde-numrene (1-basert). | |
includeHighlightColors | array | Hvis ikke tom, trekk bare ut tekst med disse uthevingsfargene. | |
includeStyles | array | Hvis ikke tom, hentes kun tekst med disse stilene. | |
lineSeparatorReplacement | string | Erstatningsstreng for linjeskillertegn. | |
replaceLineSeparator | boolean | false | Erstatt Unicode-linjeskiller (U+2028) i utdata. |
replaceNoBreakHyphenTag | boolean | false | Erstatt ikke-brytende bindestrek-tagger med det ikke-brytende bindestrek-tegnet. |
tabAsCharacter | boolean | false | Behandle tabulatorelementer som tabulatortegn i stedet for plassholderspenn. |
translateCharts | boolean | false | Trekk ut strenger fra innebygde diagrammer. |
translateComments | boolean | false | Trekk ut kommentartekst fra Word-dokumenter. |
translateDiagrams | boolean | false | Trekk ut tekst fra SmartArt-diagrammer. |
translateDocProperties | boolean | true | Hent ut tittel, emne og nøkkelord fra dokumentegenskaper. |
translateFootnotes | boolean | true | Hent ut fotnoter og sluttnoter fra Word-dokumenter. |
translateHeadersFooters | boolean | true | Trekk ut tekst fra topp- og bunntekster i Word-dokumenter. |
translateHiddenSlides | boolean | false | Hent innhold fra skjulte lysbilder i PowerPoint. |
translateHiddenText | boolean | false | Trekk ut tekst med vanish-egenskapen (skjult) i Word-dokumenter. |
translateHyperlinks | boolean | true | Hent ut hyperkoblingtekst for oversettelse. |
translateSharedStrings | boolean | true | Hent ut delte strenger fra Excel-arbeidsbøker. |
translateSheetNames | boolean | false | Hent ut arknavn i Excel-arbeidsbøker. |
translateSlideMasters | boolean | false | Trekk ut tekst fra lysbildemaler i PowerPoint. |
translateSlideNotes | boolean | true | Hent ut foredragsholdernotater i PowerPoint-presentasjoner. |
useCodeFinder | boolean | false | Aktiver mønsterbasert deteksjon av innebygde koder (plassholdere, tagger osv.). |
Configure it live
Examples
Translate everything in a Word document
Include comments, hidden text, and slide masters that are off by default.
translateHiddenText: true
translateComments: true
Limit an Excel workbook to selected sheets
Skip data and lookup sheets during extraction.
excludedSheets:
- Data
- Lookups
Extract only specific PowerPoint slides
Translate slides 1, 2, and 5 and skip the rest.
includedSlides:
- 1
- 2
- 5
Processing notes
The document variant (Word / Excel / PowerPoint) is auto-detected from the package contents.
The writer is faithful by default, preserving source run properties inline rather than rewriting them into synthesised styles.
Limitations
One filter covers Word, Excel, and PowerPoint; some options apply only to the relevant variant (for example, the slide options affect PowerPoint only).
← Back to the Format Reference