Gå til hovedinnhold

OpenXML (Office) format (.docx, .docm, .dotx, .dotm, .xlsx, .xlsm, .xltx, .xltm, .pptx, .pptm, .ppsx, .potx)

The OpenXML format handles Microsoft Office Open XML documents: Word (.docx), Excel (.xlsx), and PowerPoint (.pptx). All three share a ZIP-and-XML package, so one filter serves them and auto-detects the variant from the package contents, per ECMA-376 / ISO/IEC 29500.

Extraction is selective: by default the reader pulls the main body text plus the parts that are normally user-visible (document properties, headers and footers, footnotes, comments, and hyperlink text in Word; shared strings in Excel; and speaker notes in PowerPoint) while leaving hidden, structural, or rarely translated content out unless you opt in. A set of style and colour filters lets you include or exclude runs by paragraph/character style or highlight colour. This mirrors Okapi's OpenXML filter, including its default of accepting tracked changes before extraction.

IDopenxml
SourceBuilt-in
Extensions.docx, .docm, .dotx, .dotm, .xlsx, .xlsm, .xltx, .xltm, .pptx, .pptm, .ppsx, .potx
MIME Typesapplication/vnd.openxmlformats-officedocument.wordprocessingml.document, application/vnd.openxmlformats-officedocument.presentationml.presentation, application/vnd.openxmlformats-officedocument.spreadsheetml.sheet
CapabilitiesRead + Write

Parameters

ParameterTypeDefaultDescription
aggressiveCleanupbooleantrueFjern revisjons-ID-er, korrekturleserfeil og annet støy før sammenslåing av kjøringer.
automaticallyAcceptRevisionsbooleantrueAksepter automatisk sporede endringer før uttrekking. Når sann (standard, tilsvarer Okapi), beholdes innsatte kjøringer og slettede kjøringer fjernes; rader merket med <w:trPr><w:del/> (ECMA-376 §17.13.5.13) fjernes helt; rader merket med <w:trPr><w:ins/> (§17.13.5.16) beholdes.
codeFinderRulesarrayRegex-mønstre som samsvarer med innebygde koder i oversettbar tekst.
complexFieldDefinitionsToExtractarrayFeltinstruksprefikser som skal trekkes ut (f.eks. «HYPERLINK», «REF»).
excludeColorsarraySkriftfarger som skal utelates (hex RGB, f.eks. "FF0000" for rød).
excludedColumnsarrayKolonnebokstaver som skal utelates (f.eks. «A», «C», «AA»).
excludedSheetsarrayArknavn som skal utelates fra uttrekk.
excludeHighlightColorsarrayUthevingsfarger som skal ekskluderes (f.eks. «yellow», «red»).
excludeStylesarrayAvsnitt-/tegnstilnavn som skal utelates.
extractNonTranslatableContentbooleantrueHvis sann (standard), vises ikke-oversettbart kontekstuelt innhold — bilde-/form-alt-tekst (descr/title på docPr/cNvPr) som innholdsblokker (synlig for inntak/LLM-konsumenter, hoppes over av maskinoversettelse), og PowerPoint/Excel-kommentartekst som datadeler — i stedet for å bli skjult i ugjennomsiktig skjelett. Deaktiver for å holde det ugjennomsiktig.
extractRunFontsInfobooleanfalseEmit skriftmetadata som merknader på blokker.
fontMappingsobjectTilordning av fontnavn til skriptgruppe (f.eks. "MS Gothic": "ja").
ignoreSoftHyphenTagbooleanfalseIgnorer myke bindestrek-tagger i dokumentet.
includedSlidesarrayHvis ikke-tom, hent bare disse lysbilde-numrene (1-basert).
includeHighlightColorsarrayHvis ikke tom, trekk bare ut tekst med disse uthevingsfargene.
includeStylesarrayHvis ikke tom, hentes kun tekst med disse stilene.
lineSeparatorReplacementstring Erstatningsstreng for linjeskillertegn.
replaceLineSeparatorbooleanfalseErstatt Unicode-linjeskiller (U+2028) i utdata.
replaceNoBreakHyphenTagbooleanfalseErstatt ikke-brytende bindestrek-tagger med det ikke-brytende bindestrek-tegnet.
tabAsCharacterbooleanfalseBehandle tabulatorelementer som tabulatortegn i stedet for plassholderspenn.
translateChartsbooleanfalseTrekk ut strenger fra innebygde diagrammer.
translateCommentsbooleanfalseTrekk ut kommentartekst fra Word-dokumenter.
translateDiagramsbooleanfalseTrekk ut tekst fra SmartArt-diagrammer.
translateDocPropertiesbooleantrueHent ut tittel, emne og nøkkelord fra dokumentegenskaper.
translateFootnotesbooleantrueHent ut fotnoter og sluttnoter fra Word-dokumenter.
translateHeadersFootersbooleantrueTrekk ut tekst fra topp- og bunntekster i Word-dokumenter.
translateHiddenSlidesbooleanfalseHent innhold fra skjulte lysbilder i PowerPoint.
translateHiddenTextbooleanfalseTrekk ut tekst med vanish-egenskapen (skjult) i Word-dokumenter.
translateHyperlinksbooleantrueHent ut hyperkoblingtekst for oversettelse.
translateSharedStringsbooleantrueHent ut delte strenger fra Excel-arbeidsbøker.
translateSheetNamesbooleanfalseHent ut arknavn i Excel-arbeidsbøker.
translateSlideMastersbooleanfalseTrekk ut tekst fra lysbildemaler i PowerPoint.
translateSlideNotesbooleantrueHent ut foredragsholdernotater i PowerPoint-presentasjoner.
useCodeFinderbooleanfalseAktiver mønsterbasert deteksjon av innebygde koder (plassholdere, tagger osv.).

Configure it live

Configuration
Loading form…

Examples

Translate everything in a Word document

Include comments, hidden text, and slide masters that are off by default.

translateHiddenText: true
translateComments: true

Limit an Excel workbook to selected sheets

Skip data and lookup sheets during extraction.

excludedSheets:
- Data
- Lookups

Extract only specific PowerPoint slides

Translate slides 1, 2, and 5 and skip the rest.

includedSlides:
- 1
- 2
- 5

Processing notes

  • The document variant (Word / Excel / PowerPoint) is auto-detected from the package contents.

  • The writer is faithful by default, preserving source run properties inline rather than rewriting them into synthesised styles.

Limitations

  • One filter covers Word, Excel, and PowerPoint; some options apply only to the relevant variant (for example, the slide options affect PowerPoint only).

← Back to the Format Reference