> For the complete documentation index, see [llms.txt](https://boinc-ai.gitbook.io/transformers/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://boinc-ai.gitbook.io/transformers/api/main-classes/auto-classes/natural-language-processing/automodelformaskedlm.md).

# AutoModelForMaskedLM

#### AutoModelForMaskedLM

#### class transformers.AutoModelForMaskedLM

[\<source>](https://github.com/huggingface/transformers/blob/v4.34.1/src/transformers/models/auto/modeling_auto.py#L1253)

( \*args\*\*kwargs )

This is a generic model class that will be instantiated as one of the model classes of the library (with a masked language modeling head) when created with the [from\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/auto#transformers.FlaxAutoModelForVision2Seq.from_pretrained) class method or the [from\_config()](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/auto#transformers.FlaxAutoModelForVision2Seq.from_config) class method.

This class cannot be instantiated directly using `__init__()` (throws an error).

**from\_config**

[\<source>](https://github.com/huggingface/transformers/blob/v4.34.1/src/transformers/models/auto/auto_factory.py#L417)

( \*\*kwargs )

Parameters

* **config** ([PretrainedConfig](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/configuration#transformers.PretrainedConfig)) — The model class to instantiate is selected based on the configuration class:
  * [AlbertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/albert#transformers.AlbertConfig) configuration class: [AlbertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/albert#transformers.AlbertForMaskedLM) (ALBERT model)
  * [BartConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/bart#transformers.BartConfig) configuration class: [BartForConditionalGeneration](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/bart#transformers.BartForConditionalGeneration) (BART model)
  * [BertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/bert#transformers.BertConfig) configuration class: [BertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/bert#transformers.BertForMaskedLM) (BERT model)
  * [BigBirdConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/big_bird#transformers.BigBirdConfig) configuration class: [BigBirdForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/big_bird#transformers.BigBirdForMaskedLM) (BigBird model)
  * [CamembertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/camembert#transformers.CamembertConfig) configuration class: [CamembertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/camembert#transformers.CamembertForMaskedLM) (CamemBERT model)
  * [ConvBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/convbert#transformers.ConvBertConfig) configuration class: [ConvBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/convbert#transformers.ConvBertForMaskedLM) (ConvBERT model)
  * [Data2VecTextConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/data2vec#transformers.Data2VecTextConfig) configuration class: [Data2VecTextForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/data2vec#transformers.Data2VecTextForMaskedLM) (Data2VecText model)
  * [DebertaConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/deberta#transformers.DebertaConfig) configuration class: [DebertaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/deberta#transformers.DebertaForMaskedLM) (DeBERTa model)
  * [DebertaV2Config](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/deberta-v2#transformers.DebertaV2Config) configuration class: [DebertaV2ForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/deberta-v2#transformers.DebertaV2ForMaskedLM) (DeBERTa-v2 model)
  * [DistilBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/distilbert#transformers.DistilBertConfig) configuration class: [DistilBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/distilbert#transformers.DistilBertForMaskedLM) (DistilBERT model)
  * [ElectraConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/electra#transformers.ElectraConfig) configuration class: [ElectraForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/electra#transformers.ElectraForMaskedLM) (ELECTRA model)
  * [ErnieConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/ernie#transformers.ErnieConfig) configuration class: [ErnieForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/ernie#transformers.ErnieForMaskedLM) (ERNIE model)
  * [EsmConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/esm#transformers.EsmConfig) configuration class: [EsmForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/esm#transformers.EsmForMaskedLM) (ESM model)
  * [FNetConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/fnet#transformers.FNetConfig) configuration class: [FNetForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/fnet#transformers.FNetForMaskedLM) (FNet model)
  * [FlaubertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/flaubert#transformers.FlaubertConfig) configuration class: [FlaubertWithLMHeadModel](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/flaubert#transformers.FlaubertWithLMHeadModel) (FlauBERT model)
  * [FunnelConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/funnel#transformers.FunnelConfig) configuration class: [FunnelForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/funnel#transformers.FunnelForMaskedLM) (Funnel Transformer model)
  * [IBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/ibert#transformers.IBertConfig) configuration class: [IBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/ibert#transformers.IBertForMaskedLM) (I-BERT model)
  * [LayoutLMConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/layoutlm#transformers.LayoutLMConfig) configuration class: [LayoutLMForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/layoutlm#transformers.LayoutLMForMaskedLM) (LayoutLM model)
  * [LongformerConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/longformer#transformers.LongformerConfig) configuration class: [LongformerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/longformer#transformers.LongformerForMaskedLM) (Longformer model)
  * [LukeConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/luke#transformers.LukeConfig) configuration class: [LukeForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/luke#transformers.LukeForMaskedLM) (LUKE model)
  * [MBartConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mbart#transformers.MBartConfig) configuration class: [MBartForConditionalGeneration](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mbart#transformers.MBartForConditionalGeneration) (mBART model)
  * [MPNetConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mpnet#transformers.MPNetConfig) configuration class: [MPNetForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mpnet#transformers.MPNetForMaskedLM) (MPNet model)
  * [MegaConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mega#transformers.MegaConfig) configuration class: [MegaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mega#transformers.MegaForMaskedLM) (MEGA model)
  * [MegatronBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/megatron-bert#transformers.MegatronBertConfig) configuration class: [MegatronBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/megatron-bert#transformers.MegatronBertForMaskedLM) (Megatron-BERT model)
  * [MobileBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mobilebert#transformers.MobileBertConfig) configuration class: [MobileBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mobilebert#transformers.MobileBertForMaskedLM) (MobileBERT model)
  * [MraConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mra#transformers.MraConfig) configuration class: [MraForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mra#transformers.MraForMaskedLM) (MRA model)
  * [MvpConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mvp#transformers.MvpConfig) configuration class: [MvpForConditionalGeneration](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mvp#transformers.MvpForConditionalGeneration) (MVP model)
  * [NezhaConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/nezha#transformers.NezhaConfig) configuration class: [NezhaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/nezha#transformers.NezhaForMaskedLM) (Nezha model)
  * [NystromformerConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/nystromformer#transformers.NystromformerConfig) configuration class: [NystromformerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/nystromformer#transformers.NystromformerForMaskedLM) (Nyströmformer model)
  * [PerceiverConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/perceiver#transformers.PerceiverConfig) configuration class: [PerceiverForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/perceiver#transformers.PerceiverForMaskedLM) (Perceiver model)
  * [QDQBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/qdqbert#transformers.QDQBertConfig) configuration class: [QDQBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/qdqbert#transformers.QDQBertForMaskedLM) (QDQBert model)
  * [ReformerConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/reformer#transformers.ReformerConfig) configuration class: [ReformerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/reformer#transformers.ReformerForMaskedLM) (Reformer model)
  * [RemBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/rembert#transformers.RemBertConfig) configuration class: [RemBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/rembert#transformers.RemBertForMaskedLM) (RemBERT model)
  * [RoCBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roc_bert#transformers.RoCBertConfig) configuration class: [RoCBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roc_bert#transformers.RoCBertForMaskedLM) (RoCBert model)
  * [RoFormerConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roformer#transformers.RoFormerConfig) configuration class: [RoFormerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roformer#transformers.RoFormerForMaskedLM) (RoFormer model)
  * [RobertaConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roberta#transformers.RobertaConfig) configuration class: [RobertaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roberta#transformers.RobertaForMaskedLM) (RoBERTa model)
  * [RobertaPreLayerNormConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roberta-prelayernorm#transformers.RobertaPreLayerNormConfig) configuration class: [RobertaPreLayerNormForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roberta-prelayernorm#transformers.RobertaPreLayerNormForMaskedLM) (RoBERTa-PreLayerNorm model)
  * [SqueezeBertConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/squeezebert#transformers.SqueezeBertConfig) configuration class: [SqueezeBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/squeezebert#transformers.SqueezeBertForMaskedLM) (SqueezeBERT model)
  * [TapasConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/tapas#transformers.TapasConfig) configuration class: [TapasForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/tapas#transformers.TapasForMaskedLM) (TAPAS model)
  * [Wav2Vec2Config](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/wav2vec2#transformers.Wav2Vec2Config) configuration class: `Wav2Vec2ForMaskedLM` (Wav2Vec2 model)
  * [XLMConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm#transformers.XLMConfig) configuration class: [XLMWithLMHeadModel](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm#transformers.XLMWithLMHeadModel) (XLM model)
  * [XLMRobertaConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm-roberta#transformers.XLMRobertaConfig) configuration class: [XLMRobertaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm-roberta#transformers.XLMRobertaForMaskedLM) (XLM-RoBERTa model)
  * [XLMRobertaXLConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm-roberta-xl#transformers.XLMRobertaXLConfig) configuration class: [XLMRobertaXLForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm-roberta-xl#transformers.XLMRobertaXLForMaskedLM) (XLM-RoBERTa-XL model)
  * [XmodConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xmod#transformers.XmodConfig) configuration class: [XmodForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xmod#transformers.XmodForMaskedLM) (X-MOD model)
  * [YosoConfig](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/yoso#transformers.YosoConfig) configuration class: [YosoForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/yoso#transformers.YosoForMaskedLM) (YOSO model)

Instantiates one of the model classes of the library (with a masked language modeling head) from a configuration.

Note: Loading a model from its configuration file does **not** load the model weights. It only affects the model’s configuration. Use [from\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/auto#transformers.FlaxAutoModelForVision2Seq.from_pretrained) to load the model weights.

Examples:

Copied

```
>>> from transformers import AutoConfig, AutoModelForMaskedLM

>>> # Download configuration from huggingface.co and cache.
>>> config = AutoConfig.from_pretrained("bert-base-cased")
>>> model = AutoModelForMaskedLM.from_config(config)
```

**from\_pretrained**

[\<source>](https://github.com/huggingface/transformers/blob/v4.34.1/src/transformers/models/auto/auto_factory.py#L448)

( \*model\_args\*\*kwargs )

Parameters

* **pretrained\_model\_name\_or\_path** (`str` or `os.PathLike`) — Can be either:
  * A string, the *model id* of a pretrained model hosted inside a model repo on huggingface.co. Valid model ids can be located at the root-level, like `bert-base-uncased`, or namespaced under a user or organization name, like `dbmdz/bert-base-german-cased`.
  * A path to a *directory* containing model weights saved using [save\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/model#transformers.PreTrainedModel.save_pretrained), e.g., `./my_model_directory/`.
  * A path or url to a *tensorflow index checkpoint file* (e.g, `./tf_model/model.ckpt.index`). In this case, `from_tf` should be set to `True` and a configuration object should be provided as `config` argument. This loading path is slower than converting the TensorFlow checkpoint in a PyTorch model using the provided conversion scripts and loading the PyTorch model afterwards.
* **model\_args** (additional positional arguments, *optional*) — Will be passed along to the underlying model `__init__()` method.
* **config** ([PretrainedConfig](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/configuration#transformers.PretrainedConfig), *optional*) — Configuration for the model to use instead of an automatically loaded configuration. Configuration can be automatically loaded when:
  * The model is a model provided by the library (loaded with the *model id* string of a pretrained model).
  * The model was saved using [save\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/model#transformers.PreTrainedModel.save_pretrained) and is reloaded by supplying the save directory.
  * The model is loaded by supplying a local directory as `pretrained_model_name_or_path` and a configuration JSON file named *config.json* is found in the directory.
* **state\_dict** (*Dict\[str, torch.Tensor]*, *optional*) — A state dictionary to use instead of a state dictionary loaded from saved weights file.

  This option can be used if you want to create a model from a pretrained configuration but load your own weights. In this case though, you should check if using [save\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/model#transformers.PreTrainedModel.save_pretrained) and [from\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/model#transformers.PreTrainedModel.from_pretrained) is not a simpler option.
* **cache\_dir** (`str` or `os.PathLike`, *optional*) — Path to a directory in which a downloaded pretrained model configuration should be cached if the standard cache should not be used.
* **from\_tf** (`bool`, *optional*, defaults to `False`) — Load the model weights from a TensorFlow checkpoint save file (see docstring of `pretrained_model_name_or_path` argument).
* **force\_download** (`bool`, *optional*, defaults to `False`) — Whether or not to force the (re-)download of the model weights and configuration files, overriding the cached versions if they exist.
* **resume\_download** (`bool`, *optional*, defaults to `False`) — Whether or not to delete incompletely received files. Will attempt to resume the download if such a file exists.
* **proxies** (`Dict[str, str]`, *optional*) — A dictionary of proxy servers to use by protocol or endpoint, e.g., `{'http': 'foo.bar:3128', 'http://hostname': 'foo.bar:4012'}`. The proxies are used on each request.
* **output\_loading\_info(`bool`,** *optional*, defaults to `False`) — Whether ot not to also return a dictionary containing missing keys, unexpected keys and error messages.
* **local\_files\_only(`bool`,** *optional*, defaults to `False`) — Whether or not to only look at local files (e.g., not try downloading the model).
* **revision** (`str`, *optional*, defaults to `"main"`) — The specific model version to use. It can be a branch name, a tag name, or a commit id, since we use a git-based system for storing models and other artifacts on huggingface.co, so `revision` can be any identifier allowed by git.
* **trust\_remote\_code** (`bool`, *optional*, defaults to `False`) — Whether or not to allow for custom models defined on the Hub in their own modeling files. This option should only be set to `True` for repositories you trust and in which you have read the code, as it will execute code present on the Hub on your local machine.
* **code\_revision** (`str`, *optional*, defaults to `"main"`) — The specific revision to use for the code on the Hub, if the code leaves in a different repository than the rest of the model. It can be a branch name, a tag name, or a commit id, since we use a git-based system for storing models and other artifacts on huggingface.co, so `revision` can be any identifier allowed by git.
* **kwargs** (additional keyword arguments, *optional*) — Can be used to update the configuration object (after it being loaded) and initiate the model (e.g., `output_attentions=True`). Behaves differently depending on whether a `config` is provided or automatically loaded:
  * If a configuration is provided with `config`, `**kwargs` will be directly passed to the underlying model’s `__init__` method (we assume all relevant updates to the configuration have already been done)
  * If a configuration is not provided, `kwargs` will be first passed to the configuration class initialization function ([from\_pretrained()](https://huggingface.co/docs/transformers/v4.34.1/en/main_classes/configuration#transformers.PretrainedConfig.from_pretrained)). Each key of `kwargs` that corresponds to a configuration attribute will be used to override said attribute with the supplied `kwargs` value. Remaining keys that do not correspond to any configuration attribute will be passed to the underlying model’s `__init__` function.

Instantiate one of the model classes of the library (with a masked language modeling head) from a pretrained model.

The model class to instantiate is selected based on the `model_type` property of the config object (either passed as an argument or loaded from `pretrained_model_name_or_path` if possible), or when it’s missing, by falling back to using pattern matching on `pretrained_model_name_or_path`:

* **albert** — [AlbertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/albert#transformers.AlbertForMaskedLM) (ALBERT model)
* **bart** — [BartForConditionalGeneration](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/bart#transformers.BartForConditionalGeneration) (BART model)
* **bert** — [BertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/bert#transformers.BertForMaskedLM) (BERT model)
* **big\_bird** — [BigBirdForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/big_bird#transformers.BigBirdForMaskedLM) (BigBird model)
* **camembert** — [CamembertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/camembert#transformers.CamembertForMaskedLM) (CamemBERT model)
* **convbert** — [ConvBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/convbert#transformers.ConvBertForMaskedLM) (ConvBERT model)
* **data2vec-text** — [Data2VecTextForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/data2vec#transformers.Data2VecTextForMaskedLM) (Data2VecText model)
* **deberta** — [DebertaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/deberta#transformers.DebertaForMaskedLM) (DeBERTa model)
* **deberta-v2** — [DebertaV2ForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/deberta-v2#transformers.DebertaV2ForMaskedLM) (DeBERTa-v2 model)
* **distilbert** — [DistilBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/distilbert#transformers.DistilBertForMaskedLM) (DistilBERT model)
* **electra** — [ElectraForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/electra#transformers.ElectraForMaskedLM) (ELECTRA model)
* **ernie** — [ErnieForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/ernie#transformers.ErnieForMaskedLM) (ERNIE model)
* **esm** — [EsmForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/esm#transformers.EsmForMaskedLM) (ESM model)
* **flaubert** — [FlaubertWithLMHeadModel](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/flaubert#transformers.FlaubertWithLMHeadModel) (FlauBERT model)
* **fnet** — [FNetForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/fnet#transformers.FNetForMaskedLM) (FNet model)
* **funnel** — [FunnelForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/funnel#transformers.FunnelForMaskedLM) (Funnel Transformer model)
* **ibert** — [IBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/ibert#transformers.IBertForMaskedLM) (I-BERT model)
* **layoutlm** — [LayoutLMForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/layoutlm#transformers.LayoutLMForMaskedLM) (LayoutLM model)
* **longformer** — [LongformerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/longformer#transformers.LongformerForMaskedLM) (Longformer model)
* **luke** — [LukeForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/luke#transformers.LukeForMaskedLM) (LUKE model)
* **mbart** — [MBartForConditionalGeneration](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mbart#transformers.MBartForConditionalGeneration) (mBART model)
* **mega** — [MegaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mega#transformers.MegaForMaskedLM) (MEGA model)
* **megatron-bert** — [MegatronBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/megatron-bert#transformers.MegatronBertForMaskedLM) (Megatron-BERT model)
* **mobilebert** — [MobileBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mobilebert#transformers.MobileBertForMaskedLM) (MobileBERT model)
* **mpnet** — [MPNetForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mpnet#transformers.MPNetForMaskedLM) (MPNet model)
* **mra** — [MraForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mra#transformers.MraForMaskedLM) (MRA model)
* **mvp** — [MvpForConditionalGeneration](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/mvp#transformers.MvpForConditionalGeneration) (MVP model)
* **nezha** — [NezhaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/nezha#transformers.NezhaForMaskedLM) (Nezha model)
* **nystromformer** — [NystromformerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/nystromformer#transformers.NystromformerForMaskedLM) (Nyströmformer model)
* **perceiver** — [PerceiverForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/perceiver#transformers.PerceiverForMaskedLM) (Perceiver model)
* **qdqbert** — [QDQBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/qdqbert#transformers.QDQBertForMaskedLM) (QDQBert model)
* **reformer** — [ReformerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/reformer#transformers.ReformerForMaskedLM) (Reformer model)
* **rembert** — [RemBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/rembert#transformers.RemBertForMaskedLM) (RemBERT model)
* **roberta** — [RobertaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roberta#transformers.RobertaForMaskedLM) (RoBERTa model)
* **roberta-prelayernorm** — [RobertaPreLayerNormForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roberta-prelayernorm#transformers.RobertaPreLayerNormForMaskedLM) (RoBERTa-PreLayerNorm model)
* **roc\_bert** — [RoCBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roc_bert#transformers.RoCBertForMaskedLM) (RoCBert model)
* **roformer** — [RoFormerForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/roformer#transformers.RoFormerForMaskedLM) (RoFormer model)
* **squeezebert** — [SqueezeBertForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/squeezebert#transformers.SqueezeBertForMaskedLM) (SqueezeBERT model)
* **tapas** — [TapasForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/tapas#transformers.TapasForMaskedLM) (TAPAS model)
* **wav2vec2** — `Wav2Vec2ForMaskedLM` (Wav2Vec2 model)
* **xlm** — [XLMWithLMHeadModel](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm#transformers.XLMWithLMHeadModel) (XLM model)
* **xlm-roberta** — [XLMRobertaForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm-roberta#transformers.XLMRobertaForMaskedLM) (XLM-RoBERTa model)
* **xlm-roberta-xl** — [XLMRobertaXLForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xlm-roberta-xl#transformers.XLMRobertaXLForMaskedLM) (XLM-RoBERTa-XL model)
* **xmod** — [XmodForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/xmod#transformers.XmodForMaskedLM) (X-MOD model)
* **yoso** — [YosoForMaskedLM](https://huggingface.co/docs/transformers/v4.34.1/en/model_doc/yoso#transformers.YosoForMaskedLM) (YOSO model)

The model is set in evaluation mode by default using `model.eval()` (so for instance, dropout modules are deactivated). To train the model, you should first set it back in training mode with `model.train()`

Examples:

Copied

```
>>> from transformers import AutoConfig, AutoModelForMaskedLM

>>> # Download model and configuration from huggingface.co and cache.
>>> model = AutoModelForMaskedLM.from_pretrained("bert-base-cased")

>>> # Update configuration during loading
>>> model = AutoModelForMaskedLM.from_pretrained("bert-base-cased", output_attentions=True)
>>> model.config.output_attentions
True

>>> # Loading from a TF checkpoint file instead of a PyTorch model (slower)
>>> config = AutoConfig.from_pretrained("./tf_model/bert_tf_model_config.json")
>>> model = AutoModelForMaskedLM.from_pretrained(
...     "./tf_model/bert_tf_checkpoint.ckpt.index", from_tf=True, config=config
... )
```
