clip.marsclip_model¶
marsclip_model ¶
First tri-modal MarsCLIP model slice with valid-token masking.
ImageViTTower ¶
ImageViTTower(*, image_size: int = 224, patch_size: int = 16, hidden_dim: int = 256, depth: int = 4, num_heads: int = 8, embed_dim: int = 256)
Bases: Module
A lightweight ViT-style image encoder with valid-patch masking.
Source code in src/clip/marsclip_model.py
TextTransformerTower ¶
TextTransformerTower(*, vocab_size: int, max_length: int = 64, hidden_dim: int = 256, depth: int = 2, num_heads: int = 8, embed_dim: int = 256)
Bases: Module
A lightweight text encoder for raw/expanded rationale text.
Source code in src/clip/marsclip_model.py
GeoContextTower ¶
GeoContextTower(*, geo_dim: int, scale_dim: int, viewing_dim: int, quality_dim: int, hidden_dim: int = 256, embed_dim: int = 256)
Bases: Module
Encode geo, scale, viewing, and quality metadata into one embedding.
Source code in src/clip/marsclip_model.py
MarsCLIPModel ¶
MarsCLIPModel(*, vocab_size: int, image_size: int = 224, patch_size: int = 16, hidden_dim: int = 256, embed_dim: int = 256, text_max_length: int = 64, geo_dim: int = 8, scale_dim: int = 8, viewing_dim: int = 13, quality_dim: int = 7, mask_ratio: float = 0.0)
Bases: Module
First-pass tri-modal contrastive model for MarsCLIP.
Source code in src/clip/marsclip_model.py
compute_patch_valid_mask ¶
Aggregate a pixel valid mask into one boolean per image patch.
Source code in src/clip/marsclip_model.py
sample_patch_keep_mask ¶
sample_patch_keep_mask(patch_valid_mask: Tensor, mask_ratio: float, generator: Generator | None = None) -> torch.Tensor
Randomly keep a subset of valid image patches, never selecting invalid ones.
Source code in src/clip/marsclip_model.py
symmetric_contrastive_loss ¶
CLIP-style symmetric contrastive loss for one embedding pair.