{"total_count":17,"limit":100,"first":{"href":"https://eu-de.ml.cloud.ibm.com/ml/v1/foundation_model_specs?version=2024-05-01"},"resources":[{"model_id":"cross-encoder/ms-marco-minilm-l-12-v2","label":"ms-marco-minilm-l-12-v2","provider":"cross-encoder","source":"cross-encoder","indemnity":"NON_IBM","functions":[{"id":"rerank"}],"short_description":"Used for Information Retrieval: Encode and sort a query will all possible passages.","long_description":"The model can be used for Information Retrieval: Given a query, encode the query will all possible passages (e.g. retrieved with ElasticSearch). Then sort the passages in a decreasing order.","input_tier":"class_11","output_tier":"class_11","number_params":"33.4m","model_limits":{"max_sequence_length":512},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-09-17"},{"id":"deprecated","start_date":"2026-05-05"},{"id":"withdrawn","start_date":"2026-08-16"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}},{"model_id":"ibm/granite-3-1-8b-base","label":"granite-3-1-8b-base","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"base_foundation_model_deployable"},{"id":"lora_fine_tune_trainable"}],"short_description":"Granite 3.1 8b base is a pre-trained autoregressive foundation model with a context length of 128k intended for tuning.","long_description":"Granite models are designed to be used for a wide range of generative and non-generative tasks with appropriate prompt engineering. They employ a GPT-style decoder-only architecture, with additional innovations from IBM Research and the open community.","terms_url":"https://www.ibm.com/support/customer/csol/terms/?id=i126-6883\u0026lc=en","input_tier":"","output_tier":"","number_params":"8b","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","classification","generation","code","extraction","translation","function_calling","code-generation","code-explanation","code-fixing"],"tasks":[{"id":"question_answering"},{"id":"summarization"},{"id":"retrieval_augmented_generation"},{"id":"classification"},{"id":"generation"},{"id":"code"},{"id":"extraction"},{"id":"translation"},{"id":"function_calling"},{"id":"code-generation"},{"id":"code-explanation"},{"id":"code-fixing"}],"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-04-16"}],"versions":[{"version":"3.1.0","available_date":"2024-12-06"}],"lora_fine_tuning_parameters":{"num_epochs":{"default":10,"min":1,"max":50},"verbalizer":{"default":"### Input: {{input}} \n\n### Response: {{output}}"},"batch_size":{"default":5,"min":1,"max":16},"accumulate_steps":{"default":1,"min":1,"max":128},"learning_rate":{"default":0.00001,"min":0.00001,"max":0.5},"max_seq_length":{"default":4096,"min":1,"max":8192},"tokenizer":{"default":"ibm/granite-3-1-8b-base"},"response_template":{"default":"\n### Response:"},"num_gpus":{"default":1},"peft_parameters":{"type":{"supported":["lora"],"default":"lora"},"rank":{"supported":[8,16,32,64,128,256],"default":32},"target_modules":{"supported":["all-linear","o_proj","v_proj","k_proj","q_proj","up_proj","down_proj","gate_proj"],"default":["all-linear"]},"lora_alpha":{"default":32,"min":0,"max":999999},"lora_dropout":{"default":0.05,"min":0,"max":1}},"gradient_checkpointing":{"default":true}},"architecture_type":"granite","curated_model_info":{"base_model_id":"ibm/granite-3-1-8b-base","lora_hardware_spec":"WXaaS-S-Lora","additional_params":"VLLM_USE_V1=1,HOME=/home/vllm,OMP_NUM_THREADS=2,MAX_SEQUENCE_LENGTH=131072,MAX_LORAS=8,MAX_CPU_LORAS=10,MAX_LORA_RANK=256,DTYPE=bfloat16","gpu_requirements":{"min_count":{"a100":1,"h100":1}}},"deployment_parameters":[{"name":"enable_lora","display_name":"Enable Lora","default":false,"type":"boolean"}]},{"model_id":"ibm/granite-4-h-small","label":"granite-4-h-small","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"autoai_rag"},{"id":"text_chat"},{"id":"text_generation"}],"short_description":"Granite-4.0-H-Small is a 30B parameter long-context instruct model finetuned from Granite-4.0-H-Small-Base using a combination of open source instruction datasets with permissive license and internally collected synthetic datasets.","long_description":"Granite-4.0-H-Small is a 30B parameter long-context instruct model finetuned from Granite-4.0-H-Small-Base using a combination of open source instruction datasets with permissive license and internally collected synthetic datasets. This model is developed using a diverse set of techniques with a structured chat format, including supervised finetuning, model alignment using reinforcement learning, and model merging. Granite 4.0 instruct models feature improved instruction following (IF) and tool-calling capabilities, making them more effective in enterprise applications.","terms_url":"https://www.ibm.com/support/customer/csol/terms/?id=i126-6883\u0026lc=en","input_tier":"class_18","output_tier":"class_5","number_params":"32b","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","classification","generation","code","extraction","translation","function_calling","code-generation","code-explanation","code-fixing"],"tasks":[{"id":"question_answering"},{"id":"summarization"},{"id":"retrieval_augmented_generation"},{"id":"classification"},{"id":"generation"},{"id":"code"},{"id":"extraction"},{"id":"translation"},{"id":"function_calling"}],"model_limits":{"max_sequence_length":131072},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-10-02"}],"versions":[{"version":"4.0.0","available_date":"2025-10-02"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":8,"balance_mode":2}},{"model_id":"ibm/granite-embedding-278m-multilingual","label":"granite-embedding-278m-multilingual","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"autoai_rag"},{"id":"embedding"}],"embedding_dimension":768,"short_description":"Granite-Embedding-278M-Multilingual is a 278M parameter model from the Granite Embeddings suite that can be used to generate high quality text embeddings.","long_description":"Granite-Embedding-278M-Multilingual is a 278M parameter model from the Granite Embeddings suite that can be used to generate high quality text embeddings. This model produces embedding vectors of size 768 and is trained using a combination of open source relevance-pair datasets with permissive, enterprise-friendly license, and IBM collected and generated datasets. It supports 12 languages:  English, German, Spanish, French, Japanese, Portuguese, Arabic, Czech, Italian, Korean, Dutch, and Chinese.","input_tier":"class_c1","output_tier":"class_c1","number_params":"278m","model_limits":{"max_sequence_length":512},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-01-15"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}},{"model_id":"ibm/granite-ttm-1024-96-r2","label":"granite-ttm-1024-96-r2","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"time_series_forecast"}],"short_description":"TinyTimeMixers (TTMs) are compact pre-trained models for Multivariate Time-Series Forecasting, open-sourced by IBM Research","long_description":"TinyTimeMixers (TTMs) are compact pre-trained models for Multivariate Time-Series Forecasting, open-sourced by IBM Research. Given the last 1024 time-points (i.e. context length), this model can forecast up to next 96 time-points (i.e. forecast length) in future. This model is targeted towards a forecasting setting of context length 1024 and forecast length 96 and recommended for hourly and minutely resolutions (Ex. 10 min, 15 min, 1 hour, etc)","input_tier":"class_14","output_tier":"class_15","number_params":"805k","limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-11-21"},{"id":"deprecated","start_date":"2026-08-12"},{"id":"withdrawn","start_date":"2026-11-12"}],"versions":[{"version":"1.1.0","available_date":"2025-04-25"},{"version":"1.0.0","available_date":"2024-11-21"}]},{"model_id":"ibm/granite-ttm-1536-96-r2","label":"granite-ttm-1536-96-r2","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"time_series_forecast"}],"short_description":"TinyTimeMixers (TTMs) are compact pre-trained models for Multivariate Time-Series Forecasting, open-sourced by IBM Research","long_description":"TinyTimeMixers (TTMs) are compact pre-trained models for Multivariate Time-Series Forecasting, open-sourced by IBM Research. Given the last 1536 time-points (i.e. context length), this model can forecast up to next 96 time-points (i.e. forecast length) in future. This model is targeted towards a forecasting setting of context length 1536 and forecast length 96 and recommended for hourly and minutely resolutions (Ex. 10 min, 15 min, 1 hour, etc)","input_tier":"class_14","output_tier":"class_15","number_params":"805k","limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-11-21"},{"id":"deprecated","start_date":"2026-08-12"},{"id":"withdrawn","start_date":"2026-11-12"}],"versions":[{"version":"1.1.0","available_date":"2025-04-25"},{"version":"1.0.0","available_date":"2024-11-21"}]},{"model_id":"ibm/granite-ttm-512-96-r2","label":"granite-ttm-512-96-r2","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"time_series_forecast"}],"short_description":"TinyTimeMixers (TTMs) are compact pre-trained models for Multivariate Time-Series Forecasting, open-sourced by IBM Research","long_description":"TinyTimeMixers (TTMs) are compact pre-trained models for Multivariate Time-Series Forecasting, open-sourced by IBM Research. Given the last 512 time-points (i.e. context length), this model can forecast up to next 96 time-points (i.e. forecast length) in future. This model is targeted towards a forecasting setting of context length 512 and forecast length 96 and recommended for hourly and minutely resolutions (Ex. 10 min, 15 min, 1 hour, etc)","input_tier":"class_14","output_tier":"class_15","number_params":"805k","limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-11-21"},{"id":"deprecated","start_date":"2026-08-12"},{"id":"withdrawn","start_date":"2026-11-12"}],"versions":[{"version":"1.1.0","available_date":"2025-04-25"},{"version":"1.0.0","available_date":"2024-11-21"}]},{"model_id":"ibm/slate-125m-english-rtrvr-v2","label":"slate-125m-english-rtrvr-v2","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"autoai_rag"},{"id":"embedding"},{"id":"rerank"},{"id":"similarity"}],"embedding_dimension":768,"short_description":"An embedding model with 512 token limit. It has 125 million parameters and an embedding dimension of 768.","long_description":"This model follows the standard 'sentence transformers' approach, relying on bi-encoders. It generates embeddings for various inputs such as queries, passages, or documents. The training objective is to maximize cosine similarity between two text pieces: text A (query text) and text B (passage text). This process yields sentence embeddings q and p, allowing for comparison through cosine similarity.","input_tier":"class_c1","output_tier":"class_c1","number_params":"125m","model_limits":{"max_sequence_length":512},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-08-15"},{"id":"deprecated","start_date":"2026-05-05"},{"id":"withdrawn","start_date":"2027-01-12"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}},{"model_id":"ibm/slate-30m-english-rtrvr-v2","label":"slate-30m-english-rtrvr-v2","provider":"IBM","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"embedding"},{"id":"rerank"},{"id":"similarity"}],"embedding_dimension":384,"short_description":"An embedding model with 512 token limit. It has 30 million parameters and an embedding dimension of 384.","long_description":"This model follows the standard 'sentence transformers' approach, relying on bi-encoders. It generates embeddings for various inputs such as queries, passages, or documents. The training objective is to maximize cosine similarity between two text pieces: text A (query text) and text B (passage text). This process yields sentence embeddings q and p, allowing for comparison through cosine similarity.","input_tier":"class_c1","output_tier":"class_c1","number_params":"30m","model_limits":{"max_sequence_length":512},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-08-15"},{"id":"deprecated","start_date":"2026-05-05"},{"id":"withdrawn","start_date":"2027-01-12"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}},{"model_id":"intfloat/multilingual-e5-large","label":"multilingual-e5-large","provider":"intfloat","source":"intfloat","indemnity":"NON_IBM","functions":[{"id":"autoai_rag"},{"id":"embedding"},{"id":"multilingual"},{"id":"rerank"},{"id":"similarity"}],"embedding_dimension":1024,"short_description":"An embedding model. It has 560 million parameters, has 24 layers and the embedding size is 1024.","long_description":"This model gets continually trained on a mixture of multilingual datasets. It supports 100 languages from xlm-roberta.","input_tier":"class_c1","output_tier":"class_c1","number_params":"560m","model_limits":{"max_sequence_length":512},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-05-16"}],"supported_languages":["af","am","ar","as","az","be","bg","bn","br","bs","ca","cs","cy","da","de","el","en","eo","es","et","eu","fa","fi","fr","fy","ga","gd","gl","gu","ha","he","hi","hr","hu","hy","id","is","it","ja","jv","ka","kk","km","kn","ko","ku","ky","la","lo","lt","lv","mg","mk","ml","mn","mr","ms","my","ne","nl","no","om","or","pa","pl","ps","pt","ro","ru","sa","sd","si","sk","sl","so","sq","sr","su","sv","sw","ta","te","th","tl","tr","ug","uk","ur","uz","vi","xh","yi","zh"],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}},{"model_id":"meta-llama/llama-3-1-70b-gptq","label":"llama-3-1-70b-gptq","provider":"Meta","source":"IBM","indemnity":"IBM_COVERED","functions":[{"id":"base_foundation_model_deployable"},{"id":"lora_fine_tune_trainable"}],"short_description":"Llama 3.1 is an auto-regressive language model that uses an optimized transformer architecture. The tuned versions use supervised fine-tuning (SFT) and reinforcement learning with human feedback (RLHF) to align with human preferences for helpfulness and safety.","long_description":"The Meta Llama 3.1 collection of multilingual large language models (LLMs) is a collection of pretrained and instruction tuned generative models in 8B, 70B and 405B sizes (text in/text out). The Llama 3.1 instruction tuned text only models (8B, 70B, 405B) are optimized for multilingual dialogue use cases and outperform many of the available open source and closed chat models on common industry benchmarks. Llama 3.1 is an auto-regressive language model that uses an optimized transformer architecture. The tuned versions use supervised fine-tuning (SFT) and reinforcement learning with human feedback (RLHF) to align with human preferences for helpfulness and safety.","terms_url":"https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct/blob/main/LICENSE","input_tier":"","output_tier":"","number_params":"70b","min_shot_size":1,"task_ids":["question_answering","summarization","classification","generation","code","extraction","translation"],"tasks":[{"id":"question_answering","ratings":{"quality":4}},{"id":"summarization","ratings":{"quality":3}},{"id":"classification","ratings":{"quality":4}},{"id":"generation"},{"id":"code"},{"id":"extraction","ratings":{"quality":4}},{"id":"translation"}],"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-07-04"}],"versions":[{"version":"3.1.0","available_date":"2025-07-04"}],"lora_fine_tuning_parameters":{"num_epochs":{"default":10,"min":1,"max":50},"verbalizer":{"default":"### Input: {{input}} \n\n### Response: {{output}}"},"batch_size":{"default":5,"min":1,"max":16},"accumulate_steps":{"default":1,"min":1,"max":128},"learning_rate":{"default":0.00001,"min":0.00001,"max":0.5},"max_seq_length":{"default":1024,"min":1,"max":8192},"tokenizer":{"default":"meta-llama/llama-3-1-70b-gptq"},"response_template":{"default":"\n### Response:"},"num_gpus":{"default":1},"peft_parameters":{"type":{"supported":["qlora"],"default":"qlora"},"rank":{"supported":[8,16,32,64,128,256],"default":8},"target_modules":{"supported":["all-linear","o_proj","v_proj","k_proj","q_proj","up_proj","down_proj","gate_proj"],"default":["v_proj","q_proj"]},"lora_alpha":{"default":32,"min":0},"lora_dropout":{"default":0.05,"min":0,"max":1}},"gradient_checkpointing":{"default":true}},"architecture_type":"llama","curated_model_info":{"base_model_id":"meta-llama/llama-3-1-70b-gptq","lora_hardware_spec":"WXaaS-M-Lora","additional_params":"TOOL_CALL_PARSER=llama3_json,VLLM_USE_V1=1,HOME=/home/vllm,OMP_NUM_THREADS=2,MAX_SEQUENCE_LENGTH=128000,MAX_LORAS=8,MAX_CPU_LORAS=10,MAX_LORA_RANK=256,DTYPE=float16","gpu_requirements":{"min_count":{"a100":4,"h100":4}}},"deployment_parameters":[{"name":"enable_lora","display_name":"Enable Lora","default":false,"type":"boolean"}]},{"model_id":"meta-llama/llama-3-1-8b","label":"llama-3-1-8b","provider":"Meta","source":"Hugging Face","indemnity":"NON_IBM","functions":[{"id":"base_foundation_model_deployable"},{"id":"lora_fine_tune_trainable"}],"short_description":"Llama-3-1-8b is an auto-regressive language model that uses an optimized transformer architecture.","long_description":"Llama-3-1-8b is a pretrained and fine-tuned generative text model with 8 billion parameters, optimized for multilingual dialogue use cases and code output.","terms_url":"https://www.llama.com/llama3_1/license/","input_tier":"","output_tier":"","number_params":"8b","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","classification","generation","code","extraction"],"tasks":[{"id":"question_answering","ratings":{"quality":4}},{"id":"summarization","ratings":{"quality":3}},{"id":"retrieval_augmented_generation","ratings":{"quality":4}},{"id":"classification","ratings":{"quality":4}},{"id":"generation"},{"id":"code"},{"id":"extraction","ratings":{"quality":4}}],"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-11-25"}],"versions":[{"version":"3.1.0","available_date":"2024-08-01"}],"lora_fine_tuning_parameters":{"num_epochs":{"default":5,"min":1,"max":50},"verbalizer":{"default":"### Input: {{input}} \n\n### Response: {{output}}"},"batch_size":{"default":8,"min":1,"max":16},"accumulate_steps":{"default":1,"min":1,"max":128},"learning_rate":{"default":0.00001,"min":0.00001,"max":0.5},"max_seq_length":{"default":1024,"min":1,"max":8192},"tokenizer":{"default":"meta-llama/llama-3-1-8b"},"response_template":{"default":"\n### Response:"},"num_gpus":{"default":1},"peft_parameters":{"type":{"supported":["lora"],"default":"lora"},"rank":{"supported":[8,16,32,64,128,256],"default":32},"target_modules":{"supported":["all-linear","o_proj","v_proj","k_proj","q_proj","up_proj","down_proj","gate_proj"],"default":["v_proj","q_proj"]},"lora_alpha":{"default":64,"min":0,"max":999999},"lora_dropout":{"default":0.05,"min":0,"max":1}},"gradient_checkpointing":{"default":true}},"architecture_type":"llama","curated_model_info":{"base_model_id":"meta-llama/llama-3-1-8b","lora_hardware_spec":"WXaaS-S-Lora","additional_params":"VLLM_USE_V1=1,HOME=/home/vllm,OMP_NUM_THREADS=2,MAX_SEQUENCE_LENGTH=131072,MAX_LORAS=8,MAX_CPU_LORAS=10,MAX_LORA_RANK=256,DTYPE=bfloat16","gpu_requirements":{"min_count":{"a100":1,"h100":1}}},"deployment_parameters":[{"name":"enable_lora","display_name":"Enable Lora","default":false,"type":"boolean"}]},{"model_id":"meta-llama/llama-3-3-70b-instruct","label":"llama-3-3-70b-instruct","provider":"Meta","source":"Hugging Face","indemnity":"NON_IBM","functions":[{"id":"autoai_rag"},{"id":"autoai_sql_rag"},{"id":"multilingual"},{"id":"text_chat"},{"id":"text_generation"}],"short_description":"This version of Llama-3.3-70b-instruct is also the FP8 quantized version of the original FP16 weights.","long_description":"The Meta Llama 3.3 multilingual large language model (LLM) is a pretrained and instruction tuned generative model in 70B (text in/text out). The Llama 3.3 instruction tuned text only model is optimized for multilingual dialogue use cases and outperform many of the available open source and closed chat models on common industry benchmarks.","terms_url":"https://github.com/meta-llama/llama-models/blob/main/models/llama3_3/LICENSE","input_tier":"class_13","output_tier":"class_13","number_params":"70b","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","classification","generation","code","extraction","translation","function_calling"],"tasks":[{"id":"question_answering","ratings":{"quality":4}},{"id":"summarization","ratings":{"quality":3}},{"id":"retrieval_augmented_generation","ratings":{"quality":4}},{"id":"classification","ratings":{"quality":4}},{"id":"generation"},{"id":"code"},{"id":"extraction","ratings":{"quality":4}},{"id":"translation"},{"id":"function_calling","ratings":{"quality":4}}],"model_limits":{"max_sequence_length":131072},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-12-06"}],"versions":[{"version":"3.3.0","available_date":"2024-12-06"}],"supported_languages":["en","de","fr","it","pt","hi","es","th"],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":12,"balance_mode":2}},{"model_id":"meta-llama/llama-4-maverick-17b-128e-instruct-fp8","label":"llama-4-maverick-17b-128e-instruct-fp8","provider":"Meta","source":"Hugging Face","indemnity":"NON_IBM","functions":[{"id":"autoai_rag"},{"id":"image_chat"},{"id":"multilingual"},{"id":"text_chat"},{"id":"text_generation"}],"short_description":"Llama 4 Maverick, a 17 billion active parameter model with 128 experts.","long_description":"The Llama 4 collection of models are natively multimodal AI models that enable text and multimodal experiences. These models leverage a mixture-of-experts architecture to offer industry-leading performance in text and image understanding.","terms_url":"https://github.com/meta-llama/llama-models/blob/main/models/llama4/LICENSE","input_tier":"class_9","output_tier":"class_16","number_params":"400b","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","classification","generation","code","extraction","translation","function_calling"],"tasks":[{"id":"question_answering"},{"id":"summarization"},{"id":"retrieval_augmented_generation"},{"id":"classification"},{"id":"generation"},{"id":"code"},{"id":"extraction"},{"id":"translation"},{"id":"function_calling"}],"model_limits":{"max_sequence_length":131072},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-04-07"}],"versions":[{"version":"4.0.0","available_date":"2025-04-07"}],"supported_languages":["en","de","fr","it","pt","hi","es","th"],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}},{"model_id":"mistralai/mistral-medium-2505","label":"mistral-medium-2505","provider":"Mistral AI","source":"Mistral","indemnity":"THIRD_PARTY","functions":[{"id":"autoai_rag"},{"id":"autoai_sql_rag"},{"id":"image_chat"},{"id":"multilingual"},{"id":"text_chat"},{"id":"text_generation"}],"short_description":"Mistral Medium 3 (25.05) is our latest iteration of the Mistral Medium model family.","long_description":"Mistral Medium 3 (25.05) features multimodal capabilities and an extended context length of up to 128k. It can now process and understand visual inputs as well as long documents, further expanding its range of applications.","terms_url":"https://www.ibm.com/support/customer/csol/terms/?id=i126-6883\u0026lc=en","input_tier":"mistral_large_input","output_tier":"mistral_large","number_params":"","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","classification","generation","code","extraction","translation","function_calling"],"tasks":[{"id":"question_answering"},{"id":"summarization"},{"id":"retrieval_augmented_generation"},{"id":"classification"},{"id":"generation"},{"id":"code"},{"id":"extraction"},{"id":"translation"},{"id":"function_calling","ratings":{"quality":4}}],"model_limits":{"max_sequence_length":131072},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-05-07"},{"id":"deprecated","start_date":"2026-05-05"},{"id":"withdrawn","start_date":"2027-01-12"}],"versions":[{"version":"1.0.0","available_date":"2025-05-07"}],"supported_languages":["en","fr","de","it","zh","ja","ko","pt","nl","pl"],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":12,"balance_mode":2}},{"model_id":"mistralai/mistral-small-3-1-24b-instruct-2503","label":"mistral-small-3-1-24b-instruct-2503","provider":"Mistral AI","source":"Hugging Face","indemnity":"NON_IBM","functions":[{"id":"autoai_rag"},{"id":"autoai_sql_rag"},{"id":"image_chat"},{"id":"text_chat"},{"id":"text_generation"}],"short_description":"This model is an instruction-finetuned version of: Mistral-Small-3.1-24B-Base-2503.","long_description":"Mistral Small 3 (2501), Mistral Small 3.1 (2503) adds state-of-the-art vision understanding and enhances long context capabilities up to 128k tokens without compromising text performance. With 24 billion parameters, this model achieves top-tier capabilities in both text and vision tasks.","terms_url":"https://www.apache.org/licenses/LICENSE-2.0","input_tier":"class_c1","output_tier":"class_17","number_params":"24b","min_shot_size":1,"task_ids":["question_answering","summarization","retrieval_augmented_generation","retrieval_augmented_generation","classification","generation","code","extraction","function_calling"],"tasks":[{"id":"question_answering"},{"id":"summarization"},{"id":"retrieval_augmented_generation"},{"id":"classification"},{"id":"generation"},{"id":"code"},{"id":"extraction"},{"id":"function_calling"}],"model_limits":{"max_sequence_length":128000},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2025-04-22"}],"versions":[{"version":"1.0.0","available_date":"2025-04-22"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":8,"balance_mode":2}},{"model_id":"sentence-transformers/all-minilm-l6-v2","label":"all-minilm-l6-v2","provider":"sentence-transformers","source":"sentence-transformers","indemnity":"NON_IBM","functions":[{"id":"embedding"},{"id":"rerank"},{"id":"similarity"}],"embedding_dimension":384,"short_description":"An embedding model with 128 token limit. It has 23 million parameters and an embedding dimension of 384.","long_description":"This is a sentence-transformers model. It maps sentences \u0026 paragraphs to a 384 dimensional dense vector space and can be used for tasks like clustering or semantic search.","input_tier":"class_c1","output_tier":"class_c1","number_params":"23m","model_limits":{"max_sequence_length":512},"limits":{"3f6acf43-ede8-413a-ac69-f8af3bb0cbfe":{"call_time":"5m0s"},"a3d2f92f-06f9-48d0-b2e6-a7ba2b4e0577":{"call_time":"10m0s"},"d18d88b9-be7a-46ec-be1e-aff14904f1e9":{"call_time":"10m0s"}},"lifecycle":[{"id":"available","start_date":"2024-10-16"},{"id":"deprecated","start_date":"2026-05-05"},{"id":"withdrawn","start_date":"2027-01-12"}],"router_info":{"version":"1.1.35","build":"1.1.35","build_date":"20260619142455","max_concurrent_requests":16,"balance_mode":2}}]}