# কোন model বেছে নেবেন

> কাজ দেখে model বেছে নিন: লম্বা agentic coding session, সস্তা high-volume edit, বড় context-এর repo কাজ, ছবি দেখানো, বা দ্রুত interactive ব্যবহার। সঙ্গে আছে কয়েকটা model-এর তুলনা আর Tokens-এ model id কীভাবে কাজ করে।

Model বাছাইয়ে আসল কথা হলো কাজটা কী, leaderboard নয়। এই পাতায় কাজ অনুযায়ী model ভাগ করা হয়েছে, কয়েকটা উল্লেখযোগ্য model-এর তুলনা দেওয়া হয়েছে, আর বলা হয়েছে Tokens-এ model id কীভাবে কাজ করে। যা কিছু কেনা যায় তার সবই আছে [/models-এর catalog](/models)-এ। একটা key-র জন্য ঠিক কোন তালিকা, তা পাবেন `GET /v1/models` থেকে।

:::note[এই পাতার দাম নিয়ে]
নিচের দামগুলো provider-দের নিজেদের list price, প্রতি 1M token-এর জন্য USD-তে, October 2026-এ দেখে নেওয়া। এগুলো দিয়ে model-গুলোর মধ্যে তুলনা বোঝা যায়। Tokens-এ আপনার দাম দেখুন [/models](/models)-এ, সেটা এগুলোর থেকে আলাদা হতে পারে।
:::

## Tokens-এ model id

প্রতিটা model-এর id `provider/model` ধাঁচের, যেমন `deepseek/deepseek-v4.1-flash`। প্রতিটা request-এর `model` field-এ আর আপনার agent-এর config-এ এই id-ই বসে।

- Tokens-এর id একটা alias, তাই provider-এর নিজের id-র সঙ্গে সবসময় মেলে না। যেমন DeepSeek-এর API তাদের বর্তমান Flash model-কে বলে `deepseek-flash`। id সবসময় copy করুন [/models](/models) বা API থেকে।
- Catalog-এ Tokens যা যা দেয় সব দেখায়। আপনার key হয়তো কম model দেখবে: plan অনুযায়ী model আলাদা, আর key-তে allowed-models তালিকাও থাকতে পারে।

```bash
curl -s https://tokens.bd/v1/models -H "Authorization: Bearer $TOKENS_API_KEY"
```

Response-এর প্রতিটা `data[].id` এমন একটা model, যা এই key দিয়ে এখনই call করা যায়।

## কয়েকটা model-এর তুলনা

| Model (maker)                  | Context         | যে জন্য পরিচিত                                                              | List price in / out                                                     |
| ------------------------------ | --------------- | -------------------------------------------------------------------------- | ----------------------------------------------------------------------- |
| Claude Sonnet 5.5 (Anthropic)  | 1M, 128K out    | Agentic coding, tool use, ছবি input                                         | $2 / $10                                                                |
| GPT-5.6 Sol (OpenAI)           | 1.05M, 128K out | জটিল, দীর্ঘমেয়াদি agentic কাজ                                              | $4 / $20 (promotional until at least 2026-11-21; launch price $5 / $30) |
| GPT-6 Luna (OpenAI)            | 1.05M, 128K out | নির্দিষ্ট, high-volume কাজ                                                  | $0.10 / $0.50                                                           |
| Gemini 3.8 Flash (Google)      | 1M in, 65K out  | দীর্ঘমেয়াদি software engineering; text, image, video, audio ও PDF input    | $0.75 / $3.75 until 2026-12-31, then $1.50 / $7.50                      |
| Grok 4.7 (xAI)                 | 500K            | Coding আর knowledge work                                                    | $2 / $6 (prompts under 200K)                                            |
| Kimi K3 (Moonshot AI)          | 1M              | দীর্ঘমেয়াদি coding আর গভীর reasoning; thinking সবসময় চালু                  | $3 / $15                                                                |
| GLM-5.3 (Z.ai)                 | 1M, 128K out    | Coding আর agent; শুধু text; reasoning সবসময় চালু                            | $1.40 / $4.40                                                           |
| Qwen 3.8 Max (Alibaba)         | 1M, 131K out    | Coding, একসঙ্গে অনেক tool সামলানো, image ও video input                      | $2 / $6                                                                 |
| DeepSeek V4.1 Flash (DeepSeek) | 1M, 384K out    | দ্রুত আর সস্তা, ছবি input                                                    | $0.30 / $1.20 at peak hours, half off-peak                              |
| MiniMax M3 (MiniMax)           | 1M              | Multimodal coding                                                           | $0.30 / $1.20 (input up to 512K)                                        |
| Qwen 3.8 Flash (Alibaba)       | 1M, 131K out    | সস্তা, দ্রুত coding আর agent                                                 | $0.15 / $0.47                                                           |
| MiMo V2.6 Flash (Xiaomi)       | 1M, 128K out    | কম খরচের reasoning, ছবি input                                               | $0.14 / $0.28                                                           |

"যে জন্য পরিচিত" column-টা প্রতিটা maker-এর নিজেদের দাবির সারকথা। এটা কোনো benchmark result নয়।

## লম্বা session-এর agentic coding-এ সেরা model

Claude Code, Codex CLI আর OpenCode-এর মতো agent একটা কাজেই model-কে কয়েক ডজন বার call করে, আর প্রতিবার পুরো কথোপকথন আর file-এর লেখা আবার পাঠায়। তিনটা জিনিস এখানে raw intelligence score-এর চেয়ে বেশি কাজের:

1. **ভরসাযোগ্য tool calling।** যে model tool-এর argument গুলিয়ে ফেলে, সে turn নষ্ট করে।
2. **Input-এর দাম, আর cached input-এর দাম।** লম্বা session-এর বেশিরভাগ খরচ input token-এ। Caching করে upstream provider, আর যে model-এর cached-input দাম ঠিক করা আছে, Tokens cached input-এ সেই দামই ধরে। তবে catalog-এ এখন cached দাম দেখানো হয় না। বিস্তারিত [Prompt caching](/docs/prompt-caching)-এ।
3. **টেকসই context।** বেশিরভাগ নতুন flagship প্রায় 1M token দেয়।

শুরুর জন্য ভালো: Claude Sonnet 5.5, GPT-5.6 Sol, Kimi K3, GLM-5.3, Gemini 3.8 Flash আর Qwen 3.8 Max। Kimi K3 আর GLM-5.3 উত্তর দেওয়ার আগে সবসময় ভেবে নেয়। কঠিন সমস্যায় এটা কাজে দেয়, কিন্তু প্রতিটা call-এ output token বাড়ায়।

:::tip
মূল agent-এর জন্য শক্তিশালী model, আর ছোটখাটো কাজের জন্য সস্তা একটা। অনেক agent-এ title, summary আর ছোট edit-এর জন্য আলাদা ছোট বা দ্রুত model ঠিক করে দেওয়া যায়। নিজের agent-এর guide দেখুন, যেমন [Claude Code](/docs/claude-code) বা [OpenCode](/docs/opencode)।
:::

## High-volume edit-এর জন্য সস্তা model

বড় refactor, commit message, classification, test-এর কাঠামো, বা যা হাজার হাজার বার চালাবেন, তাতে প্রতি token-এর দামই সিদ্ধান্ত নেয়। তুলনার table থেকে: GPT-6 Luna ($0.10 / $0.50), MiMo V2.6 Flash ($0.14 / $0.28), Qwen 3.8 Flash ($0.15 / $0.47) আর DeepSeek V4.1 Flash। Z.ai-র GLM-5.3 Flash ($0.15 / $0.50) প্রায় একই দামের, আর image, video ও file input নেয়।

GPT-6 Luna নিয়ে একটা খুঁটিনাটি: OpenAI Chat Completions-এ এর tool calling চালায় শুধু `reasoning_effort` `none` থাকলে; পুরো tool support আছে Responses API-তে। Tokens `POST /v1/chat/completions` আর `POST /v1/responses`, দুটোই সাপোর্ট করে।

## পুরো repo-র কাজের জন্য বড় context-এর model

1M token-এর window এখন সাধারণ ব্যাপার, কিন্তু সেটা ভরতে খরচ আছে। Claude Sonnet 5.5-এর list price-এ 800K token-এর একটা prompt শুধু input-এই $1.60 লাগে, আর প্রতিবার পাঠালেই লাগে। কিছু provider একটা সীমা পেরোলে বেশি দামও নেয়:

- GPT-6 Luna আর GPT-5.6 model: 272K input token-এর ওপরে বেশি rate।
- Grok 4.5 থেকে 4.7: 200K prompt token আর তার বেশিতে $4 / $12।
- MiniMax M3: 512K input-এর ওপরে দ্বিগুণ rate।

Repo-র বেশিরভাগ প্রশ্নে পুরো tree paste করার চেয়ে ভালো agent বেছে বেছে খুঁজে পড়ে, আর সেটাই ভালো ফল দেয়। পুরো window সত্যিই লাগলে আগে [/models](/models)-এ দাম দেখে নিন। আরেকটা কথা: Tokens-এ একটা request body সর্বোচ্চ 10 MB হতে পারে।

## Vision আর multimodal input

Prompt-এ screenshot, diagram, PDF বা recording দিলে আগে দেখে নিন কোন model কোন ধরনের input নেয়:

- **সবচেয়ে বেশি ধরনের input:** Gemini 3.8 Flash (text, image, video, audio, PDF), Qwen 3.8 Omni Flash (text, image, audio, video), MiMo V2.6 Pro (text, image, video, audio)।
- **ছবি input আর ভালো coding, দুটোই:** Claude Sonnet 5.5, Qwen 3.8 Max, Kimi K3, MiniMax M3, DeepSeek V4.1 Flash।
- **শুধু text:** GLM-5.3, DeepSeek V4 Pro, LongCat 2.0 আর Tencent Hy4 Preview। এগুলোতে ছবি পাঠালে হয় fail করবে, নয়তো উপেক্ষা করা হবে।

ছবি যায় chat message-এর ভেতরে, আপনার SDK যে format ব্যবহার করে সেটাতে। Tokens-এ image generation, audio বা file-upload endpoint নেই।

## Interactive ব্যবহারের জন্য দ্রুত model

কয়েকটা maker একই model-এর আরও দ্রুত চলা সংস্করণ বেশি দামে বিক্রি করে। Maker-দের নিজেদের প্রকাশ করা গতি:

- Kimi K2.7 Code HighSpeed: প্রায় 180 tokens/s, দাম K2.7 Code-এর দ্বিগুণ ($1.90 / $8)।
- GLM-5.3 FlashX: প্রায় 200 tokens/s, $0.37 / $1.25।
- MiMo V2.6 Pro UltraSpeed: MiMo V2.6 Pro-র চেয়ে "up to 20x faster output", $4.35 / $8.70।
- Step 3.5 Flash: 100 থেকে 350 tokens/s, $0.10 / $0.30।

Tokens একটা বাড়তি network hop যোগ করে, তাই Tokens দিয়ে প্রথম token আসতে provider-কে সরাসরি call করার চেয়ে কম সময় লাগবে না। Streaming চালু করুন (`"stream": true`), তাহলে লেখা তৈরি হতে হতেই দেখা যাবে। বিস্তারিত [streaming](/docs/streaming)-এ।

## ঠিক করার আগে দুটো model চালিয়ে দেখুন

দুটো প্রার্থী বেছে নিন, আর আপনার codebase-এর একই সত্যিকারের কাজ দুটোকে দিন। একটা করে উত্তর তুলনা করতে Dashboard-এর Playground সবচেয়ে সহজ। Agent-এর কাজের জন্য, প্রতিটা model-এ agent-কে এক session চালান, আর প্রতি token-এর দাম না দেখে [usage](/docs/usage-and-alerts)-এ দেখুন একটা কাজ শেষ করতে মোট কত খরচ হলো। যে model-এর token-দাম বেশি কিন্তু কম turn-এ কাজ সারে, সেটাই শেষ পর্যন্ত সস্তা হতে পারে।

ঠিক করে ফেললে সেটাকে agent-এর default করে দিন: [Tokens CLI](/docs/tokens-cli) setup-এর সময় default model জিজ্ঞেস করে, অথবা প্রতিটা agent-এর আলাদা guide দেখুন।

সূত্র (list price আর spec, October 2026-এ দেখা): [Anthropic pricing](https://platform.claude.com/docs/en/about-claude/pricing), [OpenAI pricing](https://developers.openai.com/api/docs/pricing), [Google Gemini pricing](https://ai.google.dev/gemini-api/docs/pricing), [xAI models](https://docs.x.ai/docs/models), [DeepSeek pricing](https://api-docs.deepseek.com/quick_start/pricing), [Kimi pricing](https://platform.kimi.ai/docs/pricing/chat), [Z.ai pricing](https://docs.z.ai/guides/overview/pricing), [Alibaba Model Studio pricing](https://www.alibabacloud.com/help/en/model-studio/model-pricing), [MiniMax pricing](https://platform.minimax.io/docs/guides/pricing-paygo.md), [Xiaomi MiMo](https://mimo.mi.com), [StepFun pricing](https://platform.stepfun.ai/docs/en/guides/pricing/details)।

---
Page: https://tokens.bd/bn/docs/choosing-a-model
