Model বাছাইয়ে আসল কথা হলো কাজটা কী, leaderboard নয়। এই পাতায় কাজ অনুযায়ী model ভাগ করা হয়েছে, কয়েকটা উল্লেখযোগ্য model-এর তুলনা দেওয়া হয়েছে, আর বলা হয়েছে Tokens-এ model id কীভাবে কাজ করে। যা কিছু কেনা যায় তার সবই আছে /models-এর catalog-এ। একটা key-র জন্য ঠিক কোন তালিকা, তা পাবেন GET /v1/models থেকে।
এই পাতার দাম নিয়ে
নিচের দামগুলো provider-দের নিজেদের list price, প্রতি 1M token-এর জন্য USD-তে, October 2026-এ দেখে নেওয়া। এগুলো দিয়ে model-গুলোর মধ্যে তুলনা বোঝা যায়। Tokens-এ আপনার দাম দেখুন /models-এ, সেটা এগুলোর থেকে আলাদা হতে পারে।
Tokens-এ model id#
প্রতিটা model-এর id provider/model ধাঁচের, যেমন deepseek/deepseek-v4.1-flash। প্রতিটা request-এর model field-এ আর আপনার agent-এর config-এ এই id-ই বসে।
- Tokens-এর id একটা alias, তাই provider-এর নিজের id-র সঙ্গে সবসময় মেলে না। যেমন DeepSeek-এর API তাদের বর্তমান Flash model-কে বলে
deepseek-flash। id সবসময় copy করুন /models বা API থেকে। - Catalog-এ Tokens যা যা দেয় সব দেখায়। আপনার key হয়তো কম model দেখবে: plan অনুযায়ী model আলাদা, আর key-তে allowed-models তালিকাও থাকতে পারে।
curl -s https://tokens.bd/v1/models -H "Authorization: Bearer $TOKENS_API_KEY"Response-এর প্রতিটা data[].id এমন একটা model, যা এই key দিয়ে এখনই call করা যায়।
কয়েকটা model-এর তুলনা#
| Model (maker) | Context | যে জন্য পরিচিত | List price in / out |
|---|---|---|---|
| Claude Sonnet 5.5 (Anthropic) | 1M, 128K out | Agentic coding, tool use, ছবি input | $2 / $10 |
| GPT-5.6 Sol (OpenAI) | 1.05M, 128K out | জটিল, দীর্ঘমেয়াদি agentic কাজ | $4 / $20 (promotional until at least 2026-11-21; launch price $5 / $30) |
| GPT-6 Luna (OpenAI) | 1.05M, 128K out | নির্দিষ্ট, high-volume কাজ | $0.10 / $0.50 |
| Gemini 3.8 Flash (Google) | 1M in, 65K out | দীর্ঘমেয়াদি software engineering; text, image, video, audio ও PDF input | $0.75 / $3.75 until 2026-12-31, then $1.50 / $7.50 |
| Grok 4.7 (xAI) | 500K | Coding আর knowledge work | $2 / $6 (prompts under 200K) |
| Kimi K3 (Moonshot AI) | 1M | দীর্ঘমেয়াদি coding আর গভীর reasoning; thinking সবসময় চালু | $3 / $15 |
| GLM-5.3 (Z.ai) | 1M, 128K out | Coding আর agent; শুধু text; reasoning সবসময় চালু | $1.40 / $4.40 |
| Qwen 3.8 Max (Alibaba) | 1M, 131K out | Coding, একসঙ্গে অনেক tool সামলানো, image ও video input | $2 / $6 |
| DeepSeek V4.1 Flash (DeepSeek) | 1M, 384K out | দ্রুত আর সস্তা, ছবি input | $0.30 / $1.20 at peak hours, half off-peak |
| MiniMax M3 (MiniMax) | 1M | Multimodal coding | $0.30 / $1.20 (input up to 512K) |
| Qwen 3.8 Flash (Alibaba) | 1M, 131K out | সস্তা, দ্রুত coding আর agent | $0.15 / $0.47 |
| MiMo V2.6 Flash (Xiaomi) | 1M, 128K out | কম খরচের reasoning, ছবি input | $0.14 / $0.28 |
"যে জন্য পরিচিত" column-টা প্রতিটা maker-এর নিজেদের দাবির সারকথা। এটা কোনো benchmark result নয়।
লম্বা session-এর agentic coding-এ সেরা model#
Claude Code, Codex CLI আর OpenCode-এর মতো agent একটা কাজেই model-কে কয়েক ডজন বার call করে, আর প্রতিবার পুরো কথোপকথন আর file-এর লেখা আবার পাঠায়। তিনটা জিনিস এখানে raw intelligence score-এর চেয়ে বেশি কাজের:
- ভরসাযোগ্য tool calling। যে model tool-এর argument গুলিয়ে ফেলে, সে turn নষ্ট করে।
- Input-এর দাম, আর cached input-এর দাম। লম্বা session-এর বেশিরভাগ খরচ input token-এ। Caching করে upstream provider, আর যে model-এর cached-input দাম ঠিক করা আছে, Tokens cached input-এ সেই দামই ধরে। তবে catalog-এ এখন cached দাম দেখানো হয় না। বিস্তারিত Prompt caching-এ।
- টেকসই context। বেশিরভাগ নতুন flagship প্রায় 1M token দেয়।
শুরুর জন্য ভালো: Claude Sonnet 5.5, GPT-5.6 Sol, Kimi K3, GLM-5.3, Gemini 3.8 Flash আর Qwen 3.8 Max। Kimi K3 আর GLM-5.3 উত্তর দেওয়ার আগে সবসময় ভেবে নেয়। কঠিন সমস্যায় এটা কাজে দেয়, কিন্তু প্রতিটা call-এ output token বাড়ায়।
Tip
মূল agent-এর জন্য শক্তিশালী model, আর ছোটখাটো কাজের জন্য সস্তা একটা। অনেক agent-এ title, summary আর ছোট edit-এর জন্য আলাদা ছোট বা দ্রুত model ঠিক করে দেওয়া যায়। নিজের agent-এর guide দেখুন, যেমন Claude Code বা OpenCode।
High-volume edit-এর জন্য সস্তা model#
বড় refactor, commit message, classification, test-এর কাঠামো, বা যা হাজার হাজার বার চালাবেন, তাতে প্রতি token-এর দামই সিদ্ধান্ত নেয়। তুলনার table থেকে: GPT-6 Luna ($0.10 / $0.50), MiMo V2.6 Flash ($0.14 / $0.28), Qwen 3.8 Flash ($0.15 / $0.47) আর DeepSeek V4.1 Flash। Z.ai-র GLM-5.3 Flash ($0.15 / $0.50) প্রায় একই দামের, আর image, video ও file input নেয়।
GPT-6 Luna নিয়ে একটা খুঁটিনাটি: OpenAI Chat Completions-এ এর tool calling চালায় শুধু reasoning_effort none থাকলে; পুরো tool support আছে Responses API-তে। Tokens POST /v1/chat/completions আর POST /v1/responses, দুটোই সাপোর্ট করে।
পুরো repo-র কাজের জন্য বড় context-এর model#
1M token-এর window এখন সাধারণ ব্যাপার, কিন্তু সেটা ভরতে খরচ আছে। Claude Sonnet 5.5-এর list price-এ 800K token-এর একটা prompt শুধু input-এই $1.60 লাগে, আর প্রতিবার পাঠালেই লাগে। কিছু provider একটা সীমা পেরোলে বেশি দামও নেয়:
- GPT-6 Luna আর GPT-5.6 model: 272K input token-এর ওপরে বেশি rate।
- Grok 4.5 থেকে 4.7: 200K prompt token আর তার বেশিতে $4 / $12।
- MiniMax M3: 512K input-এর ওপরে দ্বিগুণ rate।
Repo-র বেশিরভাগ প্রশ্নে পুরো tree paste করার চেয়ে ভালো agent বেছে বেছে খুঁজে পড়ে, আর সেটাই ভালো ফল দেয়। পুরো window সত্যিই লাগলে আগে /models-এ দাম দেখে নিন। আরেকটা কথা: Tokens-এ একটা request body সর্বোচ্চ 10 MB হতে পারে।
Vision আর multimodal input#
Prompt-এ screenshot, diagram, PDF বা recording দিলে আগে দেখে নিন কোন model কোন ধরনের input নেয়:
- সবচেয়ে বেশি ধরনের input: Gemini 3.8 Flash (text, image, video, audio, PDF), Qwen 3.8 Omni Flash (text, image, audio, video), MiMo V2.6 Pro (text, image, video, audio)।
- ছবি input আর ভালো coding, দুটোই: Claude Sonnet 5.5, Qwen 3.8 Max, Kimi K3, MiniMax M3, DeepSeek V4.1 Flash।
- শুধু text: GLM-5.3, DeepSeek V4 Pro, LongCat 2.0 আর Tencent Hy4 Preview। এগুলোতে ছবি পাঠালে হয় fail করবে, নয়তো উপেক্ষা করা হবে।
ছবি যায় chat message-এর ভেতরে, আপনার SDK যে format ব্যবহার করে সেটাতে। Tokens-এ image generation, audio বা file-upload endpoint নেই।
Interactive ব্যবহারের জন্য দ্রুত model#
কয়েকটা maker একই model-এর আরও দ্রুত চলা সংস্করণ বেশি দামে বিক্রি করে। Maker-দের নিজেদের প্রকাশ করা গতি:
- Kimi K2.7 Code HighSpeed: প্রায় 180 tokens/s, দাম K2.7 Code-এর দ্বিগুণ ($1.90 / $8)।
- GLM-5.3 FlashX: প্রায় 200 tokens/s, $0.37 / $1.25।
- MiMo V2.6 Pro UltraSpeed: MiMo V2.6 Pro-র চেয়ে "up to 20x faster output", $4.35 / $8.70।
- Step 3.5 Flash: 100 থেকে 350 tokens/s, $0.10 / $0.30।
Tokens একটা বাড়তি network hop যোগ করে, তাই Tokens দিয়ে প্রথম token আসতে provider-কে সরাসরি call করার চেয়ে কম সময় লাগবে না। Streaming চালু করুন ("stream": true), তাহলে লেখা তৈরি হতে হতেই দেখা যাবে। বিস্তারিত streaming-এ।
ঠিক করার আগে দুটো model চালিয়ে দেখুন#
দুটো প্রার্থী বেছে নিন, আর আপনার codebase-এর একই সত্যিকারের কাজ দুটোকে দিন। একটা করে উত্তর তুলনা করতে Dashboard-এর Playground সবচেয়ে সহজ। Agent-এর কাজের জন্য, প্রতিটা model-এ agent-কে এক session চালান, আর প্রতি token-এর দাম না দেখে usage-এ দেখুন একটা কাজ শেষ করতে মোট কত খরচ হলো। যে model-এর token-দাম বেশি কিন্তু কম turn-এ কাজ সারে, সেটাই শেষ পর্যন্ত সস্তা হতে পারে।
ঠিক করে ফেললে সেটাকে agent-এর default করে দিন: Tokens CLI setup-এর সময় default model জিজ্ঞেস করে, অথবা প্রতিটা agent-এর আলাদা guide দেখুন।
সূত্র (list price আর spec, October 2026-এ দেখা): Anthropic pricing, OpenAI pricing, Google Gemini pricing, xAI models, DeepSeek pricing, Kimi pricing, Z.ai pricing, Alibaba Model Studio pricing, MiniMax pricing, Xiaomi MiMo, StepFun pricing।