Skip to content

কোন model বেছে নেবেন

কাজ দেখে model বেছে নিন: লম্বা agentic coding session, সস্তা high-volume edit, বড় context-এর repo কাজ, ছবি দেখানো, বা দ্রুত interactive ব্যবহার। সঙ্গে আছে কয়েকটা model-এর তুলনা আর Tokens-এ model id কীভাবে কাজ করে।

সর্বশেষ আপডেট 11 অক্টোবর 2026

Markdown-এ দেখুন
এই পাতায়

Model বাছাইয়ে আসল কথা হলো কাজটা কী, leaderboard নয়। এই পাতায় কাজ অনুযায়ী model ভাগ করা হয়েছে, কয়েকটা উল্লেখযোগ্য model-এর তুলনা দেওয়া হয়েছে, আর বলা হয়েছে Tokens-এ model id কীভাবে কাজ করে। যা কিছু কেনা যায় তার সবই আছে /models-এর catalog-এ। একটা key-র জন্য ঠিক কোন তালিকা, তা পাবেন GET /v1/models থেকে।

এই পাতার দাম নিয়ে

নিচের দামগুলো provider-দের নিজেদের list price, প্রতি 1M token-এর জন্য USD-তে, October 2026-এ দেখে নেওয়া। এগুলো দিয়ে model-গুলোর মধ্যে তুলনা বোঝা যায়। Tokens-এ আপনার দাম দেখুন /models-এ, সেটা এগুলোর থেকে আলাদা হতে পারে।

Tokens-এ model id#

প্রতিটা model-এর id provider/model ধাঁচের, যেমন deepseek/deepseek-v4.1-flash। প্রতিটা request-এর model field-এ আর আপনার agent-এর config-এ এই id-ই বসে।

  • Tokens-এর id একটা alias, তাই provider-এর নিজের id-র সঙ্গে সবসময় মেলে না। যেমন DeepSeek-এর API তাদের বর্তমান Flash model-কে বলে deepseek-flash। id সবসময় copy করুন /models বা API থেকে।
  • Catalog-এ Tokens যা যা দেয় সব দেখায়। আপনার key হয়তো কম model দেখবে: plan অনুযায়ী model আলাদা, আর key-তে allowed-models তালিকাও থাকতে পারে।
bash
curl -s https://tokens.bd/v1/models -H "Authorization: Bearer $TOKENS_API_KEY"

Response-এর প্রতিটা data[].id এমন একটা model, যা এই key দিয়ে এখনই call করা যায়।

কয়েকটা model-এর তুলনা#

Model (maker)Contextযে জন্য পরিচিতList price in / out
Claude Sonnet 5.5 (Anthropic)1M, 128K outAgentic coding, tool use, ছবি input$2 / $10
GPT-5.6 Sol (OpenAI)1.05M, 128K outজটিল, দীর্ঘমেয়াদি agentic কাজ$4 / $20 (promotional until at least 2026-11-21; launch price $5 / $30)
GPT-6 Luna (OpenAI)1.05M, 128K outনির্দিষ্ট, high-volume কাজ$0.10 / $0.50
Gemini 3.8 Flash (Google)1M in, 65K outদীর্ঘমেয়াদি software engineering; text, image, video, audio ও PDF input$0.75 / $3.75 until 2026-12-31, then $1.50 / $7.50
Grok 4.7 (xAI)500KCoding আর knowledge work$2 / $6 (prompts under 200K)
Kimi K3 (Moonshot AI)1Mদীর্ঘমেয়াদি coding আর গভীর reasoning; thinking সবসময় চালু$3 / $15
GLM-5.3 (Z.ai)1M, 128K outCoding আর agent; শুধু text; reasoning সবসময় চালু$1.40 / $4.40
Qwen 3.8 Max (Alibaba)1M, 131K outCoding, একসঙ্গে অনেক tool সামলানো, image ও video input$2 / $6
DeepSeek V4.1 Flash (DeepSeek)1M, 384K outদ্রুত আর সস্তা, ছবি input$0.30 / $1.20 at peak hours, half off-peak
MiniMax M3 (MiniMax)1MMultimodal coding$0.30 / $1.20 (input up to 512K)
Qwen 3.8 Flash (Alibaba)1M, 131K outসস্তা, দ্রুত coding আর agent$0.15 / $0.47
MiMo V2.6 Flash (Xiaomi)1M, 128K outকম খরচের reasoning, ছবি input$0.14 / $0.28

"যে জন্য পরিচিত" column-টা প্রতিটা maker-এর নিজেদের দাবির সারকথা। এটা কোনো benchmark result নয়।

লম্বা session-এর agentic coding-এ সেরা model#

Claude Code, Codex CLI আর OpenCode-এর মতো agent একটা কাজেই model-কে কয়েক ডজন বার call করে, আর প্রতিবার পুরো কথোপকথন আর file-এর লেখা আবার পাঠায়। তিনটা জিনিস এখানে raw intelligence score-এর চেয়ে বেশি কাজের:

  1. ভরসাযোগ্য tool calling। যে model tool-এর argument গুলিয়ে ফেলে, সে turn নষ্ট করে।
  2. Input-এর দাম, আর cached input-এর দাম। লম্বা session-এর বেশিরভাগ খরচ input token-এ। Caching করে upstream provider, আর যে model-এর cached-input দাম ঠিক করা আছে, Tokens cached input-এ সেই দামই ধরে। তবে catalog-এ এখন cached দাম দেখানো হয় না। বিস্তারিত Prompt caching-এ।
  3. টেকসই context। বেশিরভাগ নতুন flagship প্রায় 1M token দেয়।

শুরুর জন্য ভালো: Claude Sonnet 5.5, GPT-5.6 Sol, Kimi K3, GLM-5.3, Gemini 3.8 Flash আর Qwen 3.8 Max। Kimi K3 আর GLM-5.3 উত্তর দেওয়ার আগে সবসময় ভেবে নেয়। কঠিন সমস্যায় এটা কাজে দেয়, কিন্তু প্রতিটা call-এ output token বাড়ায়।

Tip

মূল agent-এর জন্য শক্তিশালী model, আর ছোটখাটো কাজের জন্য সস্তা একটা। অনেক agent-এ title, summary আর ছোট edit-এর জন্য আলাদা ছোট বা দ্রুত model ঠিক করে দেওয়া যায়। নিজের agent-এর guide দেখুন, যেমন Claude Code বা OpenCode।

High-volume edit-এর জন্য সস্তা model#

বড় refactor, commit message, classification, test-এর কাঠামো, বা যা হাজার হাজার বার চালাবেন, তাতে প্রতি token-এর দামই সিদ্ধান্ত নেয়। তুলনার table থেকে: GPT-6 Luna ($0.10 / $0.50), MiMo V2.6 Flash ($0.14 / $0.28), Qwen 3.8 Flash ($0.15 / $0.47) আর DeepSeek V4.1 Flash। Z.ai-র GLM-5.3 Flash ($0.15 / $0.50) প্রায় একই দামের, আর image, video ও file input নেয়।

GPT-6 Luna নিয়ে একটা খুঁটিনাটি: OpenAI Chat Completions-এ এর tool calling চালায় শুধু reasoning_effort none থাকলে; পুরো tool support আছে Responses API-তে। Tokens POST /v1/chat/completions আর POST /v1/responses, দুটোই সাপোর্ট করে।

পুরো repo-র কাজের জন্য বড় context-এর model#

1M token-এর window এখন সাধারণ ব্যাপার, কিন্তু সেটা ভরতে খরচ আছে। Claude Sonnet 5.5-এর list price-এ 800K token-এর একটা prompt শুধু input-এই $1.60 লাগে, আর প্রতিবার পাঠালেই লাগে। কিছু provider একটা সীমা পেরোলে বেশি দামও নেয়:

  • GPT-6 Luna আর GPT-5.6 model: 272K input token-এর ওপরে বেশি rate।
  • Grok 4.5 থেকে 4.7: 200K prompt token আর তার বেশিতে $4 / $12।
  • MiniMax M3: 512K input-এর ওপরে দ্বিগুণ rate।

Repo-র বেশিরভাগ প্রশ্নে পুরো tree paste করার চেয়ে ভালো agent বেছে বেছে খুঁজে পড়ে, আর সেটাই ভালো ফল দেয়। পুরো window সত্যিই লাগলে আগে /models-এ দাম দেখে নিন। আরেকটা কথা: Tokens-এ একটা request body সর্বোচ্চ 10 MB হতে পারে।

Vision আর multimodal input#

Prompt-এ screenshot, diagram, PDF বা recording দিলে আগে দেখে নিন কোন model কোন ধরনের input নেয়:

  • সবচেয়ে বেশি ধরনের input: Gemini 3.8 Flash (text, image, video, audio, PDF), Qwen 3.8 Omni Flash (text, image, audio, video), MiMo V2.6 Pro (text, image, video, audio)।
  • ছবি input আর ভালো coding, দুটোই: Claude Sonnet 5.5, Qwen 3.8 Max, Kimi K3, MiniMax M3, DeepSeek V4.1 Flash।
  • শুধু text: GLM-5.3, DeepSeek V4 Pro, LongCat 2.0 আর Tencent Hy4 Preview। এগুলোতে ছবি পাঠালে হয় fail করবে, নয়তো উপেক্ষা করা হবে।

ছবি যায় chat message-এর ভেতরে, আপনার SDK যে format ব্যবহার করে সেটাতে। Tokens-এ image generation, audio বা file-upload endpoint নেই।

Interactive ব্যবহারের জন্য দ্রুত model#

কয়েকটা maker একই model-এর আরও দ্রুত চলা সংস্করণ বেশি দামে বিক্রি করে। Maker-দের নিজেদের প্রকাশ করা গতি:

  • Kimi K2.7 Code HighSpeed: প্রায় 180 tokens/s, দাম K2.7 Code-এর দ্বিগুণ ($1.90 / $8)।
  • GLM-5.3 FlashX: প্রায় 200 tokens/s, $0.37 / $1.25।
  • MiMo V2.6 Pro UltraSpeed: MiMo V2.6 Pro-র চেয়ে "up to 20x faster output", $4.35 / $8.70।
  • Step 3.5 Flash: 100 থেকে 350 tokens/s, $0.10 / $0.30।

Tokens একটা বাড়তি network hop যোগ করে, তাই Tokens দিয়ে প্রথম token আসতে provider-কে সরাসরি call করার চেয়ে কম সময় লাগবে না। Streaming চালু করুন ("stream": true), তাহলে লেখা তৈরি হতে হতেই দেখা যাবে। বিস্তারিত streaming-এ।

ঠিক করার আগে দুটো model চালিয়ে দেখুন#

দুটো প্রার্থী বেছে নিন, আর আপনার codebase-এর একই সত্যিকারের কাজ দুটোকে দিন। একটা করে উত্তর তুলনা করতে Dashboard-এর Playground সবচেয়ে সহজ। Agent-এর কাজের জন্য, প্রতিটা model-এ agent-কে এক session চালান, আর প্রতি token-এর দাম না দেখে usage-এ দেখুন একটা কাজ শেষ করতে মোট কত খরচ হলো। যে model-এর token-দাম বেশি কিন্তু কম turn-এ কাজ সারে, সেটাই শেষ পর্যন্ত সস্তা হতে পারে।

ঠিক করে ফেললে সেটাকে agent-এর default করে দিন: Tokens CLI setup-এর সময় default model জিজ্ঞেস করে, অথবা প্রতিটা agent-এর আলাদা guide দেখুন।

সূত্র (list price আর spec, October 2026-এ দেখা): Anthropic pricing, OpenAI pricing, Google Gemini pricing, xAI models, DeepSeek pricing, Kimi pricing, Z.ai pricing, Alibaba Model Studio pricing, MiniMax pricing, Xiaomi MiMo, StepFun pricing।

এই পাতাটা কি কাজে লেগেছে?

এখনো আটকে আছেন? Support ticket খুলুন

আপনার agent set up করতে সাহায্য লাগবে?

Connection tester দিয়ে সংযোগ পরীক্ষা করে নিন, অথবা একটা API key তৈরি করুন।