8 yuè月 3 rì日,ā阿lǐ里bā巴bā巴fā发bù布le了tā它dào到mù目qián前wéi为zhǐ止zuì最dà大de的rén人gōng工zhì智néng能mó模xíng型 Qwen3.8-Max,cān参shù数liàng量wèi为liǎng两wàn万sì四qiān千yì亿。jù据péng彭bó博shè社bào报dào道,zài在duō多xiàng项cè测shì试zhōng中,zhè这ge个mó模xíng型de的biǎo表xiàn现yǐ已jīng经jiē接jìn近měi美guó国de的lèi类sì似chǎn产pǐn品。
On 3 August Alibaba released its largest AI model to date, Qwen3.8-Max, with 2.4 trillion parameters. Bloomberg reported that on a range of tests the model already performs close to comparable American products.
3 августа Alibaba выпустила свою крупнейшую на сегодня модель искусственного интеллекта Qwen3.8-Max с 2,4 триллиона параметров. Как сообщает Bloomberg, по ряду тестов она уже близка к сопоставимым американским продуктам.
zhè这shì是sān三zhōu周nèi内dì第sān三cì次zhè这yàng样de的fā发bù布。zài在cǐ此zhī之qián前,yuè月zhī之àn暗miàn面tuī推chū出le了 Kimi K3,DeepSeek yě也gēng更xīn新le了zì自jǐ己de的mó模xíng型。zhè这sān三kuǎn款mó模xíng型dōu都yǐ以kāi开fàng放quán权zhòng重de的fāng方shì式fā发bù布。
It was the third such release in three weeks. Before it, Moonshot AI had put out Kimi K3, and DeepSeek had also updated its own model. All three were released with open weights.
Это третий подобный релиз за три недели. До него Moonshot AI представила Kimi K3, а DeepSeek тоже обновила свою модель. Все три выпущены с открытыми весами.
cān参shù数kě可yǐ以lǐ理jiě解wèi为mó模xíng型nèi内bù部yī一gè个gè个kě可yǐ以tiáo调zhěng整de的xiǎo小dān单yuán元,tā它men们de的zhí值zài在xùn训liàn练guò过chéng程zhōng中màn慢màn慢què确dìng定。cān参shù数yuè越duō多,mó模xíng型néng能jì记zhu住de的guī规lǜ律jiù就yuè越duō多,xùn训liàn练hé和shǐ使yòng用shí时xū需yào要de的suàn算lì力yě也yuè越dà大。
A parameter can be understood as one of many small adjustable units inside the model, whose value is settled gradually during training. The more parameters, the more patterns the model can remember — and the more computing power needed to train and use it.
Параметр можно понимать как один из множества маленьких настраиваемых элементов внутри модели, значение которого постепенно определяется при обучении. Чем больше параметров, тем больше закономерностей модель может запомнить и тем больше вычислительных мощностей нужно для обучения и работы.
zhēn真zhèng正yǐn引qǐ起guān关zhù注de的bú不shi是cè测shì试fēn分shù数,ér而shì是diào调yòng用mó模xíng型de的chéng成běn本。jù据duō多jiā家méi媒tǐ体bào报dào道,zhè这xiē些mó模xíng型měi每cì次diào调yòng用de的jià价gé格,míng明xiǎn显dī低yú于shuǐ水píng平chà差bu不duō多de的měi美guó国chǎn产pǐn品,yǒu有de的chā差jù距jiē接jìn近shí十bèi倍。
What really drew attention was not the test scores but the cost of calling the model. Several outlets reported that the price per call of these models is markedly lower than American products at a similar level, in some cases by close to a factor of ten.
Внимание привлекли не баллы в тестах, а стоимость обращения к модели. По сообщениям ряда изданий, цена одного запроса к этим моделям заметно ниже, чем у американских продуктов сопоставимого уровня, местами почти в десять раз.
chéng成běn本chā差bié别de的yī一bù部fen分yuán原yīn因hé和chū出kǒu口guǎn管zhì制yǒu有guān关。jìn近nián年lái来,měi美guó国xiàn限zhì制xiàng向zhōng中guó国chū出kǒu口zuì最xiān先jìn进de的rén人gōng工zhì智néng能xīn芯piàn片。zhōng中guó国de的shí实yàn验shì室hěn很nán难dé得dào到yī一yàng样qiáng强de的suàn算lì力,yú于shì是zhuǎn转xiàng向zài在jià架gòu构xiào效lǜ率shàng上xún寻zhǎo找kōng空jiān间。
Part of the cost difference has to do with export controls. In recent years the United States has restricted exports of its most advanced AI chips to China. Chinese labs struggle to obtain equally powerful computing capacity, and have turned instead to finding room in architectural efficiency.
Часть разницы в стоимости связана с экспортным контролем. В последние годы США ограничивают поставки самых передовых ИИ-чипов в Китай. Китайским лабораториям трудно получить столь же мощные вычислительные ресурсы, и они ищут резерв в эффективности архитектуры.
bèi被guǎng广fàn泛cǎi采yòng用de的bàn办fǎ法,shì是yī一zhǒng种jiào叫「hùn混hé合zhuān专jiā家」de的jià架gòu构。mó模xíng型de的cān参shù数zǒng总liàng量suī虽rán然hěn很dà大,dàn但zài在chǔ处lǐ理yí一gè个qǐng请qiú求shí时,zhǐ只yòng用dào到qí其zhōng中yī一bù部fen分,qí其yú余cān参shù数bù不cān参yù与jì计suàn算。zhè这yàng样,zǒng总liàng量hé和měi每cì次shí实jì际yòng用dào到de的liàng量jiù就fēn分kāi开le了,shǐ使yòng用de的chéng成běn本yě也suí随zhī之xià下jiàng降。
The widely adopted answer is an architecture called mixture-of-experts. The total parameter count is large, but for any single request only a portion is used, while the rest takes no part in the computation. Total size and per-request usage are thereby separated, and running costs fall.
Широко применяемое решение — архитектура под названием «смесь экспертов». Общее число параметров велико, но при обработке одного запроса используется лишь часть, а остальные в вычислении не участвуют. Общий объём и фактически задействованный на запрос объём тем самым разделяются, а стоимость работы снижается.
kāi开fàng放quán权zhòng重zhǐ指de的shì是,gōng公sī司bǎ把xùn训liàn练wán完chéng成de的cān参shù数fā发bù布chū出lái来。zhè这yàng样,shǐ使yòng用zhě者jiù就kě可yǐ以zì自jǐ己bǎ把tā它xià下zǎi载xià下lai来,zài在zì自jǐ己de的diàn电nǎo脑shàng上shǐ使yòng用。
Open weights means the company publishes the finished, trained parameters. Users can then download them themselves and run the model on their own computers.
Открытые веса означают, что компания публикует готовые, обученные параметры. Пользователь может сам скачать их и запустить модель на своём компьютере.
zhè这hé和kāi开yuán源ruǎn软jiàn件bìng并bù不yī一yàng样。fā发bù布chū出lái来de的shì是xùn训liàn练de的jiē结guǒ果,bú不shi是xùn训liàn练de的guò过chéng程:yòng用le了nǎ哪xiē些shù数jù据、yòng用le了shén什me么xùn训liàn练fāng方fǎ法,yī一bān般dōu都bù不huì会shuō说míng明。suǒ所yǐ以yè业nèi内yī一bān般shuō说「kāi开fàng放quán权zhòng重」,ér而bù不shuō说「kāi开yuán源」。
This is not the same as open-source software. What is published is the result of training, not the process: which data and which training methods were used are generally not disclosed. So the industry usually says open weights, not open source.
Это не то же самое, что открытый исходный код. Публикуется результат обучения, а не процесс: какие данные и какие методы обучения использовались, как правило, не раскрывается. Поэтому в отрасли обычно говорят «открытые веса», а не «открытый код».
bù不guò过duì对shǐ使yòng用zhě者lái来shuō说,zhè这ge个qū区bié别réng仍rán然hěn很zhòng重yào要。quán权zhòng重fā发bù布chū出lái来yǐ以hòu后,mó模xíng型kě可yǐ以fàng放zài在jī机gòu构zì自jǐ己de的fú服wù务qì器shàng上shǐ使yòng用,shù数jù据bù不yòng用lí离kāi开běn本jī机gòu构。duì对zhè这yī一diǎn点zuì最guān关xīn心de的,shì是yī医liáo疗、jīn金róng融hé和jiào教yù育jī机gòu构。
For users, though, the distinction still matters. Once the weights are published, the model can be run on an organisation's own servers, and data need not leave the institution. The ones who care about this most are healthcare, finance and education bodies.
Однако для пользователей это различие по-прежнему важно. После публикации весов модель можно запускать на собственных серверах организации, и данные не покидают учреждение. Больше всего это волнует медицинские, финансовые и образовательные организации.
xǔ许kě可tiáo条kuǎn款shì是chuán传bō播kuài快màn慢de的lìng另yī一gè个yuán原yīn因。zhè这jǐ几kuǎn款mó模xíng型yòng用de的shì是bǐ比jiào较kuān宽sōng松de的kāi开yuán源xǔ许kě可,shāng商yè业jī机gòu构kě可yǐ以zài在tā它men们de的jī基chǔ础shàng上kāi开fā发chǎn产pǐn品,bù不yòng用fù付fèi费。
Licence terms are another reason for how fast they spread. These models use relatively permissive open-source licences, so commercial organisations can build products on top of them without paying.
Условия лицензии — ещё одна причина скорости распространения. Эти модели используют сравнительно свободные открытые лицензии, поэтому коммерческие организации могут строить на их основе продукты бесплатно.
zài在zhōng中guó国,xiàng向dà大zhòng众tí提gōng供fú服wù务de的shēng生chéng成shì式rén人gōng工zhì智néng能chǎn产pǐn品,bì必xū须àn按guī规dìng定bèi备àn案。2023 nián年kāi开shǐ始shí实xíng行de的《shēng生chéng成shì式rén人gōng工zhì智néng能fú服wù务guǎn管lǐ理zàn暂xíng行bàn办fǎ法》duì对cǐ此tí提chū出le了yāo要qiú求。zhè这yě也shì是guó国nèi内chǎn产pǐn品fā发bù布shí时jiān间bǐ比jiào较jí集zhōng中de的yuán原yīn因zhī之yī一。
In China, generative AI products offered to the public must be filed with the authorities as required. The Interim Measures for the Administration of Generative AI Services, in force since 2023, set out that requirement. This is one reason domestic releases tend to cluster in time.
В Китае продукты генеративного ИИ, предоставляемые публике, обязаны пройти регистрацию согласно правилам. Такое требование установлено «Временными мерами по управлению услугами генеративного ИИ», действующими с 2023 года. Отчасти поэтому релизы внутри страны идут волнами.
zài在yǔ语yán言jiāo教xué学fāng方miàn面,zhè这yī一pī批mó模xíng型chǔ处lǐ理zhōng中wén文de的néng能lì力,bǐ比yǐ以qián前míng明xiǎn显tí提gāo高le了。bǎ把yī一duàn段wén文zì字gǎi改xiě写dào到mǒu某gè个 HSK shuǐ水píng平,huò或zhě者zhǐ指chū出xué学xí习zhě者zuò作wén文lǐ里bù不zì自rán然de的shuō说fǎ法,xiàn现zài在dōu都yǐ已jīng经néng能zuò做dào到le了。
In language teaching, this batch of models handles Chinese noticeably better than before. Rewriting a passage to a given HSK level, or pointing out unnatural phrasing in a learner's composition, is now within reach.
В преподавании языка это поколение моделей заметно лучше работает с китайским, чем прежде. Переписать отрывок под заданный уровень HSK или указать на неестественные обороты в сочинении учащегося — теперь вполне посильные задачи.
hái还yào要shuō说míng明de的shì是,cè测shì试chéng成jì绩hé和shí实jì际shǐ使yòng用de的tǐ体yàn验bìng并bù不yī一yàng样。cè测shì试fēn分shù数gāo高de的mó模xíng型,zài在xiě写dài代mǎ码zhè这lèi类rèn任wu务shàng上kě可néng能hěn很qiáng强,dàn但zài在liáo聊tiān天duì对huà话shí时què却xiǎn显de得bǐ比jiào较yìng硬、bù不gòu够zì自rán然。
It should also be said that test scores and the actual experience of using a model are not the same thing. A model with high scores may be strong at tasks like writing code, yet come across as stiff and unnatural in conversation.
Стоит также оговорить, что баллы в тестах и реальный опыт использования — не одно и то же. Модель с высокими баллами может отлично справляться с задачами вроде написания кода, но в разговоре звучать скованно и неестественно.
mù目qián前hái还bù不qīng清chu楚,zhè这yī一lún轮jià价gé格xià下jiàng降néng能bù不néng能yī一zhí直chí持xù续xià下qù去。gè各jiā家gōng公sī司zài在kāi开fàng放quán权zhòng重shàng上de的zuò做fǎ法,huì会bù不huì会suí随zhe着shāng商yè业huà化de的tuī推jìn进ér而gǎi改biàn变,tóng同yàng样hái还méi没yǒu有dá答àn案。
For now it is unclear whether this round of price declines can keep going. Whether the companies' approach to open weights will change as commercialisation advances is likewise still unanswered.
Пока неясно, сможет ли нынешнее снижение цен продолжаться. Изменится ли подход компаний к открытым весам по мере коммерциализации — тоже пока без ответа.
Discussion · 0
It’s quiet in here… suspiciously quiet. Say something 👀